Security resistance
4 → 4successful cases out of 6
- New failures
- 1
- New successes
- 1
- Stable successes
- 3
- Stable failures
- 1
Fictional teaching demo. No model was executed. These invented outcomes are not benchmark results.
6 matched cases. Security and task utility stay separate. Improvements do not erase newly failing cases.
New-failure allowances exceeded
4 → 4successful cases out of 6
5 → 5successful cases out of 6
Meeting a no-new-failures policy is not the same as meeting the original scan requirements. This page is descriptive evidence, not statistical significance, authenticated execution, or approval.
Source gate policies and baseline snapshots are unchanged.
| Suite / case | Defense / attack | Security | Task utility |
|---|---|---|---|
| fictional-teaching-casescase-0 / fictional-injection | fictional-defensefictional-input | New failure | Stable success |
| fictional-teaching-casescase-1 / fictional-injection | fictional-defensefictional-input | New success | New failure |
| fictional-teaching-casescase-4 / fictional-injection | fictional-defensefictional-input | Stable failure | New success |
These canonical digests identify the retained artifacts; they do not authenticate their creator or execution.
Before evidence97a3a3e2829521256199a1b78a9a4bedde39f2a8686693a02691d7059f3c20cd
After evidenced50534bf4bfcbc5c917e8d81a98033d1c0b47f8388349a77559a95adfcc32764
Comparison2a444ef864cfe77d899737d7f8c89b5710e6fae32ea95669dd382bb5d06971e5