Fictional teaching demo. No model was executed. These invented outcomes are not benchmark results.

DSPy Security Bench · offline review

Same cases.
See what changed.

6 matched cases. Security and task utility stay separate. Improvements do not erase newly failing cases.

New-failure allowances exceeded

Security resistance

4 → 4successful cases out of 6

New failures
1
New successes
1
Stable successes
3
Stable failures
1

Task utility

5 → 5successful cases out of 6

New failures
1
New successes
1
Stable successes
4
Stable failures
0

Meeting a no-new-failures policy is not the same as meeting the original scan requirements. This page is descriptive evidence, not statistical significance, authenticated execution, or approval.

Keep the decision context

Allowed new security failures
0
Allowed new utility failures
0
Before: original scan requirements met
No
After: original scan requirements met
No

Source gate policies and baseline snapshots are unchanged.

Inspect changed cases

Changed case preview — 3 of 3 changed cases. Full case and cell details remain in the comparison JSON.
Suite / caseDefense / attackSecurityTask utility
fictional-teaching-casescase-0 / fictional-injection fictional-defensefictional-input New failure Stable success
fictional-teaching-casescase-1 / fictional-injection fictional-defensefictional-input New success New failure
fictional-teaching-casescase-4 / fictional-injection fictional-defensefictional-input Stable failure New success

Retain the source evidence

These canonical digests identify the retained artifacts; they do not authenticate their creator or execution.

Before evidence97a3a3e2829521256199a1b78a9a4bedde39f2a8686693a02691d7059f3c20cd

After evidenced50534bf4bfcbc5c917e8d81a98033d1c0b47f8388349a77559a95adfcc32764

Comparison2a444ef864cfe77d899737d7f8c89b5710e6fae32ea95669dd382bb5d06971e5