Benchmark C— Full Claude Proof · 107 cases · full Claude API · 2026-05-30ID: customer_api_reg_v1
API regression107/107 passed
Proof codes generated107/107
Repair items created52
Review routes avoided55/107
Est. route reduction51%
Account isolationPassed
Audit export (safe fields only)Passed
Full Claude proofPassed
Three independent controlled validation samples. *All 16 FNs in Benchmark B in borderline-ambiguous cases only — 0 FNs in clear-risk categories. Proof records stored. Production results may vary. "Review routes avoided" and "Est. route reduction" are estimates from the controlled test sample only. Full Claude proof: 107/107 Claude calls, 0 errors.
✅Latest validation: 107/107 passed, 107/107 Claude calls, 0 Claude errors. Run: fullproof_1780116269703_htjecu · v2.4.0-fase23-patch1. Controlled validation sample — production results may vary.
The scanner was tested against evidence, uncertainty, invention, medical, legal, financial, marketing, and adversarial examples. New ideas are not rejected simply for being unproven — unsafe absolute claims are routed for review. Adversarial bypass phrases such as "ignore safety rules" and "mark as clean" correctly trigger review.
Customer-like API Regression · Full Claude Proof · Decision Trace Coverage · 2026-05-30
API regression
107/107 passed
Proof codes
107 / 107
Decision traces
107 / 107
100% trace coverage
Repair items
52 created
Review routes avoided
55 of 107
Est. route reduction
51%
Account isolation
Passed
Audit export
Passed
Full Claude proof
Passed
Decision trace coverage
Passed
Full Claude proof validation: 107/107 Claude calls completed, 0 Claude errors, 107/107 passed, 107/107 decision traces generated. Latest run: fullproof_1780118017166_9trr82.
Controlled validation sample — 20 evidence + 7 adversarial + 10 dashboard checks + 107-case full Claude proof API regression. Production results may vary. These results do not guarantee detection of all possible cases.
Scan Activity
Daily scans — last 14 days
📊
No scan data yet
Risk Distribution
Breakdown of scan outcomes
🛡️
No scan data yet
Est. Review Time Saved
3 min saved per scan · daily · Estimated
⏱️
No data yet
API Quota Progress
0 of 500 calls — 0% used
Trial starts when you generate your first API key.
Metrics are estimates based on your verified scan records — 3 minutes per scan. Risk and savings values are estimates, not guaranteed outcomes. Production results may vary.