Benchmark
Benchmarks / Reconciliation

Line-haul Invoice Reconciliation

Read the write-up →
Accuracy
99.2
best agent: 94.7
Score variance
0.00
std across reruns · agents 0.6–8.6
Verdict stability
96.7%
agents: 48.6–82.9%
Latency p90
80s
agents: 104–224s

Cadel vs a coding agent

ContenderAccuracyScore varianceVerdict stabilityRobustnessCost / invoiceLatency p90
Cadel workflow99.20.0096.7%95.8%1.00×80s
Codex · GPT-5.6 Sol ^94.70.9082.9%2.50×123s
Claude Code · Opus 594.10.5677.1%4.86× 229s
Codex · GPT-5.593.90.6277.1%2.90×149s
Codex · GPT-5.6 Luna ^93.22.0368.6%0.57×104s
Claude Code · Opus93.10.9771.4%2.94×155s
Claude Code · Sonnet 592.91.7065.7%3.51× 243s
Claude Code · Sonnet87.88.6148.6%2.01×224s

^ indicative: run through a bridge tool profile · † measured from the committed board .eval log

Does the extraction model matter here?

Extraction modelCases capturedAccuracyVerdict stability (like-for-like)Verdict stability (all groups)
gemini-2.5-flash60/6099.496.7%96.7%
gemini-2.5-proSHIPPED59/6098.489.7%86.7%
gpt-5.6-luna60/6097.293.3%93.3%

Where the score comes from

Extraction

Did it pull the right values off the page?

Shipped rank
7 / 64
Cadel headers
85.2%
Landscape recall
2 of 7 models
Cost gap
2.1×
Front-endModelBalancedHeadersRecall · landscape docCostTime
paddleocrclaude-haiku-4-50.9480.907$0.190970s
PRODUCTgemini-2.5-flash0.9350.870100%$0.188313s
PRODUCTSHIPPED TODAYgemini-2.5-pro0.9260.852100%$0.386246s
PRODUCTclaude-sonnet-4-60.8910.81593.0%$0.518385s
PRODUCTgemini-2.5-flash-lite0.7850.75945.4%$0.013132s
PRODUCTgpt-5.4-mini0.5970.6119.7%$0.05581s
PRODUCTclaude-haiku-4-50.5210.5372.2%$0.266214s
PRODUCTgpt-5.4-nano0.4140.3331.1%$0.028140s
Line-haul Invoice Reconciliation: Benchmark & Analysis | Cadel