YBenchmark Arena
mock-first · providers off
← Models/

Claude Opus 5

anthropicv5.0.0

Evidence-backed model card, assembled from this model's runs. Strengths, weaknesses and recommendations are derived from measured scores, not asserted.

Overall score
0 runs
Context
200k
8k out
Regressions
0
vs prior version
Family
claude
Verify pricing against current Anthropic rates before budgeting a large run.

Strengths

Categories scoring 0.75 or above

No standout strengths yet.

Weaknesses

Categories scoring below 0.60

No notable weaknesses.

Recommended for

Insufficient evidence.

Avoid for

No categories to avoid.