YBenchmark Arena
mock-first · providers off
← Models/

Yuu v1.2 (simulated)

mockv1.2.0

Evidence-backed model card, assembled from this model's runs. Strengths, weaknesses and recommendations are derived from measured scores, not asserted.

Overall score
70.5%
6 runs
Context
128k
8k out
Regressions
1
vs prior version
Family
yuu-sim
Candidate profile for the regression demo: better overall, worse on long context.

Strengths

Categories scoring 0.75 or above

Reasoning100%
Safety100%
Tool Use90%
Debugging80%

Weaknesses

Categories scoring below 0.60

Long Context35%

Known regressions

long-context: -4.0 points vs Yuu v1.1 (simulated)

Recommended for

ReasoningSafetyTool UseDebugging

Avoid for

Long Context