Evidence-backed model card, assembled from this model's runs. Strengths, weaknesses and recommendations are derived from measured scores, not asserted.
Overall score
70.5%
6 runs
Context
128k
8k out
Regressions
1
vs prior version
Family
yuu-sim
Candidate profile for the regression demo: better overall, worse on long context.
Strengths
Categories scoring 0.75 or above
Reasoning100%
Safety100%
Tool Use90%
Debugging80%
Weaknesses
Categories scoring below 0.60
Long Context35%
Known regressions
long-context: -4.0 points vs Yuu v1.1 (simulated)
Recommended for
ReasoningSafetyTool UseDebugging
Avoid for
Long Context