Product
Claude Opus 5
Anthropic large language model that led the Terminal-Bench-Science v0.1 launch leaderboard at 30.0 percent.
Covered in 1 article · September 2026
Coverage
Sep 3, 2026
Scientists Built a 70-Task Benchmark for AI Agents. Its Launch Leader Solved 30%.
Terminal-Bench-Science measures agents on research workflows, not textbook questions. A vendor-run result released days later shows how quickly its baseline can move.
Sep 3, 2026 · By SCN Staff · 6 min read