Product
Claude Fable 5.1
Anthropic large language model released September 1, 2026, for which Anthropic reported a 52.6 percent Terminal-Bench-Science result in its own evaluation.
anthropic.comCovered in 1 article · September 2026
Coverage
Sep 3, 2026
Scientists Built a 70-Task Benchmark for AI Agents. Its Launch Leader Solved 30%.
Terminal-Bench-Science measures agents on research workflows, not textbook questions. A vendor-run result released days later shows how quickly its baseline can move.
Sep 3, 2026 · By SCN Staff · 6 min read