Product

Claude Fable 5.1

Anthropic large language model released September 1, 2026, for which Anthropic reported a 52.6 percent Terminal-Bench-Science result in its own evaluation.

Coverage

Sep 3, 2026
AINews
Scientists Built a 70-Task Benchmark for AI Agents. Its Launch Leader Solved 30%.

Terminal-Bench-Science measures agents on research workflows, not textbook questions. A vendor-run result released days later shows how quickly its baseline can move.

Sep 3, 2026 · By SCN Staff · 6 min read