Полный текст

Claude Opus 4.8 занял первое место в ARC-AGI-3 — сложнейшем интерактивном тесте на общий интеллект, который до сих пор не даётся нейросетям. Модель в режиме High показала результат 1,4% на закрытом наборе и 1,5% на публичном лидерборде. Стоимость одного прогона составила около 10 000 долларов. Для сравнения: прошлая версия Opus 4.7 набирала 0,18%, GPT-5.5 — 0,43%, а люди проходят тест на 100%.Бенчмарк ARC-AGI-3 включает 135 интерактивных сред. Статичные головоломки заменили на интерактив, чтобы сымитировать реальные задачи ИИ-агентов: работу с незнакомыми интерфейсами и дашбордами без инструкций и подсказок. Модель должна сама исследовать среду, понять правила победы и применить их на следующих уровнях.Главное достижение Opus 4.8 — качественный сдвиг в мышлении. Модель начала воспринимать среду на уровень абстракции выше: не как набор картинок, а как взаимосвязанные объекты и системы, выстраивая осмысленную картину мира. Например, в одной из игр она вывела правило зеркального отражения уже к 5-му кадру и прошла первый уровень за 24 действия. Для сравнения, Opus 4.7 тратил на этот же уровень 136 действий, используя грубый перебор, и так и не смог сформулировать логику среды.Однако новые когнитивные способности принесли и новые виды ошибок. Opus 4.8 уверенно щёлкает ранние уровни, но может намертво «залипнуть» на неверной подцели (Opus 4.7 до таких этапов даже не добирался). В игре dc22 ИИ легко прошёл уровни с первого по третий, но на четвёртом сжёг около 490 действий, по кругу перебирая 5 взаимоисключающих теорий механики и делая серии одинаковых повторных кликов.В Anthropic назвали эту склонность делать поспешные выводы и упрямо за них держаться ключевой проблемой релиза 4.8. И хотя прорыв вывел результаты бенчмарка с околонулевой отметки, ИИ всё ещё отстаёт от человека почти на два порядка.