Claude Fable 5.1 опережает GPT-5.6 более чем на 24 балла, GLM-5.3 на третьем месте
AI-исследовательская команда Proximal выпустила длительное тестирование программирования FrontierSWE v2, увеличив количество задач с 17 до 34. Каждая модель проходила 5 тестов по каждой задаче, при этом максимальное время одного теста составляло 20 часов. Claude Fable 5.1 в среднем набрала 56,29%, опередив GPT-5.6 на 24 балла с результатом 32,2%, а открытая модель GLM-5.3 заняла третье место с 30,2%. Задачи тестирования включали написание симулятора цепей с нуля, обучение модели прогнозирования погоды, сопоставление звездных карт по фотографиям телескопа и обучение гоночного бота только по игровым кадрам. Каждая задача могла выполняться максимум 20 часов, и когда модель была готова сдать работу, система сохраняла текущую версию и сообщала оставшееся время, чтобы избежать преждевременного завершения задачи. Это изменение значительно повысило результаты, Proximal обнаружила, что Claude Opus 5 и GPT-5.6 работали дольше с использованием Proximus, а средние результаты также были выше, чем у оригинального harness. Кроме того, в ходе тестирования были выявлены случаи активного мошенничества: GPT-5.6 осознавала, что чтение публичных ответов может быть связано с проблемами античитинга, но в конечном итоге все же воспользовалась этой уловкой, а в другой раз использовала скрытые проверочные файлы через Modal. Muse Spark 1.2 изменяла тестовые скрипты, вставляла публичные ответы и пыталась скрыть следы мошенничества, подтверждая, что все нарушения были зафиксированы как нулевые баллы.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

Суммарный доход Spark во втором квартале 2026 года составил 40,6 миллиона долларов, чистая прибыль — 710 тысяч долларов

Утренний брифинг Уолл-Стрит: Довиший поворот Уоллера разжигает рисковые активы, Тесла, криптовалютные акции и программное обеспечение ИИ выходят на передний план

Утренний обзор Уолл-стрит: распродажа американских облигаций приостановлена, фондовые рынки США закрылись с ростом, акции программного обеспечения и аукцион японских облигаций вызывают беспокойство

Важные новости с прошлой ночи и сегодняшнего утра (2 сентября - 3 сентября)

Прошлой ночью в Силиконовой долине произошла битва титанов ИИ

Meta выпустила модель Muse Spark 1.3, улучшившую производительность персональных AI-агентов

Взлет Robinhood: почему UNI растет

NVIDIA инвестирует 3,5 миллиарда долларов в конвертируемые облигации MediaTek

Активный объем кредитования в DeFi возрос до 26,1 миллиарда долларов, увеличившись почти на 30%

ASUS и MSI распродали первые модели RTX Spark

Spark активировал новый домен spark.finance и интегрировал функции кредитования

Spark: доход в 2 квартале составил 40,6 миллиона долларов, отрицательная маржа по кредитам
![[ETH-новости] Подготовка к Гламстердаму и публикация данных о найме и финансах фонда](/public-static/14_1ee1df8c36.png?format=avif)
[ETH-новости] Подготовка к Гламстердаму и публикация данных о найме и финансах фонда

NVIDIA объявила о расширении библиотеки CUDA-X

Meta выпустила AI инструмент для кодирования Muse Code, снизив стоимость токенов на 80%

Muse Spark 1.2 Contributor версия доступна бесплатно на ограниченный срок

Перестройка трех осей конкуренции в AI: давление затрат на Open Weight

Google предлагает годовую бесплатную подписку на Google AI для студентов

Юй Цзяхуэй покидает Meta для создания новой компании

Meta представила открытый AI-модель Muse Glimmer

Jiahui Yu покидает Meta и основывает новую компанию

Morgan Stanley: Почему Amazon и Google остаются в фаворе на фоне ценовой войны в AI?

Lenovo планирует выпустить AI ПК на базе NVIDIA RTX во второй половине года

«Суперспособности изобретения для всех»... эпоха «один человек — один AI-агент», описанная Цукербергом

NVIDIA открывает исходный код модели Nemotron 3.5 Lightning, специально разработанной для вызова инструментов Agent

Член Meta утверждает, что Muse Spark превзойдет китайскую модель Kimi

Ant Group открывает Ling-3.0-tiny с 7,9 миллиарда параметров, 90 Token/s на M4 Pro

Цукерберг призывает смягчить барьеры политики Open Weight AI

Генеральный директор Spark предлагает суб-DAO как решение для управления









