Прошлой ночью в Силиконовой долине произошла битва титанов ИИ

By: mp.weixin.qq.com|2026/09/03 01:51:00
0
Поделиться
copy
Оценить в GoogleОценить в Google

Автор: Макс, 01 Основатель

Редактор: Макс

Прошлой ночью в Силиконовой долине произошло три крупных события.

Google выпустила Gemini 3.8 Flash, Meta представила Muse Spark 1.3, а ранее не упоминавшийся стартап Mostik был представлен в заметном интервью с WIRED.

Если мы посмотрим только на первые два события, это кажется просто еще одной обычной ночью битвы ИИ.

Google только что вывела Gemini на первое место в рейтинге DeepSWE, и через несколько часов Meta объявила о еще более высоких результатах, титул мирового лидера продержался всего несколько часов.

К 2026 году люди могут даже привыкнуть к таким событиям.

Выпуски моделей, обновления бенчмарков, празднования в X в течение нескольких часов, а затем ожидание следующей компании, которая побьет рекорд.

Однако если мы свяжем эти три события с прошлой ночи, я считаю, что действительно примечательный аспект лежит совершенно вне этих рейтингов.

Экономика ИИ претерпевает трансформацию.

В последние несколько лет, обсуждая затраты на ИИ, самой распространенной цифрой, на которую мы смотрели, было то, сколько стоит миллион токенов.

Но с появлением Агентов это измерение становится все более неадекватным.

Настоящие вопросы в будущем могут быть не "сколько стоит миллион токенов", а сколько стоит исправить ошибку, завершить исследовательскую задачу или заставить Агента работать непрерывно в течение трех часов.

Прошлой ночью затраты на вывод одновременно снижались с нескольких совершенно разных направлений.

Google встраивает передовые возможности в модели, которые становятся все дешевле, Meta позволяет Агентам выполнять те же задачи с меньшим количеством токенов и вызовов инструментов, а Mostik делает шаг дальше, задавая вопрос:

Если обе стороны в общении являются ИИ, почему модели все еще должны общаться на языках, предназначенных для людей?

ЧАСТЬ 01, Ответ Gemini

Сначала давайте посмотрим на Google.

Google выпустила свою совершенно новую флагманскую модель, Gemini 3.8 Flash, которую они утверждают, что это их самая мощная модель для рассуждений и кодирования на сегодняшний день.

Это также третье обновление серии Flash за шесть недель, с 3.6 до 3.7, а теперь до 3.8.

Ранее Flash воспринимался как очень простой: быстрее, дешевле, но с возможностями, слегка уступающими самым сильным моделям.

Google постепенно меняет это определение.

На этот раз основные улучшения 3.8 Flash сосредоточены на долгосрочном кодировании и агентских рабочих процессах.

На DeepSWE v1.1, который измеряет долгосрочные возможности программной инженерии ИИ, он достиг около 74%.

Самая большая разница между DeepSWE и традиционными бенчмарками кода заключается в том, что он не просто бросает алгоритмический вопрос модели; он фактически помещает Агента в репозиторий кода.

Модель должна понять проблему, искать код, изменять файлы, вызывать инструменты, проводить тесты и продолжать искать причины после неудач.

Полная задача может включать десятки или даже сотни шагов.

В таких тестах Gemini 3.8 Flash однажды достигла мирового номера один.

Claude Opus 5 также набрал около 74%, GPT-5.6 Sol около 73%, а ранее ведущий Fable 5 около 70%.

Если мы смотрим только на возможности, между этими топовыми моделями нет значительного разрыва.

Что действительно настораживает, так это другая цифра: деньги.

Цена запуска API для Gemini 3.8 Flash остается на уровне $0.75 за 1M токенов для ввода и $3.75 за 1M токенов для вывода.

Завершение полной задачи на DeepSWE стоит в среднем всего $2.36.

Для сравнения, Claude Opus 5, который также набрал около 74%, имеет среднюю стоимость $11.84 за задачу; GPT-5.6 Sol, около 73%, также стоит около $6.46 в среднем.

Это означает, что для того же уровня возможностей программной инженерии затраты на выполнение могут различаться в несколько раз.

Это станет очень важным в эпоху Агентов.

В эпоху чат-ботов, стоит ли ответ на несколько центов больше или меньше, едва ли заметно для обычных пользователей.

Но Агенты совершенно иные; кодирующий агент может выполнять 100 шагов подряд, исследовательский агент может просматривать десятки веб-страниц и читать сотни страниц материалов, а в будущем Агенты в компаниях могут даже работать непрерывно в течение нескольких часов.

Google даже упомянула, что 3.8 Flash будет активно "работать усерднее", когда столкнется со сложными задачами, выполняя больше рассуждений и вызовов инструментов.

Google не уменьшила "мышление" модели, чтобы сэкономить деньги; скорее, поскольку токены уже достаточно дешевы, она может позволить себе запускать более длинные циклы.

Поэтому я считаю, что действительно важный аспект 3.8 Flash не в том, что она снова заняла первое место в мире.

Скорее, это продвижение возможностей, которые ранее были доступны только в самых дорогих передовых моделях, в ценовой диапазон Flash.

ЧАСТЬ 02, Ответ Meta через три с половиной часа

Пока Google праздновала выпуск Gemini 3.8 Flash, Meta внезапно сделала камбэк.

Meta неожиданно выпустила модель Muse Spark 1.3.

Согласно опубликованной оценке Meta, Muse Spark 1.3 достигла 75.4% на DeepSWE v1.1.

Эта цифра превосходит Gemini 3.8 Flash, Claude Opus 5 и GPT-5.6 Sol.

Еще более удивительно, что Muse Spark 1.2 набрала всего около 55% в этом тесте.

С 1.2 до 1.3, незначительное обновление версии напрямую улучшило результат на около 20 процентных пунктов.

Однако я считаю, что действительно примечательный аспект Meta на этот раз не только 75.4%.

Есть еще два других числа: вызовы инструментов уменьшились примерно на 20%, а потребление токенов уменьшилось примерно на 25%.

Этот момент легко упустить, но он очень близок к самому важному вопросу после истинной коммерциализации Агентов.

Одним из самых расточительных аспектов Агента часто является не нормальное рассуждение, а отклонение от курса.

Например, если кодирующий агент неправильно понимает требования на шаге 20, он может продолжать изменять пять файлов, проводить три раунда тестов и искать большое количество кода, только чтобы позже понять, что он был на неправильном пути и должен начать заново.

Десятки вызовов инструментов и тысячи токенов могут быть потрачены впустую таким образом.

Поэтому, если модель может раньше обнаружить неоднозначности в задачах, знать, когда она не может продолжать, и задавать вопросы пользователю раньше, это эффективно снижает затраты.

Многие из возможностей, укрепленных в Muse Spark 1.3, принадлежат этой категории: она может поддерживать несколько рабочих процессов одновременно в длинных потоках, проактивно задавать вопросы при столкновении с неоднозначными задачами, запрашивать помощь для неразрешимых проблем, подтверждать перед необратимыми действиями и менее вероятно забывать начальные ограничения после выполнения многих раундов долгих задач.

Meta даже начала подчеркивать осознание модели своих собственных возможностей: знание того, что она может делать, а что не может.

Эти возможности могут не казаться столь привлекательными, как увеличение бенчмарка на 20 пунктов в эпоху чат-ботов, но в эпоху Агентов они могут напрямую переводиться в деньги.

Каждый раз, когда Агент избегает ошибки, это оптимизация рассуждений.

Поэтому, рассматривая Google и Meta вместе, метрики конкуренции среди крупных моделей тихо меняются.

В будущем людям может быть менее важно "сколько стоит миллион токенов" и больше важно другое число:

Сколько стоит выполнить реальную задачу от начала до конца?

ЧАСТЬ 03, Mostik, разрушительный прорыв

Если Google и Meta все еще изучают, как завершить задачи с более дешевыми и меньшими токенами, Mostik начинает решать более фундаментальный вопрос:

Почему эти токены вообще должны существовать?

Mostik означает "мост" на русском.

Генеральный директор Саша Малышева является главным разработчиком этого подхода, а его главный ученый - Станислав Смирнов, профессор Женевского университета и лауреат медали Филдса в 2010 году.

Они пытаются сделать то, что звучит просто, но на самом деле крайне сложно: позволить двум моделям ИИ общаться без использования естественного языка.

Сегодня подавляющее большинство многопользовательских систем работают следующим образом:

Модель A получает некоторую информацию, генерирует сотни или даже тысячи токенов и выражает свои выводы на естественном языке; затем Модель B читает весь этот текст, переосмысляет его и строит свое внутреннее представление, прежде чем продолжить рассуждение.

Но проблема в том, что то, что действительно вычисляется внутри больших моделей, - это не китайский или английский, а:

Высокомерные непрерывные математические представления.

Это похоже на две компьютера, которые могут напрямую передавать данные, но Компьютер A сначала распечатывает файл на сотни страниц, а затем Компьютер B использует камеру, чтобы распознать текст постранично.

В прошлом все изучали, как снизить затраты на печать, в то время как Mostik хочет просто выбросить принтер.

Они пытаются построить мост между внутренними представлениями различных моделей, позволяя моделям обмениваться скрытыми представлениями напрямую, а не генерируя сначала естественный язык.

Интересный эксперимент, раскрытый авторитетными СМИ Силиконовой долины WIRED, включает Mostik, который соединяет полную версию GLM-5.2 753B с Qwen 3.5, который имеет всего 4B и может работать на мобильных устройствах.

В результате гибридная система имеет возможности, которые находятся между двумя моделями, но затраты на вывод составляют всего 1/20 от полной версии GLM-5.2.

Конечно, еще рано говорить о том, что Mostik решил проблему коммуникации моделей.

Скрытая коммуникация сама по себе не является новой концепцией; в последние годы было много исследований, пытающихся обмениваться встраиваниями, скрытыми состояниями, кешами KV и другими внутренними представлениями.

Настоящая проблема заключается в том, что разные модели имеют разные архитектуры, параметры, обучающие данные и внутренние системы координат. Как заставить две модели действительно понять скрытое пространство друг друга - это сама по себе очень сложная задача.

Смирнов сам признает, что в настоящее время не хватает зрелого математического языка для описания общих представлений между различными моделями.

Но цифра 1/20 все равно меня волнует.

Потому что она заставляет меня серьезно задуматься о совершенно другой архитектуре ИИ в будущем.

ЧАСТЬ 04: В будущем вам нужна только модель 0.xB

В последние два года обсуждения пограничного ИИ мы исследовали, как вписать более крупные модели в мобильные телефоны: 7B, 4B, 3B, 1B, постоянно дистиллируя, квантируя и сжимая.

Но если путь Mostik действительно сработает в конечном итоге, я думаю, что будущие телефоны могут вообще не нуждаться в "универсальной" большой модели.

Ваше устройство может потребовать только запуска небольшой модели 0.xB или нескольких B.

Это будет дешево, способно работать непрерывно, отвечая за понимание того, в каком приложении вы находитесь, что вы только что сделали, состояние устройства и выполнение подавляющего большинства простых, высокочастотных задач.

Когда возникают действительно сложные проблемы, оно может вызвать удаленную большую модель через скрытую коммуникацию.

Но ключевое отличие в том, что оно не должно отправлять весь контекст ста тысяч токенов обратно в облако, как сегодня, позволяя удаленной модели читать все с нуля.

Ему может понадобиться только передать сильно сжатое скрытое состояние.

После того как удаленная большая модель завершит сложное рассуждение, ей не обязательно генерировать тысячи токенов естественных языковых объяснений для локальной модели, но она может напрямую вернуть новые внутренние представления.

Таким образом, локальная небольшая модель отвечает за высокочастотную, низкозатратную, непрерывную работу, в то время как облачная передовая модель обрабатывает низкочастотные, но действительно сложные рассуждения, с некоторым мостом, обеспечивающим эффективную коммуникацию между ними.

Если это действительно удастся достичь в будущем, снижение затрат на вывод может быть гораздо больше, чем просто снижение текущих цен API на 30% или 50%.

Это может изменить способ организации вычислений ИИ.

ЧАСТЬ 05: Заключение

Итак, оглядываясь на прошлую ночь, на поверхности было три совершенно разных новости.

Google выпустила Gemini 3.8 Flash, сжимая передовые возможности в ценовой диапазон Flash;

Meta выпустила Muse Spark 1.3, позволяя агентам достигать большего с меньшим количеством токенов и вызовов инструментов;

Mostik сделала шаг дальше, пытаясь устранить необходимость в некоторых токенах, которые должны генерироваться между моделями с самого начала.

Все они указывают на одно и то же изменение:

Интеллект становится дешевле с поразительной скоростью.

И это снижение цен больше не касается только единичной цены API.

Стоимость моделей снижается, объем вычислений, необходимых для выполнения задач, уменьшается, и теперь даже способ, которым модели обмениваются информацией, пересматривается.

Влияние, которое это может в конечном итоге оказать, может быть гораздо больше, чем просто несколько процентных пунктов увеличения в бенчмарках.

Потому что многие технологии действительно взрываются не тогда, когда они "впервые становятся пригодными для использования", а когда они становятся "достаточно дешевыми для повседневного использования".

Сегодня, если агент тратит десятки долларов на выполнение задачи для обычного человека, это может быть вовсе не рентабельно.

Если в будущем это будет стоить всего несколько центов, многие приложения, которые сейчас кажутся совершенно непрактичными, могут внезапно стать жизнеспособными.

Сегодня мы не можем иметь десятки агентов, работающих вокруг человека 24 часа в сутки; если затраты на вывод снизятся на один или два порядка, это может стать нормой.

Сейчас семь часов утра, и мне следовало лечь спать несколько часов назад.

Но после выпуска Gemini Meta последовала через несколько часов, а затем я увидел эксперимент Mostik 1/20.

Я лежал в постели, размышляя об этих вещах, о модели 0.xB в моем телефоне, о большой модели в облаке и о том, как они, возможно, даже не будут нуждаться в общении на естественном языке.

Чем больше я об этом думал, тем труднее мне было уснуть, поэтому я встал и закончил писать эту статью.

74% Gemini, 75.4% Muse, и через несколько дней могут появиться новые цифры, которые затмят их.

Но мне действительно трудно успокоить это волнение.

Потому что по сравнению с тем, кто снова занял мировое лидерство, я все больше беспокоюсь о другом вопросе:

Насколько дешевым может стать такой умный ИИ в конечном итоге?

Как только мощный интеллект станет достаточно дешевым, чтобы его можно было вызывать по желанию, я верю, что многие ИИ-продукты, которые сегодня кажутся очень безумными, могут только начинать.

Цена --

--
--
--

Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.

Вам также может понравиться

Содержание

Свежие статьи

Еще

Свежие листинги на WEEX

iconiconiconiconiconiconiconiconicon
Служба поддержки:@weikecs
Деловое сотрудничество:@weikecs
Количественная торговля и ММ:bd@weex.com
VIP-программа:support@weex.com