Google создает WikiSkill, чтобы агенты ИИ запоминали свои ошибки и улучшались
**Исследователи Google Research представили WikiSkill, фреймворк, который сохраняет ошибки и успехи агентов ИИ в постоянной вики для создания лучших инструкций в будущих запусках. Испытания показывают значительные успехи в математике, электронных таблицах и интерактивных средах, хотя система все еще не представляет собой строгое непрерывное обучение.
- WikiSkill разделяет трассировки выполнения, накопленные знания и активные инструкции на три уровня.**
- Фреймворк повысил средний результат Gemini 3.5 Flash с 49,5% до 68,1%, а Qwen-3.6-27B с 39,4% до 63,3%.
- Большие модели лучше используют эволюционировавшие навыки, в то время как маленькие могут закрыть часть разрыва.
Внешняя память для агентов, которые забывают
Исследователи Google Research представили WikiSkill как фреймворк, предназначенный для решения повторяющейся проблемы агентов искусственного интеллекта: каждое выполнение заканчивается, и большая часть полученного опыта исчезает. Вместо того чтобы изменять параметры модели после каждой задачи, система собирает информацию о сбоях, успехах и полезных стратегиях в структуре, похожей на совместную энциклопедию. Затем агент обращается к этому материалу, чтобы действовать с лучшими инструкциями в следующий раз.
Предложение не подразумевает, что модель учится непрерывно в традиционном смысле. Модель сохраняет свое первоначальное обучение, но генерирует более точные инструкции для себя на основе зарегистрированного опыта, что является менее элегантным решением, чем постоянное обучение и потенциально уязвимым к накопленным ошибкам. Тем не менее, результаты исследования показывают, что эта внешняя память может значительно улучшить производительность в задачах, требующих нескольких шагов и координированного использования инструментов.
Концепция исходит из перспективы, приписываемой Андрею Карпаты, о некой вики для языковых моделей, где опыт агентов превращается в постоянные и накопительные знания. WikiSkill переносит эту идею на автоматическое развитие навыков, с процессом, который пытается превратить предыдущие выполнения в повторно используемые процедуры, не затрагивая поведение, изученное во время обучения. Это различие имеет значение, поскольку позволяет тестировать изменения поведения без полной перенастройки модели.
Работа была оценена по пяти типам тестов: математическое рассуждение, веб-поиск, манипуляция электронными таблицами, вопросы и ответы по документам и интерактивные задачи в виртуальной среде. Исследователи использовали Qwen в версиях с 4 миллиардами, 9 миллиардами и 27 миллиардами параметров, а также Gemma-4-31B и Gemini-3.5-Flash. Эта комбинация позволила наблюдать, как накопленная память работает в моделях с различными возможностями и перед задачами с очень разными требованиями.
Три уровня и цикл улучшения
WikiSkill организует рабочее пространство на трех уровнях, которые выполняют отдельные функции. Raw Layer сохраняет полные трассировки каждого выполнения, включая вызовы инструментов, полученные ответы и шаги, предпринятые агентом; эти записи неизменяемы и служат сырьем для анализа поведения. Над ней находится Wiki Layer, где опыт превращается в структурированные выводы, такие как паттерны сбоев, операционные рекомендации и стратегии, которые принесли положительные результаты.
Wiki Layer не перезапускается после выполнения задачи, а растет с каждой итерацией, согласно описанию исследователей. Эта непрерывность позволяет последующему выполнению обращаться к ранее выявленным проблемам, даже если стратегия, вызвавшая их, больше не активна. Третий уровень, называемый Skill Layer, содержит процедурные инструкции, которые агент использует во время выполнения, и функционирует как изменяемая часть системы.
Цикл начинается, когда агент вывода завершает задачу с доступными навыками и создает новый след. Затем Wiki Maintainer проверяет эти записи, чтобы определить, что пошло не так и какие решения помогли, в то время как Skill Proposer использует накопленные выводы, чтобы предложить конкретные изменения в активных инструкциях. Таким образом, архитектура разделяет наблюдение за фактами, интерпретацию опыта и применение нового поведения.
Перед тем как принять модификацию, механизм валидации или gating тестирует ее на независимом наборе задач. Если изменение улучшает результаты, оно может быть включено в Skill Layer; если оно ухудшает производительность, оно отменяется без удаления информации, которая вызвала предложение. Даже неудачное обновление сохраняет полезность, потому что в вики фиксируется, что было попытано и почему это не сработало, так что система может избежать повторения того же пути или разработать альтернативу в последующих раундах.
Неравномерные результаты в зависимости от модели и задачи
Исследование сообщило об улучшениях WikiSkill по сравнению с агентами без дополнительных навыков. В среднем, Gemini-3.5-Flash повысился с 49,5% без навыков до 68,1% с WikiSkill, в то время как Qwen-3.6-27B продвинулся с 39,4% до 63,3%. Эти цифры соответствуют среднему значению пяти бенчмарков и были рассчитаны на основе трех независимых выполнений, согласно таблице, включенной в работу.
При наблюдении за отдельными задачами различия становятся еще более заметными. Gemini-3.5-Flash поднялся с 33,0% до 72,6% в LiveMath и с 50,5% до 76,6% в SpreadSheet, двух сценариях, где накопленные инструкции, похоже, имеют наибольшее влияние. В случае Qwen-3.6-27B, WikiSkill достиг 61,9% в LiveMath и 81,7% в SpreadSheet, по сравнению с 33,9% и 40,8% соответственно, когда модель работала без навыков.
Прибыль не была равномерной во всех областях. Математические задачи и работа с таблицами показали самые большие скачки, в то время как OfficeQA, который требует ответов на вопросы о документах и управления длинными контекстами, продемонстрировал более ограниченные успехи в различных конфигурациях. Например, в Gemini-3.5-Flash, оценка OfficeQA повысилась с 48,6% до 60,7%, что является значительным улучшением, хотя и меньшим, чем наблюдаемое в LiveMath и SpreadSheet.
Размер модели также повлиял на способность использовать эволюционировавшие навыки. Исследователи отметили, что Qwen-3.5-4B испытывал трудности с надежным выполнением многошаговых стратегий поиска, когда ему нужно было поддерживать их через обширные контексты, поэтому он часто возвращался к своему предустановленному поведению. Тем не менее, небольшая модель, оснащенная WikiSkill, может сопоставить производительность более крупной модели, не использующей эту структуру, что открывает возможный путь для повышения полезности систем с меньшими ресурсами.
Передача навыков и ожидаемые ограничения
Еще одно наблюдение исследования заключается в том, что навыки, созданные одной моделью, могут быть переданы другой и, в некоторых случаях, работать лучше, чем инструкции, которые модель-получатель разработала самостоятельно. Эта возможность указывает на общий репозиторий процедур, где полезный навык для решения задач с таблицами или навигации по вебу может быть повторно использован различными агентами. Тем не менее, результаты не гарантируют, что передача будет полезной во всех случаях, поэтому исследователи предлагают проверять ее индивидуально.
Передача данных требует осторожности, поскольку инструкция, которая работает в одной модели, может зависеть от ее возможностей, стиля рассуждения или способа взаимодействия с инструментами. Более мелкий агент может неполно интерпретировать стратегию, разработанную для более крупной системы, особенно когда задача требует поддержания множества шагов в контексте. Механизм валидации предлагает барьер против этого риска, но не исключает необходимости оценивать каждую способность в среде, где она будет использоваться.
WikiSkill также выявляет основное различие между памятью и обучением. Вики сохраняет информацию, а Skill Proposer генерирует новые инструкции, но параметры модели остаются неизменными; поэтому система не приобретает постоянное внутреннее понимание так, как это сделало бы в процессе непрерывного обучения. Решение может улучшить наблюдаемое поведение, хотя неверное заключение, неполная запись или ошибочная интерпретация могут быть включены в базу знаний и повлиять на будущие решения.
Дизайн слоев пытается решить эту проблему, сохраняя оригинальные следы, выводы и активные навыки отдельно. Возможность отмены обновления защищает немедленное выполнение, в то время как сохранение неудачных попыток предотвращает потерю полезной информации для последующего анализа. В целом, подход показывает, как разработчики могут создавать агентов с накопленной операционной историей, не утверждая, что они решили задачу непрерывного обучения, которая все еще остается открытой.
Результаты предполагают, что внешняя память может стать важным элементом для агентов, работающих повторно над одними и теми же типами задач. WikiSkill не устраняет ограничения моделей и не гарантирует, что каждый опыт приведет к улучшению, но предлагает систематическую процедуру для наблюдения за ошибками, документирования стратегий, тестирования изменений и сохранения полученных уроков. Основное обещание рамки заключается в преобразовании забвения между выполнениями в постепенный процесс контролируемой доработки.
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

Кибератака в Манчестере: 8,7 миллиона путешественников стали жертвами бесплатного Wi-Fi в аэропортах

Ethena perpetual equity contracts: Ethena ищет новую доходность для USDe в бессрочных контрактах на акции

Криптовалютные платформы потеряли $3,63 млрд из-за кибератак

Полиция Великобритании изъяла 1,4 миллиона долларов, связанных с деятельностью на даркнет-рынках

Lambda привлекает 1 миллиард долларов в долг для покупки чипов Nvidia

Китайские автопроизводители делают ставку на гуманоидных роботов как новый источник прибыли

Размышления основателя: Почему Fomo пробежал дальше нас с той же стартовой точки?

Токен GOLD обрушился на 99% после поста, связанного с Трампом, сбросив $1 млн

Hyperliquid получает первый DEX с результатом HIP-4 с OUT

Обратная сторона bStocks: конкуренция за ценовую власть с Perp вместо того, чтобы быть лучшим Nasdaq

XRP ETF получают популярность в двух поданных заявках в США

RWA: CZ хочет, чтобы государства токенизировали всё для привлечения иностранных капиталов

Доллар, ставки и инфляция: почему сентябрь может стать ключевым месяцем в этой гонке

Кредиты: запускается новая система списания с дебетовых счетов, но банки ожидают низкое использование

Продажи NFT упали на 44,7% до 63,3 миллиона долларов, несмотря на лидерство Ethereum

Polygon Labs выпустила срочное уведомление об обновлении клиентов после хардфорков Austin и Kyoto

Автопроизводители становятся незаменимыми во второй половине воплощенного интеллекта

Блокчейн: Mastercard раскрывает, что на самом деле требуют банки

Следите за деньгами: $2 млрд для Strategy, инкубатор YZi Labs и доминирование DeFi
![[Колонка] Доллар на блокчейне, юань на золоте... Война валютных гегемоний изменилась](/public-static/26_2e1840f602.png?format=avif)
[Колонка] Доллар на блокчейне, юань на золоте... Война валютных гегемоний изменилась

Charles Schwab добавляет Solana, Avalanche и Chainlink в свое крипто-предложение

Что означает новая позиция ФРС для Bitcoin и криптовалют? Подробный анализ

Криптовалюта в Бразилии: законы, налоги, как купить и как найти лучшие курсы обмена

Крипто-VC финансирование: RQD* привлекает 74 миллиона долларов, Fasset получает 68 миллионов долларов

Беседа с основателем Epoch Ventures: начался массовый оборот капитала, четырехлетний цикл завершен

FWA сделка на 17 000 ETH продолжилась даже после окончания вознаграждений

Cardone Capital добавляет 1,200 BTC с помощью арендного дохода

SEC предлагает освободить фьючерсы на долговые обязательства ЕС от американских правил

ОПЕК: Венесуэла обсуждает выход с США, спустя 5 месяцев после Эмиратов

