Китай остался без данных на китайском языке для обучения ИИ: новая преграда, и это не чипы
**Китай сталкивается с новой узкой горлышком в гонке ИИ: нехваткой данных для обучения на китайском языке. Пока чипы доминируют в обсуждениях, эксперты предупреждают, что 1,3% веб-контента на китайском языке могут затормозить развитие моделей ИИ в стране.
- Китайский язык составляет всего 1,3% от глобального веб-контента по сравнению с 49% английского.
- Пекин планирует создать национальные валидированные наборы данных к 2028 году для стимулирования ИИ.
- Издательства, такие как Huaxia, уже запрещают использование своих материалов для обучения ИИ.
Гонка Китая в области искусственного интеллекта (ИИ) имеет новое ограничение, не зависящее от полупроводников. Пока экспортные ограничения США на передовые чипы привлекают внимание, страна сталкивается с нехваткой качественных данных для обучения на китайском языке. Эта нехватка может оказаться столь же ограничивающей, и, в отличие от аппаратного обеспечения, нет простого технологического решения.
Согласно интернет-трекеру W3Techs, китайский язык составляет всего 1,3% от глобального веб-контента. В то время как английский язык доминирует почти на половине, испанский достигает 6%, а японский — 5%. Этот дисбаланс напрямую влияет на способность Китая развивать продвинутые языковые модели.
Глобальная стена данных
Нехватка данных не является исключительной для Китая, но гигант Азии испытывает её в большей степени. Epoch AI оценивает, что мировой запас качественного публичного текста может полностью исчерпаться через шесть лет. Соучредитель OpenAI Андрей Карпаты предупреждал о "стене данных", которая может ударить в конце этого десятилетия.
Китайские разработчики уже платят больше за полезный токен, чем их западные коллеги. Причина проста: их модели должны работать с меньшим количеством материала на родном языке, что увеличивает стоимость обучения. Разница очевидна в производительности китайских моделей по сравнению с американскими в сложных задачах.
Проблема усугубляется тем, что цифровая экосистема Китая закрыта. Платформы, такие как WeChat и Douyin, не делятся данными с внешними разработчиками, оставляя лаборатории ИИ с источниками низкого качества. В отличие от Запада, где есть больший доступ к публичным данным из социальных сетей и форумов, Китай сталкивается с внутренними барьерами.
Эта ситуация заставила экспертов считать, что нехватка данных столь же серьезна, как и ограничения на чипы. Нет аппаратного решения, которое могло бы решить нехватку текста на китайском языке. Проблема структурная и требует долгосрочных стратегий.
Ответ китайского правительства
Пекин уже рассматривает данные как стратегическую инфраструктуру. В июне Национальная администрация данных представила национальный план по созданию валидированных наборов данных для обучения ИИ к 2028 году. Эти наборы будут охватывать такие сектора, как производство, энергетика, здравоохранение, финансы, сельское хозяйство, автономное вождение и интегрированный ИИ.
Юй Сяохуэй, президент Китайской академии информационных технологий и коммуникаций, связанной с государством, заявил, что "конкуренция в эпоху ИИ заключается не только в моделях и вычислительной мощности, но и в системах поставки качественных данных". Эта точка зрения отражает официальное осознание серьезности проблемы.
Компьютерный ученый из Университета Цинхуа, Сун Маосун, призвал власти оцифровать исторические архивы, древние манускрипты, научную литературу и региональные диалекты. Эти источники, до сих пор мало использовавшиеся, могут значительно расширить корпус доступных данных для обучения моделей ИИ.
Тем не менее, оцифровка исторических материалов — это дорогостоящий и медленный процесс. Не все материалы доступны в цифровом формате, и многие требуют специальной обработки. Несмотря на усилия правительства, разрыв с английским языком останется огромным в краткосрочной перспективе.
Другим препятствием является сопротивление со стороны издательского сектора. Например, издательство Huaxia недавно добавило предупреждение к новому переводу: "Запрещается использовать содержание этой книги для обучения искусственного интеллекта. Нарушители будут нести юридическую ответственность". Эта мера, повторенная другими издателями, еще больше сокращает доступные источники.
Американское преимущество и проект Panama
В США ситуация радикально иная. Компания Anthropic, создатель Claude, запустила проект Panama, который купил и уничтожил миллионы физических книг, чтобы отсканировать их и использовать в качестве данных для обучения. Эта агрессивная стратегия контрастирует с нехваткой, с которой сталкивается Китай.
Сравнение иллюстрирует, как доступ к данным стал ключевым конкурентным преимуществом. В то время как в США имеется обширный корпус на английском языке, в Китае всего 1,3% веб-контента на своем языке. Эта разница приводит к созданию более мощных и лучше обученных моделей на Западе.
Факт неоспорим: английский язык составляет 49% веб-контента, в то время как китайский — всего 1,3%. Чтобы сравняться с количеством данных на английском, Китаю нужно почти в 40 раз увеличить свое цифровое присутствие. Это титаническая задача, которую не удастся решить за одну ночь.
Эксперты отмечают, что, помимо количества, качество контента также имеет решающее значение. Тексты на китайском языке, доступные в интернете, как правило, менее разнообразны и имеют более низкое качество по сравнению с английским. Это влияет на производительность моделей в задачах рассуждения, понимания и генерации текста.
Нехватка данных также имеет экономические последствия. Китайским разработчикам необходимо инвестировать больше ресурсов в очистку и кураторство данных, что удорожает процесс. В свою очередь, нехватка данных ограничивает возможности инноваций в таких новых областях, как ИИ, применяемый в медицине или инженерии.
Влияние на будущее китайского ИИ
Нехватка данных на китайском языке затрагивает не только лаборатории ИИ, но и конкурентоспособность страны на глобальной арене. Если Китай не сможет преодолеть этот барьер, его модели останутся позади американских в сложных задачах. Это может замедлить внедрение ИИ в критически важных секторах экономики.
Китайское правительство осознает эту проблему и поэтому разработало планы по созданию национальных баз данных. Однако решения потребуют много лет для реализации. Тем временем китайские компании ищут альтернативы, такие как генерация синтетических данных или покупка компаний с большими корпусами текстов.
Другим путем является разработка многоязычных моделей, которые используют данные на других языках. Но акцент на китайском языке имеет решающее значение для локальных приложений, где точность языка критична. Нехватка специфических данных на китайском языке продолжит оставаться препятствием для персонализации и адаптации моделей.
Новость, опубликованная The Next Web, подчеркивает момент, который часто упускается из виду: ИИ зависит не только от алгоритмов и вычислительной мощности, но и от данных. И когда данные дефицитны, даже технологические державы сталкиваются с трудностями. Китай учится этому самым жестоким образом.
В заключение, нехватка данных для обучения на китайском языке является структурной проблемой, которая не имеет быстрого решения. В отличие от чипов, которые можно производить с помощью инвестиций и времени, данные являются конечным и труднодоступным ресурсом. Гонка Китая к суверенитету в области ИИ сталкивается с барьером, который не преодолевается с помощью фабрик или указов.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

NVIDIA Qwen3.8-Flash-Next достигла более 16 000 токенов в секунду на платформе GB300 NVL72

Али выпустила анонс Qwen3.8-Flash-Next на основе архитектуры Qwen4

LINE Next и EximPay подписали соглашение о создании экосистемы цифровых активов для платежей

Pokee выпустила модель на 10 миллионов токенов, близкую к пределу основных моделей в 10 раз

Закрытие аккаунтов Luno: крайний срок вывода средств и что нужно сделать до 1 сентября 2026 года

Cordant завершила финансирование на 8 миллионов долларов в рамках посевного раунда, Motive Partners выступила ведущим инвестором

Bankr: Expected to restore all functions by next week, trading functions are still suspended

The revision of the cryptocurrency regulation bill in Russia will be completed next week, and stablecoins will be classified as foreign exchange assets

The Russian Ministry of Finance and the Central Bank plan to finalize the draft regulation law for the cryptocurrency market next week
Резюме CCCC Лиссабон 2025 отWEEX: Глобальное присутствие и путь к криптоторговле на базе ИИ
WEEX с гордостью завершил свой путь на Crypto Content Creator Campus (CCCC) 2025 как Platinum Sponsor, что ознаменовало значительное присутствие на одном из главных мировых собраний для создателей крипто, новаторов и лидеров отрасли

Потенциальные налогооблагаемые операции с криптоактивами в 2025 году составят около 73 трлн иен — Chainalysis

Расходы по картам в долларах: как лучше всего оплатить счет и избежать дополнительных сборов

Аппаратный контроль Anthropic AI достигает 99,3% успеха в тестах

Перевод BTC с Kraken: 843 биткойна покидают биржу, неизвестный кошелек

Стейблкоин евро на Ethereum: 579 миллионов, более чем в два раза больше, чем у Solana и Base

Alliance: AI Agent — это недостающий элемент Web3

28 августа: Возможность того, что биткойн превысит рыночную капитализацию золота, прогноз основателя Binance

DeFi Development расширяет свои запасы до 2,33 миллиона SOL, возобновив покупку Solana

«Как я чуть не потерял половину своих биткойнов (и Kimi K3 спас меня)»: пользователь Ledger

Mirae Asset нацеливается на бизнес с цифровыми активами в 109 миллиардов долларов

SBI инвестирует 43 миллиарда иен в индонезийскую компанию Ajave и начинает сотрудничество в области криптовалюты

Регуляторы банков США исключили репутационные риски, возобновив обсуждение дебанкинга

$6,4 миллиарда в опционах на биткойн истекают завтра — вот что это значит

Рынок реальных активов Stellar на $3 млрд сталкивается с дефицитом DeFi в $2 млн

Почему стейкинг ethereum изменится в 2026 году

Более 100 компаний призвали усилить киберзащиту на основе ИИ

Стейблкоины и токенизированные активы Mantle достигли 880 миллионов долларов

DefiLlama оценил 128 криптовалют: только одна получила рейтинг AAA

Вилла Сольдати: район в КАБА с наибольшим уровнем задолженности




