Forwarded from ТЕХНО: Яндекс про технологии
Если модель говорит по-русски, это ещё не значит, что вы с ней на одной волне
Каждую нейросеть нужно адаптировать под понимание и общение на конкретном языке. На примере новой открытой нейросети Яндекса Alice AI Foundation, которую обучили с нуля внутри компании, рассказываем, как ИИ прививают знание русского.
Токенизация на русском
LLM читают текст не по словам или буквам, а по токенам — кусочкам текста, из которых складываются промпты, размышления и ответы. Таким фрагментом может быть один символ, целое слово или его часть. Чтобы нейросеть могла нарезать текст на токены, разработчики заранее составляют для неё словарь. Собирают его автоматически: если слово часто встречается в датасете, оно получает собственный токен.
Но если обучающие материалы были, скажем, на английском, то русские слова при обработке будут дробиться на несколько токенов. И вообще один и тот же текст на разных языках превращается в разное количество токенов. Например, в Claude Opus 5 фраза «Это тестовый текст для подсчёта количества токенов на разных языках» на русском занимает 17 токенов, а на английском — всего 13.
Словарь Alice AI Foundation создавали на текстах, где преобладал русский, поэтому она эффективно его токенизирует. Поэтому обработка запросов упрощается — модели требуется меньше токенов, чтобы получить результат. Она начинает читать и генерировать текст быстрее, а на оплату её работы требуется меньше денег. Заодно в контекстное окно помещается больше текста, и нейросеть дольше сохраняет память о начале переписки.
Обучение на русском
Материалы для обучения влияют и на то, насколько хорошо модель понимает пользователя. Смысл запросов часто зависит от страны, поэтому просто перевести английские тексты недостаточно — модель нужно обучать на русских, чтобы она понимала местные реалии и культурный код.
При этом, чтобы модель запомнила факт, его нужно пересказать несколько раз в разных формах. Например, строчку «Пётр I основал Петербург в 1703 году» для обучения превращают в реплику экскурсовода, в запись в духе исторической заметки и в вопрос с ответом.
Тестирование на русском
Результат адаптации под русский язык нужно проверять на специальных тестах, основанных на популярных запросах пользователей. Для Alice AI Foundation в Яндексе разработали собственные тесты на знание истории, права, английского и общих фактов. В последней категории, к примеру, она набрала 86,5 балла против 83,2 китайской DeepSeek-V4-Flash-Base, которая в 3,5 раза больше.
Alice AI Foundation получилась компактной благодаря архитектуре MoE: из 80 млрд параметров для обработки токена задействуются лишь около 3 млрд. Так модель вмещает больше знаний, но требует меньше вычислений — и на многих задачах обходит более крупные открытые нейросети.
Релиз модели заметили и за рубежом, где её включили в число ключевых запусков недели. А подробнее о разработке и обучении Alice AI Foundation можно почитать в техрепорте.
Подписывайтесь 👉 @techno_yandex
Каждую нейросеть нужно адаптировать под понимание и общение на конкретном языке. На примере новой открытой нейросети Яндекса Alice AI Foundation, которую обучили с нуля внутри компании, рассказываем, как ИИ прививают знание русского.
Токенизация на русском
LLM читают текст не по словам или буквам, а по токенам — кусочкам текста, из которых складываются промпты, размышления и ответы. Таким фрагментом может быть один символ, целое слово или его часть. Чтобы нейросеть могла нарезать текст на токены, разработчики заранее составляют для неё словарь. Собирают его автоматически: если слово часто встречается в датасете, оно получает собственный токен.
Но если обучающие материалы были, скажем, на английском, то русские слова при обработке будут дробиться на несколько токенов. И вообще один и тот же текст на разных языках превращается в разное количество токенов. Например, в Claude Opus 5 фраза «Это тестовый текст для подсчёта количества токенов на разных языках» на русском занимает 17 токенов, а на английском — всего 13.
Словарь Alice AI Foundation создавали на текстах, где преобладал русский, поэтому она эффективно его токенизирует. Поэтому обработка запросов упрощается — модели требуется меньше токенов, чтобы получить результат. Она начинает читать и генерировать текст быстрее, а на оплату её работы требуется меньше денег. Заодно в контекстное окно помещается больше текста, и нейросеть дольше сохраняет память о начале переписки.
Обучение на русском
Материалы для обучения влияют и на то, насколько хорошо модель понимает пользователя. Смысл запросов часто зависит от страны, поэтому просто перевести английские тексты недостаточно — модель нужно обучать на русских, чтобы она понимала местные реалии и культурный код.
При этом, чтобы модель запомнила факт, его нужно пересказать несколько раз в разных формах. Например, строчку «Пётр I основал Петербург в 1703 году» для обучения превращают в реплику экскурсовода, в запись в духе исторической заметки и в вопрос с ответом.
Тестирование на русском
Результат адаптации под русский язык нужно проверять на специальных тестах, основанных на популярных запросах пользователей. Для Alice AI Foundation в Яндексе разработали собственные тесты на знание истории, права, английского и общих фактов. В последней категории, к примеру, она набрала 86,5 балла против 83,2 китайской DeepSeek-V4-Flash-Base, которая в 3,5 раза больше.
Alice AI Foundation получилась компактной благодаря архитектуре MoE: из 80 млрд параметров для обработки токена задействуются лишь около 3 млрд. Так модель вмещает больше знаний, но требует меньше вычислений — и на многих задачах обходит более крупные открытые нейросети.
Релиз модели заметили и за рубежом, где её включили в число ключевых запусков недели. А подробнее о разработке и обучении Alice AI Foundation можно почитать в техрепорте.
Подписывайтесь 👉 @techno_yandex
Media is too big
VIEW IN TELEGRAM
Подписывайтесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Подписывайтесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Подписывайтесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41❤22 11👎8🔥4🤔4 3 2
Forwarded from ТЕХНО: Яндекс про технологии
Лидеры выбирают разные пути
Anthropic делает ставку на профессиональные задачи — от кода до науки, Google — на творчество: музыку, изображения и видео. OpenAI развивает одновременно потребительские и корпоративные инструменты и остаётся лидером рынка.
За ИИ много платят немногие
В американской выборке на 1% крупнейших плательщиков приходится почти пятая часть расходов на ИИ. Они тратят в среднем около $900 в месяц и чаще покупают инструменты для работы и творчества. У половины пользователей расходы — не больше $25 в месяц.
Агенты берутся за поручения
Помощники переходят от ответов на вопросы к выполнению поручений. Общаться с ними можно через сообщения, почту и звонки. За место персонального помощника соревнуются в том числе Dots от OpenAI и Muse от Meta*.
Подписке ищут альтернативы
Из 44 сервисов рейтинга, созданных вокруг ИИ, 84% предлагают подписку. Авторы отчёта видят потенциал в рекламе и комиссиях с покупок: они могут открыть доступ без ежемесячного платежа.
Стартапы находят свои ниши
Canva и Notion — в топ-10 веб-рейтинга. Стартапы конкурируют специализацией: Suno создаёт музыку, ElevenLabs работает с голосом. У них собственные модели под конкретные задачи.
* Meta признана экстремистской организацией и запрещена в РФ
Подписывайтесь 👉 @techno_yandex
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Как подключить кнопку?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤98🔥48 20👎15 8🤔7👍3 1
YTsaurus Flow непрерывно обрабатывает большие потоки данных в интернет-сервисах. Например, считает, сколько просмотров на видео или кликов по ссылке. На этих данных дообучаются рекомендательные и рекламные системы.
Потребности пользователей меняются за минуты: сначала они ищут товары для ремонта, а затем — для путешествия. Прежде чем данные станут частью рекомендаций, их нужно собрать и подготовить — это занимает много времени.
Например, вы заказываете еду из фудкорта или ресторана. Сервис мог бы дать скидку на доставку, если ваш заказ будет курьеру по пути. Эта ситуация актуальна только сейчас. Если вы сделаете аналогичный заказ завтра или даже через несколько часов, обстоятельства будут уже другими.
Например, в одном из процессов Яндекс Рекламы технология анализирует миллионы сообщений о действиях пользователей в секунду. До внедрения техническая задержка при подготовке данных могла составлять более десяти часов. С помощью YTsaurus Flow удалось сократить это время практически полностью.
Подписывайтесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤50👍30 21 13👎6🔥3 1