Alice AI Foundation: открытые веса Яндекса и честный выбор между своей моделью и API
21.09.2026 Яндекс открыл веса AliceAI-Foundation-80B-A3B под Apache 2.0: 80B при 3B активных, контекст 262 144. Когда своей модели быть, а когда хватит API.
Коротко
21 сентября 2026 года Яндекс открыл веса базовой модели — репозиторий yandex/AliceAI-Foundation-80B-A3B-Base на Hugging Face под лицензией Apache 2.0. Характеристики из официальной карточки: 80 млрд параметров всего при 3 млрд активных на токен, гибридная архитектура с MoE-слоями, контекст 262 144 токена, языки — русский и английский, формат Safetensors, точность BF16. Это base-модель: она предсказывает следующий токен и не является готовым чат-ассистентом, поэтому «скачать и отвечать клиентам» из неё напрямую не получится — нужен дообучение или обвязка. Что это меняет для компании, которая выбирает между API и своим контуром: вопрос «своя модель или чужая» перестаёт быть вопросом лицензии (она бесплатная) и становится вопросом инфраструктуры и данных. Ниже — как именно считать этот выбор и в каких случаях открытые веса выгодны, а в каких обойдутся дороже API. Материал актуален на 04.10.2026, характеристики взяты только из карточки модели и поста Яндекса, сторонние оценки бенчмарков не пересказываем.
Что именно открыли и чего в открытии нет
Открыли веса, а не обучение. Это разное, и путаница между ними стоит компаниям денег.
Что есть. Архитектура и веса модели, лицензия Apache 2.0 (разрешает коммерческое использование, модификацию и дообучение без обязательств по открытию своих производных), контекст 262 144 токена, заявленная поддержка двух языков, инструкции запуска через Transformers, vLLM и SGLang. Модель обучена с нуля сериями по 2 трлн токенов — это часть описания из карточки, а не наша оценка.
Чего нет. Готового чат-режима: в названии стоит приставка Base. Анонс и разбор архитектуры — в официальном посте Яндекса на Хабре. Нет официально поставляемой версии «под ключ» с выключенной генерацией и настроенными правилами отказа. Нет гарантии, что открытая версия совпадает по поведения с облачной Alice AI, — это разные артефакты, и сравнивать их надо на своих задачах, а не по названию.
Что ещё важно для расчёта. Карточка требует trust_remote_code=True и конкретную версию библиотеки flash-linear-attention: модель использует нестандартные слои внимания (KDA — kernelized dilated attention, плюс gated attention, 512 экспертов с Top-K 10 и одним общим экспертом, один MTP-слой). Практический вывод: запустить её «как обычную Llama» на любом стеке нельзя, нужен либо официальный образ, либо проверка совместимости вашего сервера инференса. Это не дефект, но это строка в смете на работы.
Три сценария: облачный API, аренда GPU, своё железо
Выбор обычно сводят к «дешевле или дороже», хотя различаются они по четырём осям: деньги, контроль над данными, скорость запуска и то, кто отвечает за устойчивость. Сравнение в таблице — по нашей практике внедрений, цены в ней не абсолютные, а относительные.
| Ось | Облачный API | Открытая модель на арендованном GPU | Открытая модель в своём контуре |
|---|---|---|---|
| Старт | Часы: ключ, интеграция, тесты | Дни–недели: образ, сервинг, обвязка | Недели–месяцы: закупка, место, питание, охлаждение, администрирование |
| Структура затрат | Оплата за токены, растёт линейно с нагрузкой | Оплата за час GPU, нагрузка почти не важна до предела карты | CAPEX плюс постоянные расходы на сопровождение |
| Данные | Покидают периметр, нужен регуляторный анализ | Могут не покидать, зависит от арендодателя | Не покидают периметра |
| Качество ответа | Улучшается без ваших работ, но вы не управляете обновлением | Ваш выбор модели и её дообучение | Полный контроль, включая дообучение под свои формулировки |
| Кто держит отказоустойчивость | Провайдер | Арендодатель железа, вы — сервис | Только вы |
| Когда выгодно | Нагрузка нестабильная, задача типовая, запуск нужен сейчас | Нагрузка стабильная и высокая, требования к приватности средние | Регулируемая отрасль, закрытые данные, постоянная нагрузка, есть инженерная команда |
Пропорция, которую полезно держать в голове: на малой и средней нагрузке API почти всегда дешевле, потому что разница между «плачу за токены» и «плачу за GPU круглосуточно» определяется утилизацией. Аренда под модель такого класса окупается примерно тогда, когда она реально загружена большую часть суток. Для внутреннего ассистента на 30 пользователей это почти никогда не так; для потока обработки обращений 24/7 — так.
Сколько железа нужно под такую модель — наш расчёт
В карточке требований по видеопамяти нет, поэтому считаем сами и открыто помечаем это как наш расчёт, а не данные Яндекса.
Веса. 80 млрд параметров в BF16 — это порядка 160 ГБ только под веса, без учёта ключей внимания и служебных буферов. Практически это либо сервер с несколькими картами по 80 ГБ, либо квантование.
Квантование. Для модели с 3 млрд активных параметров квант — не компромисс по скорости, а способ влезть в разумное железо: при 4 битах на вес это порядка 40–45 ГБ, то есть одна станция с двумя картами по 24 ГБ уже не работает, но конфигурация из 2×48 ГБ или 4×24 ГБ становится реальной. На Hugging Face уже есть квантованные производные от этой модели — это проверяемый факт, а не обещание.
Скорость. Активных 3 млрд — значит, генерация идёт со скоростью маленькой модели, а «в восемьдесят миллиардов» оплачивается памятью, а не тактами. В этом и смысл MoE, и в этом же причина, почему такие модели требуют специфичного софта: распараллеливание экспертов — не то, что любой сервер инференса умеет одинаково хорошо.
Чего этот расчёт не покрывает. Хранилище, резервирование, мониторинг, обновление образов, зарплата администратора и стоимость простоя. В наших проектах на эти строки приходится от трети до половины трёхлетней стоимости контура, и именно их чаще всего забывают в сравнении «API против своей модели».
Как понять, что вам нужен именно свой контур
Пять признаков, при которых решение в пользу закрытого контура перестаёт быть идеологическим.
1. Данные нельзя передавать наружу по существу, а не по политике. Клиентская база, медицинские и финансовые кейсы, переписка поддержки с персональными данными, внутренняя документация под NDA. Здесь важен тест: согласует ли юрист отправку этого текста во внешний API хотя бы с обезличиванием. Если нет — контур закрытый, и обсуждать нечего.
2. Нагрузка постоянная и измеримая. Если вы можете назвать количество запросов в сутки и средняя длина ответа известна, сравнение «за токены» против «за железо» превращается в арифметику. Если не можете — начните с API, иначе купите GPU под фантазию.
3. Есть инженер, который это сопровождает. Не человек, который «разбирается в серверах», а тот, кто поставит образ, снимет метрики времени отклика, поймёт деградацию после обновления библиотеки. Модель без сопровождения — это не внедрение, а отложенный инцидент.
4. Нужен контроль над поведением, а не только над доступом. Формулировки отказа, стиль ответов, запрет на выдумывание чисел, работа с вашим доменом терминов. Это делается дообучением и ограничениями в контуре, где вы управляете версией модели.
5. Модель — часть продукта, а не часть поддержки. Если на ответе модели зависит то, за что клиент платит, внешняя недоступность провайдера становится вашим простоем. Тогда нужен либо свой контур, либо второй провайдер и честный SLA.
Если совпали первые два пункта и ни одного из трёх следующих — чаще выигрывает гибрид: чувствительные сценарии в закрытом контуре, типовые — через API. Об этом у нас есть отдельный разбор: «Закрытый AI-контур: когда бизнесу нужен on-premise, а когда хватит облака».
Типичный просчёт: модель открыли, а данные и права доступа не сделали
Самая дорогая ошибка в таких проектах — не железо и не лицензия, а ожидание, что «своя большая модель» сама начнёт знать вашу номенклатуру, цены и регламенты.
Базовая модель знает то, что было в её корпусе. Прайс-лист, складские остатки, история обращений, внутренние инструкции и условия договоров в корпус не входят, поэтому без слоя поиска по своим документам модель будет уверенно и неправильно отвечать на вопросы, которые вам важнее всего. Мы разбирали это в статьях про «Сколько стоит RAG-система для бизнеса» и про «Суверенные и национальные AI-модели».
Вторая часть того же просчёта — права доступа. Закрытый контур без разграничения ролей превращается в интерфейс ко всей чувствительной информации сразу: ассистент, которому можно задать вопрос от имени «сотрудника», отвечает и то, чего этому сотруднику видеть не положено. Проект, где права доступа спроектированы вместе с поиском по данным, а не после него, стоит дороже на старте и не требует переделки после первого внутреннего инцидента.
Третья — отсутствие приёмки. Если заранее не записаны проверки (на каких вопросах модель обязана отказываться, какой должна быть доля выдуманных фактов, за сколько секунд отвечает типовой запрос), спор о качестве превращается в спор о вкусе. Именно об этом наш материал «Гейты качества при сборке сайта на ИИ», и тот же подход мы применяем к AI-продуктам.
Как считать решение: четыре вопроса подряд
Вопрос 1: что именно должно работать через модель? Одна функция, а не «ИИ в компанию». Формулировка «ассистент для менеджеров по подбору оборудования» проверяема; «внедрить ИИ» — нет.
Вопрос 2: какие данные ей нужны и могут ли они уходить наружу? Ответ даёт выбор контура, а не наоборот.
Вопрос 3: какова нагрузка и как она будет меняться за год? Здесь считается цена: для API — за токены, для контура — за железо плюс сопровождение и простой.
Вопрос 4: чем мы замерим успех? Доля обращений, закрытых без человека, медианное время ответа, доля ответов с проверяемыми ссылками на источник, количество инцидентов с выдуманными фактами. Без этого списка проект окупить невозможно, потому что нечем доказать, что он что-то улучшил.
Практический вывод по открытым весам Яндекса: они снимают барьер «нельзя посмотреть внутрь» и дают русскоязычную модель в законном коммерческом использовании. Но они не снимают ни одной из трёх реальных статей затрат — слой данных, права доступа и сопровождение. Решение «сделаем своё, потому что веса бесплатные» — это решение наполовину верное: лицензии в смете никогда и не было самой большой строкой. Стоимость самого продукта и его поддержки разбираем в «Сколько стоит разработка AI-продукта в России», а про облачную линейку Alice AI — в «Яндекс представил Alice AI LLM Flash».
Вывод
Открытие весов Alice AI Foundation — повод не «переезжать с API», а перестать принимать решение вслепую. Теперь можно за две недели посчитать на своей задаче три варианта и выбрать по цифрам, а не по аргументу «у Яндекса дороже». Мы это делаем как отдельную работу: сравнение контуров на вашем кейсе, требования к железу, смета сопровождения и критерии приёмки. Пример такой работы — кейс «AI-продукт с нуля: локальный ассистент с приёмкой 16 из 16», где приватность была исходным условием, и кейс fine-tuned LLM для юридической платформы, где модель дообучали под предметную область. Начать можно с AI-консалтинга или с письма в контакты: скажем честно, нужен ли вам свой контур, или хватит API и нормально настроенного поиска по своим документам.
Про ответственность за вывод модели: кого реально обязывает 243-ФЗ о маркировке ИИ-контента — обязанность лежит на площадке с большой аудиторией, а не на том, кто запускает модель у себя.