8 октября 2026

Меньше, зато своя

Вчера днём я написал здесь заметку «Зачем нам своя 4B», а сегодня ночью эту самую 4B остановил. Отменять собственные слова меньше чем через сутки неловко, но промолчать было бы хуже.

Напомню, что это было. Модель на четыре миллиарда весов росла из случайных чисел, а рядом стояла хорошая открытая модель того же размера, учитель: моя смотрела, как та продолжает тексты, и повторяла за ней. Я считал, что этого достаточно, чтобы модель была своей: ни одного чужого веса в неё не попадает.

Говорила она после двух ночей на восьми арендованных видеокартах пока плохо, и это меня расстраивало: на «Два плюс два равно» отвечала «100», длинные ответы ходили по кругу. Но остановил я её не из-за этого, с этим можно было работать дальше.

Ночью я наконец сел изучать юридическую сторону дела, до которой раньше не доходили руки. В новом законе об искусственном интеллекте большой считается модель, в которой не меньше миллиарда параметров, то есть весов, и такая модель может получить один из двух статусов. Суверенная — та, весь путь создания которой, включая обучение, разработчик может воспроизвести сам. Национальная может опираться на зарубежные открытые модели. И тут оказалось, что границу я провёл не там. Своей модель делают не только веса: если она училась, глядя на зарубежную, то без той её бы не было, и суверенной её не назвать. Выходило, что я дорого плачу за модель, у которой сам же отнимаю главное, ради чего она затевалась.

А у Тернита уже есть ядро, которое говорит. Оно выросло с нуля, без чужих весов внутри, и училось обычным способом — читая тексты. Беда была одна: в нём 87 миллионов весов, и до планки закона ему не хватало больше чем в одиннадцать раз. В четвёртом часу ночи я решил, что расти будет оно — как раз до этой планки.

Тем же утром я расширил ядро до миллиарда весов. Здесь есть тонкость, которая мне очень нравится. Модель стала вчетверо шире, но сразу после расширения отвечает ровно так же, как до него: новые веса добавлены так, чтобы поначалу ничего не менять. Я сверил шестнадцать миллионов проверочных чисел, и совпали все. Выученное не потеряно, а места для нового стало намного больше. В одиннадцать утра расширенное ядро село читать на арендованной видеокарте, а к восьми вечера читало уже на двух.

Вчера я писал, что меньше четырёх миллиардов брать бессмысленно. От цели я не отказываюсь: миллиард — это планка закона, а не потолок, и тем же приёмом ядро можно расширить ещё. Изменился порядок: сначала своя, потом большая.

Своей модель делают не только веса, но и то, у кого она училась. Размер можно нарастить потом, происхождение — нет.

Андрей Рощупкин