Восемнадцатого июля выяснилась вещь, которой я, честно говоря, не ожидал: разбор языка внутри Организма оказался не привязан к языку вообще. Орган, обученный только на русском, работал на английском и немецком, которых в глаза не видел.
Числа такие. Определение ролей в фразе — кто действует, над чем: русский учили, английский дал семьдесят четыре процента даром, немецкий шестьдесят пять после короткого показа строя. Случайный контроль — семь с половиной. Единственное и множественное число: русский девяносто восемь, английский шестьдесят шесть, немецкий семьдесят пять при контроле двадцать семь.
Принято думать, что модель учит язык. Похоже, значительную часть времени она учит устройство речи вообще. Роли «кто» и «что» есть в любом языке, и опознаются они не по словам. Для меня это было не философией, а деньгами: маленькой модели не обязательно учить каждый язык с нуля, и значит она может быть ещё меньше.
В тот же день я расписал наряд на следующий шаг — слух сразу на четырёх языках разного строя, включая китайский, у которого и пробелов-то между словами нет. С одним жёстким условием: русский слой заморозить намертво и прирастить к нему остальные. Не дообучать всё целиком. Потому что дообучение всего — это гарантированное забывание, русский просядет, и мы это уже проходили.
А ещё в тот день я записал разбор собственной ошибки, и он мне не понравился. Задача изначально ставилась язык-нейтральной. А работа молча съехала в русский — просто потому, что корпуса под рукой были русские. Никто этого не решал. Оно случилось само, по удобству, и я месяц этого не замечал. После того как назвал вслух, разблокировались сразу несколько направлений, стоявших всё это время.
Вывод, который дороже процентов: цель сужается незаметно и всегда по удобству. Не потому что кто-то решил упростить, а потому что под рукой оказалось то, что оказалось. Проверять надо не «правильно ли мы это делаем», а «ту ли вообще задачу мы делаем». Первый вопрос задают на каждой планёрке, второй — почти никогда.
Андрей Рощупкин