Многие переводчики и изучающие японский язык сталкивались с проблемой: либо словарь устарел, либо его просто нет. Советский «Большой японско-русский словарь» 1970-х годов уже не покрывает современную лексику, а популярный среди японистов англо-японский словарь Jitendex требует знания двух языков. Решить эту проблему взялся разработчик, создавший проект «Колобок» — первый полноценный японско-русский словарь, составленный с помощью нейросетей.
Создатель проекта не стал изобретать велосипед и использовал существующий англо-японский словарь Jitendex в качестве основы. По его словам, в словаре собрана практически вся необходимая лексика для изучения японского языка на хорошем уровне. Однако прямой перевод с английского на русский не давал нужного качества: модели слишком буквально следовали английским переводам, игнорируя культурные и языковые нюансы. Пришлось искать подход, который позволил бы учитывать контекст и специфику обоих языков.
Перевод был организован через пайплайн с использованием модели Luna от ChatGPT. Энтузиаст запустил до 100 параллельных потоков через CLI, чтобы ускорить процесс. Сначала специалисты вручную проверяли первые 1,5 тысячи слов и корректировали промпты, чтобы минимизировать ошибки. Модель Luna показала неожиданно высокое качество: только треть первых ста статей содержала заметные недочёты, которые можно было устранить настройкой промпта. Важным условием стало ограничение контекста до среднего размера словарной статьи, чтобы избежать ошибок, связанных с перегрузкой модели.
Результат впечатляет: за полторы недели и пять перезапусков подписки на 100 долларов (что эквивалентно примерно 4–5 миллиардам токенов) был переведён словарь из 400 тысяч статей. Если бы пришлось платить за токены по стандартному тарифу API, проект обошёлся бы в 3–6 тысяч долларов — но благодаря подписке стоимость удалось снизить в десятки раз. Все статьи проверялись на соответствие json-схеме, а качество перевода контролировалось через регулярные сэмплы сравнений с оригиналом.
«Колобок» выпущен под свободной лицензией и поддерживает несколько форматов: Yomitan, StarDict, Apple Dictionary, PocketBook и MDict. При этом разработчик столкнулся с неожиданной проблемой: разные программы рендерят словарь по-разному, и теперь предстоит доработать рендеринг. Проект показал, что если есть словарь с изучаемого языка на любой другой, то его можно автоматически перевести на любой третий язык с помощью нейросетей. Это открывает возможности для создания словарей между самыми экзотическими языками.



