
Решил проверить, как разные модели справляются с переводом объёмного текста.
Взял 40 страниц рассказа на английском, перевожу на русский:
ChatGPT: переводит по одной странице, после каждой спрашивает, продолжать ли дальше. Без подтверждения дальше не пойдёт.
Claude: берётся за куски побольше, но всё равно регурярно останавливается. Приходится самому делить на части и заводить по кусочкам. Лучший по качеству перевод на мой субъективный взгляд.
Minimax: старательно переводит самыми большими кусками, но временами обрывается. Особенность — перевод продолжает идти, только если вкладка браузера активна. Переключишься — замирает.
DeepL: справился за 30 секунд, весь текст сразу и без лишних вопросов. Качество перевода, кстати, не лучше остальных, скорее даже хуже.
Почему модели могут принимать на вход сотни тысяч токенов, а ответ дают в пределах 8–16k?
(Хотя у GPT-4 Turbo есть техническая возможность отдавать 100k, у Claude 2.5 Pro — 66k.)
Ответ довольно простой: Потому что все они доучиваются на примерах коротких ответов. Модель просто привыкает: «вот здесь обычно заканчивается ответ», и генерирует спецтокен «я закончил», даже если задача требует продолжения. Если же взять модель недоученную модель, до файнтунинга, скормить ей несколько сот тысяч токенов и попросить повторить — она повторит. И переведет. Потому что её не научили останавливаться.
А первый раз, когда с таким столнулся, я подумал, что chatgpt так борется с излишне активным использованием. Оказалось, особенность тренировки моделей.