Перейти до змісту
Нотатки

Коротко · Продукти

Пілотний тест на двох картках обрав не того ШІ-перекладача

3 жовтня я двічі обирав модель для перекладу: для своєї енциклопедії рослин і для цього блогу. Перший пілотний тест мене обманув. Ось як це сталося та які сліпі тести його замінили.

Макс Кірієнко
Tech Lead SEO та маркетингу · 7 хв читання

Read in English

3 жовтня моя енциклопедія кімнатних рослин plants.place отримувала англомовну версію. Треба було перекласти з української англійською 133 картки видів — по одній сторінці на рослину. Для цього мені була потрібна модель.

На сторінці цін OpenAI є моделі sol, luna, astra й terra, але не пояснено, що означають ці назви. Тому мій агент провів пілот: переклав дві складні картки чотирма моделями. Перша була про сансев’єрію, де треба було розібратися з українськими народними назвами. Друга — про орхідею дендробіум, гібриди якої магазини продають під назвою виду.

Пілот: дві картки, чотири моделі

МодельЦіна за 1 млн токенів, вхід / вихідУсі 133 карткиВисновок пілотаСліпий тест
gpt-6-luna$0,10 / $0,50≈ $0,22Найкраща: найприродніша англійськаПрограла: перемогла у 2 із 10
gpt-6.1-sol$2 / $10≈ $4,17Точна, місцями кострубатаПеремогла у 8 із 10
gpt-6-astra$10 / $50≈ $20,84Точна й чистаСтала суддею
gpt-5.5$5 / $30≈ $12,34Найгірша: залишила кирилицю в англійському текстіВибула

Це ціни OpenAI станом на 3 жовтня 2026 року. Вартість усіх 133 карток — оцінка з пілота.

Усі вісім перекладів пройшли автоматичні перевірки: структура JSON, усі числа й усі латинські назви залишилися без змін. Найдешевшу модель було найприємніше читати. У картці сансев’єрії вона пояснила значення українських народних назв — «тещин язик» і «щучий хвіст», — а потім навела англійські. З ціною $0,22 за всю англомовну версію вибір здавався очевидним.

У самому звіті про пілот було написано, що двох карток замало. Тому перед повним запуском був ще один крок — сліпий тест.

Сліпий тест усе перевернув

Десять карток, дві моделі: gpt-6-luna і gpt-6.1-sol. Суддею була gpt-6-astra — найдорожча з чотирьох. Вона бачила український оригінал і два переклади, позначені A та B. Для кожної картки їх показували в новому випадковому порядку. Модель оцінювала чотири речі: вірність оригіналу — нічого не додано, не втрачено й не змінено, — природність англійської, правильність садівничих термінів та передавання українських народних назв. Кожну знайдену проблему вона мала процитувати.

gpt-6.1-sol перемогла з рахунком 8:2 і середнім балом 8,9 проти 8,2. Тест тривав дві з половиною хвилини й коштував $1,50. Серед десяти карток були обидві з пілота, і в обох випадках суддя вибрала модель, яку пілот поставив нижче.

Для всієї англомовної версії різниця в ціні між двома моделями становила близько $4.

Чому пілот помилився

Це пояснюють нотатки судді. Дешевшу модель часто було приємніше читати. Інша точніше передала оригінал у дев’яти картках із десяти.

Що побачив сліпий суддя на 10 картках рослин

gpt-6.1-sol точніше передала джерело на 9 картках, gpt-6-luna — на жодній, одна нічия. gpt-6-luna звучала природніше на 5 картках, gpt-6.1-sol — на 1, чотири нічиї.

Нічиї: одна за точністю, чотири за природністю. На восьми картках суддя оцінив кожен критерій окремо, на двох — сказав словами. Джерело: сліпий A/B-тест на 10 картках plants.place, суддя gpt-6-astra, 3 жовтня 2026

Ось як це виглядає в одному рядку картки сансев’єрії:

Український оригінал

«Після підсихання» — коли субстрат частково підсох. Влітку: орієнтовно раз на 7 днів.

gpt-6-luna

«Після того, як субстрат висохне». «Влітку поливайте раз на 7 днів». Звучить добре. Натякає, що субстрат має висохнути повністю, і перетворює орієнтир на чітку вказівку.

gpt-6.1-sol

«Після часткового підсихання». «Влітку орієнтир — раз на 7 днів». Кострубато. Але передає те, що сказано в оригіналі.

Картка зараз

«Поливайте, коли субстрат трохи підсохне». «Влітку орієнтуйтеся на полив раз на 7 днів…»

Рядок про полив у картці сансев’єрії зі сліпого тесту 3 жовтня. Нинішній текст картки з’явився під час пізнішого повного запуску з довшим промптом.

«Після того, як субстрат висохне» звучить правильно. Але якщо сприймати буквально, читач має чекати, доки весь субстрат висохне, тоді як в оригіналі рослину радять поливати після часткового підсихання. У 133 картках про догляд такі дрібні зміни перетворюються на неправильні поради, написані природною англійською.

Така сама помилка вже була в пілоті: там дешева модель теж написала «після того, як ґрунт висохне». У висновку пілота цього не згадали. Коли читаєш заради загального враження, оцінюєш, як звучить переклад. Вірність оригіналу видно лише тоді, коли хтось порівнює тексти рядок за рядком і має список критеріїв.

Для чого пілот усе ж згодився

Він виявив справжній провал. gpt-5.5 залишила «Дендробіум нобіле» кирилицею посеред англійського речення. Також вона взяла українське пояснення народних назв і приписала його англійським назвам. Залишки кирилиці видно вже на одній картці, і їх легко перевірити кодом. Того ж дня у валідаторі з’явилося правило: «В англійському тексті не повинно бути кирилиці».

Для моделі-переможниці вартість однієї картки підтвердилася: близько $0,031 у пілоті й близько $0,035 під час повного запуску. А ось час — ні: у пілоті одна картка забирала 37 секунд, а під час повного запуску на картку часто йшло кілька хвилин.

Отже, пілот добре показує, що зламано. Але погано ранжує дві хороші моделі, різниця між якими — у невеликих змінах значення.

Удруге я відразу почав зі сліпого тесту

Того вечора мені знадобився перекладач для цього блогу — з англійської українською. У моєму скрипті перекладу за замовчуванням стояла gpt-5.5. Цього разу пілота не було. Мій агент узяв десять абзаців із перших чернеток моїх дописів і переклав їх трьома моделями за однаковими інструкціями. Три агенти Claude оцінили переклади всліпу, кожен зі своєю роллю: літературний редактор, двомовний SEO-фахівець і суворий коректор. Порядок трьох версій змінювався від абзацу до абзацу.

МодельЦіна за 1 млн токенів, вхід / вихідСередній балНайкраща версіяСудді 1 / 2 / 3
gpt-5.6-sol$4 / $208,4017 із 308,50 / 8,15 / 8,55
gpt-5.5, попередня модель за замовчуванням$5 / $307,7010 із 307,50 / 7,90 / 7,70
gpt-5.6-terra$2 / $127,233 із 307,00 / 7,50 / 7,20

Оцінки за десятибальною шкалою. Загалом 30 вердиктів: десять абзаців і троє суддів. Ціни станом на 3 жовтня 2026 року.

Усі троє суддів поставили gpt-5.6-sol на перше місце, тому вона стала моделлю за замовчуванням. Попередня модель посіла друге місце, хоча була найдорожчою з трьох.

Чи знайшов би переможницю пілот із двох абзаців? Я перерахував ті самі оцінки для всіх можливих пар із десяти абзаців і тих самих трьох суддів.

Якби тест був меншим: як часто перемогла б інша модель

З усіх можливих наборів із десяти абзаців: на 1 абзаці інша модель перемагає в 40% випадків, на 2 — у 22%, на 3 — у 13%, на 4 — у 7%, на 5 — у 4%, на 6 — в 1%. Від 7 абзаців кожен набір обирає gpt-5.6-sol.

Усі можливі набори з десяти абзаців з оцінками тих самих трьох суддів. Промах — вищий середній бал в іншої моделі або нічия. Це той самий тест, розрізаний на частини; його повний результат вважається правильним. Джерело: сліпий тест трьох моделей перекладу, 10 абзаців × 3 судді, 3 жовтня 2026

У 10 із 45 пар перемогла б інша модель. Абзаци нерівноцінні: усі троє суддів віддали абзаци 4 і 5 моделі gpt-5.5, а абзац 3 — gpt-5.6-terra. Якби почати з них, можна було б зі спокійною совістю залишити стару модель за замовчуванням. Навіть із шістьма абзацами 3 із 210 вибірок усе ще помиляються. Починаючи із семи абзаців, не помиляється жодна.

Переможниці все одно знадобилися правила

Деякі помилки повторилися в кількох моделях. Дві з трьох переклали «SERP feature» як «функція» — так українською називають функцію в програмному забезпеченні. Українські SEO-фахівці кажуть «елемент видачі». Слово «intent» одна модель залишила англійською, друга переклала як «намір», а третя — як «інтенція». Жодна, навіть переможниця, не написала «інтент» — слово, яке вживають у професії. gpt-5.6-terra також переставила число: «стиснув 43 рази» перетворилося на «43 рази перевищив обсяг пам’яті агента».

Тож найкориснішим результатом тесту стала не модель-переможниця. Ним стали 16 правил щодо окремих слів, переважно з нотаток суддів, і ще одне загальне: не залишати англійські слова латиницею. Того ж вечора вони потрапили в промпт для перекладу.

Переклад знайшов помилки в оригіналі

Поки тривав повний запуск на plants.place, та сама модель-суддя перевірила ще десять уже перекладених карток. Середній бал становив 7,9 із 10, а перевірка коштувала $1,08. Модель знайшла шість критичних проблем. Чотири з них походили з українського оригіналу, а не з перекладу. Найгірша: у нашій українській картці було написано, що венерина мухоловка має зимувати в затінку за температури лише на 4–5 °C нижчої, ніж улітку. Мухоловці потрібен прохолодний період спокою за яскравого освітлення. Тепер це правильно написано в обох версіях.

Дві критичні помилки самого перекладу стосувалися значення, а не граматики. Перша — зайва англійська назва мандевіли, яку, за оцінкою судді, для цієї рослини не використовують. Друга — запитання про котів змінило напрям. «Чи можна тримати її вдома, якщо в мене є кіт?» перетворилося на «Чи безпечно тримати її вдома, якщо в мене є кіт?». Через це відповідь «Так, рослина отруйна» стала суперечливою. Українська відповідь теж була незграбною, тому ми виправили її у 12 картках. Менш серйозна помилка з’явилася в трьох картках: «перегній» у складі субстрату переклали як «humus», хоча тут ішлося про добре перепрілий гній. Запитання про кота й перегній тепер стали правилами в промпті.

Чого я не можу стверджувати

  • Судді — теж моделі. На plants.place судила одна модель тієї самої компанії, що й дві учасниці. У тесті для блогу судили три моделі іншої компанії.
  • Десять прикладів — теж невеликий тест, просто не настільки малий. І рахунок 8:2 насправді означає 7 явних перемог, 1 явну поразку й 2 однакові оцінки, за яких суддя все одно назвала переможницю — по одній для кожної моделі.
  • Через випадковий порядок переможниця стояла першою у 8 із 10 карток. Водночас вона виграла обидві картки, де стояла другою, а обидві перемоги іншої моделі були з другої позиції. Я не бачу впливу позиції, але не можу його виключити. У тесті для блогу двоє з трьох суддів бачили версії в однаковому порядку.
  • Поки я писав цю нотатку, дві цитати судді звірили з оригіналом: рядок про полив і «bare stems» для «голі пагони», що тут означає стебла без волосків. Обидва зауваження правильні. Усі двадцять перекладів ніхто не читав рядок за рядком.
  • Назви моделей і ціни швидко змінюються. Усе тут актуальне станом на 3 жовтня 2026 року.

Як я тепер вибираю модель ШІ для перекладу

  1. Проведіть пілот, щоб знайти те, що зламано: втрачені числа, поламану структуру, фрагменти мовою оригіналу. Не ранжуйте за ним моделі.
  2. Ранжуйте всліпу на десяти або більше прикладах. Перемішуйте порядок для кожного прикладу.
  3. Дайте судді оригінал і письмові критерії. Спочатку вірність оригіналу, потім природність мови. Попросіть процитувати кожну проблему.
  4. Візьміть суддю з іншого сімейства моделей або кількох суддів із різними ролями.
  5. Формальні речі перевіряйте кодом: числа, назви й відсутність залишків абетки оригіналу.
  6. Перетворюйте повторювані помилки на правила в промпті. Переможниця теж помиляється.
  7. Самостійно звірте з оригіналом кілька цитат судді.