Коротко · Продукти
Пілотний тест на двох картках обрав не того ШІ-перекладача
3 жовтня я двічі обирав модель для перекладу: для своєї енциклопедії рослин і для цього блогу. Перший пілотний тест мене обманув. Ось як це сталося та які сліпі тести його замінили.
3 жовтня моя енциклопедія кімнатних рослин plants.place отримувала англомовну версію. Треба було перекласти з української англійською 133 картки видів — по одній сторінці на рослину. Для цього мені була потрібна модель.
На сторінці цін OpenAI є моделі sol, luna, astra й terra, але не пояснено, що означають ці назви. Тому мій агент провів пілот: переклав дві складні картки чотирма моделями. Перша була про сансев’єрію, де треба було розібратися з українськими народними назвами. Друга — про орхідею дендробіум, гібриди якої магазини продають під назвою виду.
Пілот: дві картки, чотири моделі
| Модель | Ціна за 1 млн токенів, вхід / вихід | Усі 133 картки | Висновок пілота | Сліпий тест |
|---|---|---|---|---|
| gpt-6-luna | $0,10 / $0,50 | ≈ $0,22 | Найкраща: найприродніша англійська | Програла: перемогла у 2 із 10 |
| gpt-6.1-sol | $2 / $10 | ≈ $4,17 | Точна, місцями кострубата | Перемогла у 8 із 10 |
| gpt-6-astra | $10 / $50 | ≈ $20,84 | Точна й чиста | Стала суддею |
| gpt-5.5 | $5 / $30 | ≈ $12,34 | Найгірша: залишила кирилицю в англійському тексті | Вибула |
Це ціни OpenAI станом на 3 жовтня 2026 року. Вартість усіх 133 карток — оцінка з пілота.
Усі вісім перекладів пройшли автоматичні перевірки: структура JSON, усі числа й усі латинські назви залишилися без змін. Найдешевшу модель було найприємніше читати. У картці сансев’єрії вона пояснила значення українських народних назв — «тещин язик» і «щучий хвіст», — а потім навела англійські. З ціною $0,22 за всю англомовну версію вибір здавався очевидним.
У самому звіті про пілот було написано, що двох карток замало. Тому перед повним запуском був ще один крок — сліпий тест.
Сліпий тест усе перевернув
Десять карток, дві моделі: gpt-6-luna і gpt-6.1-sol. Суддею була gpt-6-astra — найдорожча з чотирьох. Вона бачила український оригінал і два переклади, позначені A та B. Для кожної картки їх показували в новому випадковому порядку. Модель оцінювала чотири речі: вірність оригіналу — нічого не додано, не втрачено й не змінено, — природність англійської, правильність садівничих термінів та передавання українських народних назв. Кожну знайдену проблему вона мала процитувати.
gpt-6.1-sol перемогла з рахунком 8:2 і середнім балом 8,9 проти 8,2. Тест тривав дві з половиною хвилини й коштував $1,50. Серед десяти карток були обидві з пілота, і в обох випадках суддя вибрала модель, яку пілот поставив нижче.
Для всієї англомовної версії різниця в ціні між двома моделями становила близько $4.
Чому пілот помилився
Це пояснюють нотатки судді. Дешевшу модель часто було приємніше читати. Інша точніше передала оригінал у дев’яти картках із десяти.
Що побачив сліпий суддя на 10 картках рослин
gpt-6.1-sol точніше передала джерело на 9 картках, gpt-6-luna — на жодній, одна нічия. gpt-6-luna звучала природніше на 5 картках, gpt-6.1-sol — на 1, чотири нічиї.
Ось як це виглядає в одному рядку картки сансев’єрії:
Український оригінал
«Після підсихання» — коли субстрат частково підсох. Влітку: орієнтовно раз на 7 днів.
gpt-6-luna
«Після того, як субстрат висохне». «Влітку поливайте раз на 7 днів». Звучить добре. Натякає, що субстрат має висохнути повністю, і перетворює орієнтир на чітку вказівку.
gpt-6.1-sol
«Після часткового підсихання». «Влітку орієнтир — раз на 7 днів». Кострубато. Але передає те, що сказано в оригіналі.
Картка зараз
«Поливайте, коли субстрат трохи підсохне». «Влітку орієнтуйтеся на полив раз на 7 днів…»
«Після того, як субстрат висохне» звучить правильно. Але якщо сприймати буквально, читач має чекати, доки весь субстрат висохне, тоді як в оригіналі рослину радять поливати після часткового підсихання. У 133 картках про догляд такі дрібні зміни перетворюються на неправильні поради, написані природною англійською.
Така сама помилка вже була в пілоті: там дешева модель теж написала «після того, як ґрунт висохне». У висновку пілота цього не згадали. Коли читаєш заради загального враження, оцінюєш, як звучить переклад. Вірність оригіналу видно лише тоді, коли хтось порівнює тексти рядок за рядком і має список критеріїв.
Для чого пілот усе ж згодився
Він виявив справжній провал. gpt-5.5 залишила «Дендробіум нобіле» кирилицею посеред англійського речення. Також вона взяла українське пояснення народних назв і приписала його англійським назвам. Залишки кирилиці видно вже на одній картці, і їх легко перевірити кодом. Того ж дня у валідаторі з’явилося правило: «В англійському тексті не повинно бути кирилиці».
Для моделі-переможниці вартість однієї картки підтвердилася: близько $0,031 у пілоті й близько $0,035 під час повного запуску. А ось час — ні: у пілоті одна картка забирала 37 секунд, а під час повного запуску на картку часто йшло кілька хвилин.
Отже, пілот добре показує, що зламано. Але погано ранжує дві хороші моделі, різниця між якими — у невеликих змінах значення.
Удруге я відразу почав зі сліпого тесту
Того вечора мені знадобився перекладач для цього блогу — з англійської українською. У моєму скрипті перекладу за замовчуванням стояла gpt-5.5. Цього разу пілота не було. Мій агент узяв десять абзаців із перших чернеток моїх дописів і переклав їх трьома моделями за однаковими інструкціями. Три агенти Claude оцінили переклади всліпу, кожен зі своєю роллю: літературний редактор, двомовний SEO-фахівець і суворий коректор. Порядок трьох версій змінювався від абзацу до абзацу.
| Модель | Ціна за 1 млн токенів, вхід / вихід | Середній бал | Найкраща версія | Судді 1 / 2 / 3 |
|---|---|---|---|---|
| gpt-5.6-sol | $4 / $20 | 8,40 | 17 із 30 | 8,50 / 8,15 / 8,55 |
| gpt-5.5, попередня модель за замовчуванням | $5 / $30 | 7,70 | 10 із 30 | 7,50 / 7,90 / 7,70 |
| gpt-5.6-terra | $2 / $12 | 7,23 | 3 із 30 | 7,00 / 7,50 / 7,20 |
Оцінки за десятибальною шкалою. Загалом 30 вердиктів: десять абзаців і троє суддів. Ціни станом на 3 жовтня 2026 року.
Усі троє суддів поставили gpt-5.6-sol на перше місце, тому вона стала моделлю за замовчуванням. Попередня модель посіла друге місце, хоча була найдорожчою з трьох.
Чи знайшов би переможницю пілот із двох абзаців? Я перерахував ті самі оцінки для всіх можливих пар із десяти абзаців і тих самих трьох суддів.
Якби тест був меншим: як часто перемогла б інша модель
З усіх можливих наборів із десяти абзаців: на 1 абзаці інша модель перемагає в 40% випадків, на 2 — у 22%, на 3 — у 13%, на 4 — у 7%, на 5 — у 4%, на 6 — в 1%. Від 7 абзаців кожен набір обирає gpt-5.6-sol.
У 10 із 45 пар перемогла б інша модель. Абзаци нерівноцінні: усі троє суддів віддали абзаци 4 і 5 моделі gpt-5.5, а абзац 3 — gpt-5.6-terra. Якби почати з них, можна було б зі спокійною совістю залишити стару модель за замовчуванням. Навіть із шістьма абзацами 3 із 210 вибірок усе ще помиляються. Починаючи із семи абзаців, не помиляється жодна.
Переможниці все одно знадобилися правила
Деякі помилки повторилися в кількох моделях. Дві з трьох переклали «SERP feature» як «функція» — так українською називають функцію в програмному забезпеченні. Українські SEO-фахівці кажуть «елемент видачі». Слово «intent» одна модель залишила англійською, друга переклала як «намір», а третя — як «інтенція». Жодна, навіть переможниця, не написала «інтент» — слово, яке вживають у професії. gpt-5.6-terra також переставила число: «стиснув 43 рази» перетворилося на «43 рази перевищив обсяг пам’яті агента».
Тож найкориснішим результатом тесту стала не модель-переможниця. Ним стали 16 правил щодо окремих слів, переважно з нотаток суддів, і ще одне загальне: не залишати англійські слова латиницею. Того ж вечора вони потрапили в промпт для перекладу.
Переклад знайшов помилки в оригіналі
Поки тривав повний запуск на plants.place, та сама модель-суддя перевірила ще десять уже перекладених карток. Середній бал становив 7,9 із 10, а перевірка коштувала $1,08. Модель знайшла шість критичних проблем. Чотири з них походили з українського оригіналу, а не з перекладу. Найгірша: у нашій українській картці було написано, що венерина мухоловка має зимувати в затінку за температури лише на 4–5 °C нижчої, ніж улітку. Мухоловці потрібен прохолодний період спокою за яскравого освітлення. Тепер це правильно написано в обох версіях.
Дві критичні помилки самого перекладу стосувалися значення, а не граматики. Перша — зайва англійська назва мандевіли, яку, за оцінкою судді, для цієї рослини не використовують. Друга — запитання про котів змінило напрям. «Чи можна тримати її вдома, якщо в мене є кіт?» перетворилося на «Чи безпечно тримати її вдома, якщо в мене є кіт?». Через це відповідь «Так, рослина отруйна» стала суперечливою. Українська відповідь теж була незграбною, тому ми виправили її у 12 картках. Менш серйозна помилка з’явилася в трьох картках: «перегній» у складі субстрату переклали як «humus», хоча тут ішлося про добре перепрілий гній. Запитання про кота й перегній тепер стали правилами в промпті.
Чого я не можу стверджувати
- Судді — теж моделі. На plants.place судила одна модель тієї самої компанії, що й дві учасниці. У тесті для блогу судили три моделі іншої компанії.
- Десять прикладів — теж невеликий тест, просто не настільки малий. І рахунок 8:2 насправді означає 7 явних перемог, 1 явну поразку й 2 однакові оцінки, за яких суддя все одно назвала переможницю — по одній для кожної моделі.
- Через випадковий порядок переможниця стояла першою у 8 із 10 карток. Водночас вона виграла обидві картки, де стояла другою, а обидві перемоги іншої моделі були з другої позиції. Я не бачу впливу позиції, але не можу його виключити. У тесті для блогу двоє з трьох суддів бачили версії в однаковому порядку.
- Поки я писав цю нотатку, дві цитати судді звірили з оригіналом: рядок про полив і «bare stems» для «голі пагони», що тут означає стебла без волосків. Обидва зауваження правильні. Усі двадцять перекладів ніхто не читав рядок за рядком.
- Назви моделей і ціни швидко змінюються. Усе тут актуальне станом на 3 жовтня 2026 року.
Як я тепер вибираю модель ШІ для перекладу
- Проведіть пілот, щоб знайти те, що зламано: втрачені числа, поламану структуру, фрагменти мовою оригіналу. Не ранжуйте за ним моделі.
- Ранжуйте всліпу на десяти або більше прикладах. Перемішуйте порядок для кожного прикладу.
- Дайте судді оригінал і письмові критерії. Спочатку вірність оригіналу, потім природність мови. Попросіть процитувати кожну проблему.
- Візьміть суддю з іншого сімейства моделей або кількох суддів із різними ролями.
- Формальні речі перевіряйте кодом: числа, назви й відсутність залишків абетки оригіналу.
- Перетворюйте повторювані помилки на правила в промпті. Переможниця теж помиляється.
- Самостійно звірте з оригіналом кілька цитат судді.