Чи вміє локальний ШІ говорити чеською? Що показують бенчмарки і що з цього випливає для компанії

Відповідь одразу: Так, сьогоднішні відкриті моделі чеською вміють — але запитання «чи вміє чеською?» для компанії марне. Вирішує конкретне завдання: та сама модель надійно витягне суму із замовлення й водночас напише клієнтові речення з англійською будовою. Чеські бенчмарки показують вимірюваний відрив від англійської та мінливий порядок моделей залежно від типу завдання, тож вибір належить робити на ваших власних документах, а не за лідербордом.

Запитання «чи вміє локальний ШІ чеською?» має ту саму ваду, що й запитання «чи швидкий той диск?». Відповідь залежить від того, що ви з ним збираєтеся робити. Модель, яка в тесті чеської правильно відповість на запитання з вибором варіантів, при вільному письмі може продукувати слова, яких у чеській не існує. І навпаки — модель із кострубатою стилістикою може бути цілком надійною при витягуванні чисел із рахунків у JSON.

Цей текст про те, що чеські бенчмарки насправді вимірюють, де їхня межа і як із цього зробити рішення, яке ви обстоїте і перед собою, і перед бухгалтеркою.

Шість здібностей, що ховаються за словом «чеською»

Корпоративне впровадження не тримається на одній навичці. Воно тримається на шести, які між собою пов’язані лише вільно:

ЗдібністьЯк її видно в роботі
Розуміння текстуВідрізнить рекламацію, замовлення та звичайний запит
Витягування інформаціїЗ договору поверне правильні імена, суми, терміни та зобов’язання
Створення текстуНапише природний лист без дивних слів і англійської будови речення
Дотримання інструкціїПоверне лише потрібну таблицю або валідний JSON
Робота з контекстомВідповість за наданими документами, а не за власними здогадами
Безпечна відмоваНе вигадає відповідь, коли підстав бракує

Останній рядок — саме той, на якому корпоративне впровадження найчастіше падає. Модель, яка замість «у підставах цього немає» додасть переконливо виглядаючу суму, гірша за жодну модель — бо помилку ніхто не шукає.

І саме тому байдуже, скільки відсотків модель набере в тесті чеської граматики. Це вимірює першу здібність, можливо другу. Про решту чотири не каже нічого.

Що показує BenCzechMark

BenCzechMark — чеський бенчмарк, опублікований у журналі TACL у 2025 році. Містить 50 завдань у восьми галузях — розуміння тексту, фактичні знання, математичні міркування, розпізнавання іменованих сутностей, сентимент, відношення між твердженнями та інші. Результати дійсні для конкретних версій моделей, протестованих у дослідженні; їх не можна автоматично переносити на пізнішу модель із тією самою назвою родини.

Для власника компанії з нього випливають три речі.

Єдиного переможця не існує. У різних категоріях добре показували себе різні родини моделей — Llama, Gemma, Phi, Mistral, Qwen і EuroLLM. Модель, яка розчавлює конкурентів у витягуванні сутностей, може бути посередньою в міркуваннях. Запитання звучить не «яка модель найкраща», а «яка найкраща для мого завдання».

Чеська модель не є автоматично кращою для чеської. Чеські моделі, залучені до дослідження, мали перевагу в деяких суто мовних вимірюваннях, але на більшості інших завдань відставали від сильних багатомовних моделей. Тренування на чеській допомагає мові; воно не замінює обсяг даних, розмір моделі та якість донавчання на інструкціях.

Формулювання завдання рухає результатом. Деякі менші моделі чутливо реагували на зміну промпту. Для автоматизації це принципове попередження: пайплайн, який працює лише за одного точного формулювання, впаде тієї миті, коли клієнт напише вам листа на два речення довший або без діакритики.

BenCzechMark має і свої межі. Він оцінює відкриті моделі й покриває не все — приміром, довге генерування тексту чи всю широту дотримання інструкцій. Це інструмент для складання короткого списку, а не заміна пілота на ваших даних.

Що додає MiniCzechBenchmark

MiniCzechBenchmark було представлено на воркшопі NeurIPS 2025 як швидше чеське оцінювання з наголосом на обмеження контамінації тестових даних — тобто ситуації, коли тестові запитання потрапляють до тренувальних даних і модель «знає» їх напам’ять.

Автори зазначають, що між англійськими та чеськими здібностями моделей зберігається різниця приблизно 10–30 %. Це сумарний діапазон по всьому бенчмарку, а не гарантія для конкретної моделі та конкретного завдання. Це не означає «чеський вихід буде на 20 % гірший»; це означає, що для чеської ви не можете покладатися на англійські числа з лідерборду.

Важлива, однак, межа того, що бенчмарк узагалі вимірює: усі чотири його частини — це запитання з вибором варіантів. Про те, як модель пише зв’язний текст, він отже не каже нічого. А це дві різні здібності — модель може надійно позначити відповідь B і при цьому в листі складати кострубаті речення чи творити неіснуючі слова. Якість вільного письма ви маєте перевірити самі на власних текстах; жоден публічний чеський бенчмарк її за вас не виміряє.

Із цього випливає просте правило вибору. Якщо ШІ має відповідати клієнтам, ви мусите оцінювати цілі відповіді — а не бали. Якщо він має лише сортувати документи, вирішальними є точність класифікації та стабільність вихідного формату.

Чому чеська відстає від англійської

Сама діакритика різниці не пояснює. Вирішують обсяг і якість чеських текстів у тренуванні, спосіб розбиття тексту на токени та донавчання на інструкціях — а останнє здебільшого відбувається англійською.

Токенізація при цьому — та стаття, яку люди недооцінюють. Чеська для токенізаторів, тренованих переважно на англійській, буває менш ощадною: та сама інформація займає більше токенів. Практично це означає коротший корисний контекст за того самого ліміту, вищу обчислювальну вимогливість і довшу відповідь. Скільки саме це становить, не оцінити за кількістю слів — це треба виміряти токенізатором конкретної моделі.

Друга змінна — квантизація. Чотирибітний варіант суттєво заощадить пам’ять, але може змінити точність і стабільність виходу й не є тотожним моделі в первинній точності. Порівнювати повну версію на серверній карті з агресивно квантизованою версією на робочій станції і не наводити конфігурацію — оманливо; при цьому в деяких публічних порівняннях точна конфігурація відсутня.

Які моделі має сенс залучити до корпоративного тесту

Публічні бенчмарки використайте як перше сито. BenCzechMark порівнює, серед іншого, конкретні тодішні варіанти з родин Llama, Gemma, Mistral, Qwen, Phi та EuroLLM. До власного тесту залучіть версії, доступні й підтримувані на момент рішення — і лише якщо їхня точна ліцензія покриває заплановане комерційне використання. У деяких відкритих моделей ліцензія — це не те саме, що Apache 2.0 чи MIT.

Назви родини, однак, не досить. До обліку належать:

  • точна версія та кількість параметрів,
  • тип і рівень квантизації,
  • довжина контексту,
  • ліцензія,
  • використаний runtime,
  • споживання VRAM,
  • час до першого токена та швидкість подальшого генерування.

Без цих даних тест не повторити — а неповторюваний тест не є вимірюванням, це враження.

Для простого впровадження зазвичай використовують Ollama. llama.cpp пропонує широку підтримку формату GGUF і роботу на CPU та GPU. Для сервера, що обслуговує більше одночасних запитів, обирають vLLM. Runtime сам якості чеської не створить — він вплине на швидкість, місткість і можливості впровадження.

При виборі моделі грає роль і те, звідки вона походить. NÚKIB (чеський Національний офіс з кібербезпеки та інформаційної безпеки) видав попередження щодо використання DeepSeek — воно спрямоване на суб’єктів, що підпадають під закон про кібернетичну безпеку, тобто далеко не лише на державне управління, і ми розібрали, що це означає для компаній — за локальної експлуатації частина ризиків змінюється, але не зникає повністю.

Як ми готуємо власне вимірювання на RTX 3090 і H100

Тут проходить межа між тим, що ми знаємо, і тим, що ще тільки виміряємо. Публічні чеські числа існують. Власне порівняння на нашому апаратному забезпеченні готуємо — і доки воно не буде завершене, жодної таблиці не вигадуватимемо.

RTX 3090 має 24 ГБ VRAM і є доступнішим варіантом для локальної експлуатації. Орієнтовно вона дозволяє працювати з квантизованими моделями приблизно в класі 7–32 мільярдів параметрів; справжню межу визначає поєднання квантизації, довжини контексту, KV cache і runtime. H100 слугує еталонною платформою для більших моделей і варіантів у вищій точності.

На обох платформах ми використаємо той самий тестовий набір:

  1. витягування полів із замовлення в JSON,
  2. класифікація сервісного запиту,
  3. підсумок довшого документа без додавання нових тверджень,
  4. відповідь клієнтові в приписаному тоні,
  5. робота з чеськими назвами, відмінюванням і корпоративною термінологією,
  6. відмова від відповіді, яку не можна підтвердити з підстав.

При кожному запуску ми вимірюватимемо правильність, валідність вихідного формату, наявність вигаданих даних, мовну якість, час відгуку, швидкість генерування та споживання пам’яті. Запишемо точну версію моделі, промпт, налаштування генерування та кількість повторів.

Скільки локальний ШІ коштує і що ви за цю ціну отримаєте

Локальний ШІ не нараховує плату за надісланий токен, але безкоштовним не є. Витрати складають апаратне забезпечення, електрика, сховище, адміністрування, оновлення й головно робота з інтеграції — вона зазвичай є найбільшою статтею і в калькуляціях бракує найчастіше.

RTX 3090 має сенс для пілота чи окремих внутрішніх workflow. H100 — це серверна платформа для вищої продуктивності, більших моделей і більшої кількості одночасних користувачів; для малої компанії володіти нею зазвичай не має економічного сенсу.

Тому рішення ухвалюйте не за ціною GPU, а за завданням:

  • Скільки запитів надійде одночасно?
  • Як швидко користувач має отримати відповідь?
  • Скільки часу сьогодні той процес споживає?
  • Наскільки дорога помилкова відповідь?
  • Чи мусять дані лишитися в корпоративній мережі?

Останнє запитання часто вирішує саме. Докладне порівняння експлуатаційних витрат маємо в статті скільки коштує ШІ для компанії, а розподіл ділянок між хмарою і власною мережею — у тексті ШІ без хмари: які ділянки не сміють піти з мережі.

Як розпізнати якість ще перед купівлею

Підготуйте 20–50 анонімізованих входів із реальної роботи — справжні замовлення, справжні листи, включно з тими заплутаними. Така вибірка статистичної певності не дасть, але повторювані помилки виявить протягом години.

Наперед визначте умови приймання. Конкретно: усі обов’язкові поля заповнені правильно, вихід проходить перевіркою JSON-схеми, модель не додасть суму, якої у вході немає. Без числа, встановленого наперед, результат завжди якось «пояснять».

Пілот відхиліть, якщо постачальник показує лише вдалі приклади, змінює між тестами промпт або не наводить точну версію моделі. Без збережених входів, виходів і конфігурації результат не повторити.

Якщо на це не маєте потужностей чи апаратного забезпечення, цю частину зробимо за вас: візьмемо ваші анонімізовані зразки, запустимо обрані моделі на апаратному забезпеченні, що відповідає задуманому впровадженню, і ще перед пропозицією покажемо вам реальні помилки, швидкість і апаратні вимоги. Результатом є рішення, підкріплене вимірюванням, а не рекомендація моделі за розміром чи популярністю.

Яких ризиків локальна експлуатація не вирішує

Локальна модель обмежує надсилання даних чужому постачальникові. Безпечна система з цього автоматично не виникає.

Ви й далі мусите вирішувати права доступу до документів, логування, резервні копії, оновлення, ліцензію моделі та prompt injection у завантажуваних файлах — тобто ситуацію, коли інструкція, схована в документі, перепише ваше завдання. Модель також може переконливо вигадати помилкову інформацію. Тому для бухгалтерських, юридичних і кадрових виходів лишається необхідною перевірка людиною або тверді валідаційні правила.

А потім є прозаїчний шар: модель працює на апаратному забезпеченні, яке може відмовити. Диск із моделями, індексами та корпоративними документами належить до схеми резервного копіювання так само, як бухгалтерія — правило 3-2-1 діє й для ШІ-інфраструктури.

Коли локальний ШІ має сенс для чеської компанії

Три умови водночас: ви працюєте з чутливими документами, процес повторюваний і якість ви вмієте виміряти. Якщо бракує будь-якої з них, зачекайте.

Для епізодичного писання листів зазвичай дешевшою є готова хмарна послуга. Для регулярного опрацювання внутрішніх документів, які не сміють покинути мережу, власна модель приносить більший контроль і передбачуванішу експлуатацію. Витрати не нараховуються прямо за кожен надісланий токен, але з обсягом можуть зростати вимоги до електрики, місткості та адміністрування.

Найчастіші запитання

Чи є для чеської найкращою модель, натренована прямо чеською?

Не автоматично. BenCzechMark показує, що сильні багатомовні моделі здатні перевершити чеські моделі в низці завдань. Вирішують обсяг і якість тренування, розмір моделі, донавчання на інструкціях і конкретний тип завдання.

Чи достатньо компанії локальної моделі із 7 мільярдами параметрів?

Для класифікації, витягування простих полів або роботи за твердим шаблоном часто так. При складніших міркуваннях, довгих документах і вільному письмі порівняйте її з більшими моделями — різниця виявиться саме там.

Чи погіршить квантизація чеську?

Може вплинути на точність і стабільність виходу, але міра залежить від моделі та методу квантизації. Тестуйте саме той варіант, який хочете експлуатувати — а не результати повної моделі з лідерборду.

Чи є Ollama чеською ШІ-моделлю?

Ні, Ollama — це інструмент для запуску моделей. Якість чеської визначає завантажена модель, її версія, квантизація та спосіб формулювання завдання.

Чи мусимо ми навчати модель на корпоративних даних?

Здебільшого ні. Для роботи з актуальними внутрішніми документами зазвичай доречніший пошук у керованій базі знань і передання знайдених підстав моделі. Донавчання має сенс аж тоді, коли вам потрібно повторювати специфічний стиль чи поведінку і ви маєте до цього якісні тренувальні дані.