Към съдържанието

Стратегия

Защо повечето GenAI пилоти не връщат нищо измеримо

MIT NANDA откри, че ~95% от GenAI пилотите нямат измерим ефект върху P&L. Какво мери изследването, какво не може да покаже и как се пише критерий за спиране.

Публикувано
Четене
8 мин
Стъпва на
Публикувани изследвания — MIT Project NANDA 2025, Gartner, Евростат — плюс собствения ни метод за гейтване на портфолиото

Числото е на всеки слайд от август 2025 г. насам: около 95% от GenAI пилотите не произвеждат измерима възвръщаемост. Цитира се като присъда над технологията. Не е. Присъда е над начина, по който пилотите са били подготвени да бъдат съдени — а корекцията е един абзац написан текст, който почти никой не произвежда, преди разработката да е тръгнала.

Изследването твърди по-малко от заглавието и нещо по-полезно

Източникът е The GenAI Divide: State of AI in Business 2025 на MIT Project NANDA: 52 структурирани интервюта, анкета сред 153 ръководители и преглед на над 300 публични внедрявания. Това е целева, а не случайна извадка, а „няма измерим ефект върху P&L“ в повечето случаи е самооценка на организации, които никога не са установили базова линия, спрямо която да мерят.

Прочетено стриктно, откритието е, че около 95% от организациите не са успели да произведат число. Това е различно твърдение от „95% не са произвели стойност“ и изследването не може да раздели двете. То е и напречно във времето: снима популация, чиито пилоти в мнозинството си са на по-малко от година — етап, на който честният отговор на „какво върна това?“ често е „твърде рано е“.

Задръжте разграничението и по-интересните резултати се оказват другаде в същите данни. Фунията за специализирани GenAI инструменти в предприятията върви около 60% проучени, около 20% пилотирани, около 5% успешно внедрени. Но генеричните чатбот инструменти минават от пилот към внедряване в около 83% от случаите. Сривът е концентриран в custom и вендорските корпоративни системи, не в езиковите модели като такива. Каквото се чупи, се чупи в точката, в която моделът среща system of record и собственик на процес.

Още две числа оцеляват след възраженията към извадката, защото са сравнителни — двете рамена са мерени по един и същи начин. Пилотите през външно партньорство стигат до внедряване в около 67% от случаите срещу около 33% при вътрешните разработки, а употребата от служителите е близо двойна при външно изградените инструменти. И около половината от GenAI бюджета отива в продажби и маркетинг, където атрибуцията е лесна, докато най-големите документирани икономии в извадката са в back office: 2–10 млн. долара годишно от премахване на BPO, 30% спад в разходите за външни агенции, около 1 млн. долара годишно от аутсорснати проверки по риск мениджмънт.

Бюджетът е следвал измеримостта, а не изплащането. Това, а не 95-те процента, е находката, по която си струва да се действа.

Пилотите рядко се провалят. Просто спират да се споменават.

Прогнозата на Gartner от юни 2025 г. е, че над 40% от проектите с agentic AI ще бъдат отменени до края на 2027 г. — заради ескалиращи разходи, неясна бизнес стойност и недостатъчен контрол върху риска. Отмяната е това, което се случва, когато свърши бюджетен цикъл. Идва късно, идва в удобния за спонсора момент и не учи организацията на нищо, защото дотогава никой не може да възстанови срещу какво изобщо е трябвало да се мери пилотът.

Написаният критерий за спиране се различава в едно отношение, което носи цялата тежест: има дата. Превръща „това работи ли?“ от преценка — на която човекът, поръчал работата, винаги отговаря оптимистично — в справка.

Критерият за спиране е шест конкретни неща, а повечето написани имат две

Тези, които виждаме на практика, съдържат метрика и надежда. Критерий, който наистина може да сработи, съдържа:

  1. Метрика на ниво единица работа — цена за успешно изпълнена задача, за разрешен тикет, за обработена фактура, за изготвен документ. Цената на токен е вход, не KPI.
  2. Базова линия, измерена преди разработката, с фиксиран в писмен вид метод на измерване. Извадка от process mining или двуседмично измерване на времето; никога оценка на мениджър и никога преизмерване с друг инструмент след това.
  3. Праг с посока и допуск — числото, при което пилотът продължава, се преработва или спира.
  4. Прозорец на измерване и календарна дата, фиксирани преди да е видян първият резултат.
  5. Популация, включително контролна група, която не получава инструмента. Без контрафакт не можете да отделите модела от сезонността.
  6. Поименен подписал. Не комисия.

Където има установени стойности, ползвайте ги. Адопция под 30% от лицензираните места е провален rollout независимо от качеството на модела; здравата устойчива адопция е над 60%. При RAG система recall@5 под 80% прави работата по качеството на генерацията безсмислена, защото по-голямата част от това, което се докладва като халюцинация, е провал на retrieval-а. Праговете за groundedness върху golden set обикновено стоят между 90% и 97% според рисковото ниво. Това са release gates. Критерият за спиране стои над тях, върху бизнес метриката — система може да мине през всеки release gate и пак да си струва да бъде изключена.

Ние самите сгрешихме това по най-лесния за грешене начин. Първият ни написан критерий беше дефиниран върху точност спрямо golden dataset: прецизен, опровержим и наш. Мереше нещо, което ние контролираме, и щеше да мине комфортно, докато инструментът стои неотворен. Критерий върху метрика, която доставчикът притежава, не може да сработи. Единственият ни проект, чието число издържа на въпроси после, е автоматизацията на имейл маркетинга за козметична марка — около -60% време за подготовка на изходящата комуникация, измерено от клиента — и то само защото времето преди това беше записано.

Подписът е механизмът, а не церемонията

Подписалият е собственикът на процеса, чиято опашка, щат или cycle time реално се променя — не изпълнителният спонсор, одобрил бюджета, не IT и не доставчикът.

Стимулът на спонсора е продължаването; спонсор, който спира проект, докладва нагоре собственото си погрешно разпределение на средства. Стимулът на собственика на процеса върви в обратната посока, а и по-практично: само той може да изпълни връщането назад, защото връщането е промяна в начина, по който екипът му работи в понеделник сутрин.

Ако никой в организацията не иска да сложи името си под прага, самият отказ е резултатът от гейта. Означава, че на нивото, където работата се случва, в стойностната обосновка никога не е било повярвано.

В деня, в който сработи, не тръгвате от нула

„Изключено“ трябва да бъде изпробвано, преди да потрябва. Измерете средното време за връщане към предишния ръчен процес, докато пилотът е още здрав — план за rollback, който никога не е бил изпълняван, е абзац, а не способност.

Пазете логовете. Член 26, параграф 6 от AI Act задължава внедрителите да съхраняват автоматично генерираните логове поне шест месеца, а извеждане от експлоатация, което сваля средата същия следобед, унищожава доказателства, които сте длъжни да държите. Неприлагането не е освобождаване от отговорност: към януари 2026 г. България няма определен орган за надзор на пазара и няма национален санкционен режим, а задължението възниква независимо от това.

После запишете кое от шестте условия е паднало и направете инвентаризация на оцелялото. Golden dataset-ът, етикетиран от вашите собствени експерти по темата, оцелява. Таксономията на изключенията — няколкостотин реални случая, кодирани по причина — оцелява и обикновено е най-ценният артефакт от целия пилот, защото в документоемкия back office голяма част от изключенията се оказват проблеми с данните нагоре по веригата (грешна референция към поръчка, липсващи master data), които никой модел не е щял да поправи. Работата по интеграциите и правата за достъп оцелява. Измерената базова линия оцелява и тя прави следващия опит по-евтин.

Портфолио с 0% спрени кандидати има декоративни гейтове. Здравото отсява 30–50% преди разработка. Питайте всеки консултант — нас включително — кои са последните три случая на употреба, срещу които е препоръчал. Консултант, който не може да назове нито един, не гейтва нищо.

Къде това спира да важи

Критерият за спиране е инструмент за случаи с ефективност и изброима единица работа. Стои зле върху залози за нова способност, върху работа, водена от регулаторно съответствие, при която няма алтернатива по избор, и върху всичко, при което контрафактът наистина не може да бъде изолиран. Да наложите фалшив праг върху тях е по-лошо от това да признаете, че се финансират по преценка.

Прозорците трябва да отговарят и на вашия собствен темп. Най-добрите средни по размер компании в извадката на NANDA минават от пилот до пълно внедряване за около 90 дни; големите предприятия отнемат девет месеца и повече. Критерий от 60 дни в организация с деветмесечен цикъл не налага дисциплина — той убива неща, преди да се разчисти интеграционният дълг, и правилният отговор е да поправите cycle time-а, а не прага.

И нищо от това не замества неблагодарната част. Данните на Евростат за 2025 г. поставят използването на AI в българските предприятия на 8,55% срещу 19,95% средно за ЕС. Разликата няма да се затвори, защото някой е написал по-добър гейт. Затваря се, когато първият случай на употреба бъде измерен спрямо нещо — и измерването е било договорено, преди някой да е видял резултата.

Абстрактна топла светлина върху тъмен фон

Това ли е проблемът, с който живеете?

Ако този текст описва вашата ситуация, най-бързата следваща стъпка е разговор с човека, който го е написал.

30 минути, без ангажимент, а каквото стигнем, остава при вас.