Kāpēc AI izmēģinājumi izgāžas: 95 % nedod neko — un kur atdeve tiešām ir
Kāpēc AI izmēģinājumi izgāžas, ir labi dokumentēts. Kur atdeve tiešām atrodas un kā izvēlēties pirmo projektu, kas sevi pierāda viena ceturkšņa laikā.
Lielākā daļa AI izmēģinājumu izgāžas tāpēc, ka darbs izvēlēts slikti un nekad nav mērīts — ne tāpēc, ka modeļi būtu vāji. MIT Project NANDA pārskatīja ieviešanu uzņēmumos un atrada, ka aptuveni 95 % ģeneratīvā AI izmēģinājumu nedeva izmērāmu atdevi pret 30 līdz 40 miljardu dolāru ieguldījumu. Tas pats pētījums lielāko atdevi atrada aizmugures procesos, kamēr 50 līdz 70 % budžetu aizgāja pārdošanā un mārketingā, kur atdeve bija viszemākā.
Kāpēc lielākā daļa AI izmēģinājumu izgāžas?
Tie izgāžas uz piemērotības un mērīšanas, ne uz gudrības. MIT ziņojuma diagnoze ir, ka rīki „nepielāgojas, nepatur atgriezenisko saiti un neiederas ikdienas darba plūsmās" — spējas bija pietiekamas, integrācija nebija.
Skaitļi, ko vērts paņemt līdzi uz sanāksmi:
- 95 % izmēģinājumu nedeva izmērāmu atdevi; vairāk nekā 300 atklātas iniciatīvas, 52 intervijas un 153 vadītāju aptaujas — MIT Project NANDA, 2025
- 50–70 % AI budžetu aizgāja pārdošanas un mārketinga izmēģinājumos, kur atdeve bija viszemākā — tas pats pētījums
- Aizmugures procesu automatizācija deva lielāko atdevi, samazinot apstrādes, salīdzināšanas un ārpakalpojumu izmaksas — tas pats pētījums
Izlasiet definīciju, pirms reaģējat uz virsrakstu. Panākumi nozīmēja tikt garām izmēģinājuma stadijai ar izmērāmiem rezultātiem pēc pusgada. Tā ir prasīga latiņa, un daļa analītiķu iebilst, ka tā nepamana vērtību, kas nekad nekļūst par rādītāju. Tā ir arī tā latiņa, ko lietos jūsu finanšu direktors.
No kurienes atdeve tiešām nāk?
No atkārtota aizmugures darba, un tam ir strukturāls iemesls. Pārdošanas un mārketinga izmēģinājumus ir viegli sākt un gandrīz neiespējami novērtēt. Ģenerēta vēstuļu virkne sanāksmē izskatās iespaidīgi; pēc pusgada neviens vairs nespēj atdalīt tās ietekmi no sezonalitātes, cenu izmaiņām vai jauna darbinieka. Izmēģinājums nevar skaidri izgāzties, tāpēc tas nevar arī skaidri izdoties.
Aizmugures darbs ir pretējs. Tas ir atkārtots, seko jau esošai procedūrai, lieto zināmus avotus, un tam parasti ir pareiza atbilde. Automatizējot daļu no tā, var izmērīt „pirms" un „pēc", jo „pirms" jau tika mērīts — stundās, kļūdās, tajā, cik vēlu atskaite aizgāja.
Vai liels iznākums ir tas pats, kas rezultāts?
Nē, un tieši šo divu jaukšana ir veids, kā izmēģinājumi mēnešiem ražo darbību bez vērtības. Carnegie Mellon pētnieki apkalpoja simulētu programmatūras uzņēmumu tikai ar AI aģentiem un atrada, ka tie cīnās ar pamata biroja uzdevumiem. Vienā plaši apspriestā demonstrācijā pārlūka aģents 40 minūtēs pieteicās uz 100 darba vietām un ieguva nulle interviju.
Jautājums nekad nav, cik daudz sistēma saražoja. Jautājums ir, cik daudz pabeigta darba aizgāja ārā, cilvēkam to nepārtaisot — atšķirība, kas aprakstīta rakstā laika ietaupījums, ko apēd pārbaudīšana.
Kas vajadzīgs izmērāmam AI izmēģinājumam?
Sešas lietas, nofiksētas pirms kaut kā būvēšanas:
Viens atkārtots process. Ne kategorija — viens process. „Piegādātāju rēķinu salīdzināšana" ir izmēģinājums. „Finanses" nav.
Viens īpašnieks. Nosaukts cilvēks, kurš jau atbild par iznākumu un var pateikt, vai rezultāts ir pieņemams.
Noteikti avoti. Kuri faili, kura pastkaste, kura sistēma, kuri lauki. Ja atbilde ir „atkarīgs no tā, kurš to tajā nedēļā dara", jūs esat atradis kaut ko, kas jāsalabo pirms jebkāda AI.
Sākuma mērījums. Cik ilgi tas prasa tagad, cik bieži tas kavējas, cik bieži tas ir nepareizs. Nomēriet to dažus ciklus vispirms. To gandrīz neviens nedara, tāpēc gandrīz neviens pēc tam nevar pierādīt rezultātu.
„Pabeigts" definīcija. Dokuments īstajā veidnē, avoti nosaukti, izņēmumi atzīmēti. Ja cilvēkam tas vēl jāsaliek kopā, ietaupījums pārcelsies, nevis parādīsies.
Apstiprinājuma punkts. Izlemiet iepriekš, kuru soli cilvēkam jāparaksta — parasti pirmo neatgriezenisko.
Tieši šeit rīki vai nu palīdz, vai traucē. Kvantia Harness ir uzdevumu un kontroles slānis starp jūsu komandu un AI darbinieku uz datora, kas ir jūsu uzņēmuma kontrolē: spējas pēc noklusējuma ir izslēgtas, neatgriezeniskas darbības gaida cilvēku, pieejas dati paliek ārpus modeļa konteksta, un katra darbība un avots tiek pierakstīti. Tieši pēdējā īpašība padara izmēģinājumu vispār novērtējamu — uz jautājumu „vai tas nostrādāja" var atbildēt no izpildes pieraksta, ne no viedokļa. Kā tas strādā izved rutīnu no sākuma līdz galam.
Kuri jautājumi beidz izmēģinājumu agri?
Trīs — un agri ir vislētākais brīdis izmēģinājumam beigties.
Vai process ir pierakstīts, vai tas dzīvo viena cilvēka galvā? Ja tas ir galvā, projekta pirmais iznākums ir dokumentācija — vērtīga, bet vēl ne AI projekts.
Vai avota skaitļi ir uzticami? Automatizācija liek sliktiem ievaddatiem ceļot ātrāk un izskatīties oficiālāk.
Vai jūs ļautu to darīt jaunam darbiniekam pirmajā nedēļā, ar pārbaudi? Ja nē, iemesls parasti ir, ka sekas ir smagas un pārbaudes ir neformālas. Tas ir signāls automatizēt sagatavošanu un paturēt lēmumu.
Kas paliek jūsu īsajā sarakstā?
Regulārais, procedurālais, pārbaudāmais darbs, kam jau ir īpašnieks un termiņš: nedēļas vadības pakete, reģistrs, kam jāsakrīt ar avota sistēmu, salīdzināšana, ko neviens nemīl, turpinājumi, kas līdz ceturtdienai vienmēr kavējas.
Šis darbs ir garlaicīgs, un tieši tāpēc tas der. Garlaicīgs nozīmē atkārtots, atkārtots nozīmē izmērāms, un izmērāms nozīmē, ka divu mēnešu laikā zināsiet, vai bija vērts — tieši to 95 % izmēģinājumu nespēja pateikt. Par pašu atlases pārbaudi skatiet kurus uzdevumus automatizēt vispirms.