Erken erişim programına katıl
Yapay Zeka Agent Pilotları Neden Üretime Geçemiyor: 3 Mod ve Bir Hazırlık Testi
Blog
Sektör19 dk okuma

Yapay Zeka Agent Pilotları Neden Üretime Geçemiyor: 3 Mod ve Bir Hazırlık Testi

DW

Daniel Whitfield

Çözüm Mimarı, Botonom

Pilotları durduran üç başarısızlık modu var ve dışarıdan bakınca üçü de aynı görünüyor. Bir sonrakini finanse etmeden önce hangisinde olduğunuzu ayırt edin.

Pilot çalıştı. Bunun bir benzerini muhtemelen siz de gördünüz: kaydı hâlâ açabilirsiniz, yapay zeka ajanı (agent) talebi okuyor, siparişi çekiyor, cevabı yazıyor ve neredeyse her seferinde doğru yapıyor. Aradan altı ay geçti, iş hâlâ elle yapılıyor ve odadaki hiç kimse bunun hangi hafta önemsizleşmeye başladığını söyleyemiyor.

Yapay zeka agent pilotu nedir, üretim ne demektir?

Yapay zeka agent pilotu, bir agent'ın gerçek bir iş sürecini seçilmiş bir vaka kümesi üzerinde, insan gözetimi altında yürüttüğü ve işi yapıp yapamayacağını ortaya çıkarmak için kurulan sınırlı bir denemedir.

Üretim ise aynı agent'ın aynı işi tam hacimde, kimsenin ayıklamadığı vakalar üzerinde, işi bitirme yetkisiyle ve attığı her adımın izlenen bir kaydıyla yapmasıdır.

Kısa cevap. Yapay zeka agent pilotları genellikle üç nedenden birine takılıyor: süreç, herhangi bir şeyin takip edebileceği kadar net yazılmamıştır; agent'ın işi bitirmesine hiç izin verilmemiştir; ya da insan gözden geçirme adımı gerçek hacimde bir kuyruğa dönüşmüştür. Hangisinin geçerli olduğunu teşhis etmek, araç değiştirmekten daha önemli.

Üretimin dört koşulu var ve dördü birden sağlanmadan pilot üretim sayılmaz:

  1. Gerçek hacim. İş, gerçekte geldiği hızda geliyor, yoğun dönem dahil.
  2. Ayıklanmamış vakalar. Zor olanları kimse agent görmeden önce ayırmıyor.
  3. Bitirme yetkisi. Agent, tanımlı bir aksiyon kümesini son adımı bir insana bırakmadan tamamlıyor.
  4. İzlenen kayıt. Attığı her adım, bir insanın baktığı yerde kayıtlı; pratikte bu, işi dağıtan ve ne olduğunu raporlayan bir gözetim katmanı demek.

Tuzak şu: bir yapay zeka agent pilotu birinci koşulu karşılayıp diğer üçünü karşılamayabilir ve yine de başarılı diye yazılabilir. Gerçek hacimde koştu, her vakayı yine bir insan açtı ve raporlanan rakam tamamlanmış bir sonuç değil, bir verimlilik tahminiydi. Baktığımız duran işlerin çoğu bu şekle sahip.

Bu yazı agent'ın ne olduğunu tanımlamıyor. Çalışan bir demo gördüğünüzü ve şu anki sorunun bir sonraki aşamayı finanse edip etmemek olduğunu varsayıyor.

Yapay zeka agent pilotları neden başarısız oluyor?

Yapay zeka agent pilotları üç nedenden başarısız oluyor ve dışarıdan üçü de aynı görünüyor: proje sessizleşiyor. Üçünün çözümü farklı ve çözümler birbirinin yerine geçmiyor. Asıl iş, hangisinin içinde olduğunuzu adıyla söylemek.

Üçünün ortak yüzü şu: kimse projeyi resmen iptal etmiyor. Bütçe bir sonraki çeyreğe kayıyor, toplantılar seyrekleşiyor ve bir noktada iş yine elle yapılır hale geliyor. On kişilik bir ekipte bunun anlamı, bir kişinin altı ay boyunca yarı zamanlı uğraştığı işin sessizce kaybolması.

Arıza moduGenelde nasıl anlatılırOnu tanıtan belirtiGerçekte neyi çözer
Tanımsız süreç"Agent tutarsızdı"İki deneyimli kişi aynı süreci farklı anlatıyorSüreci yazın: girdiler, karar kuralları, durma kuralları
Esirgenen son mil"Çalıştı ama tasarruf yoktu"Agent'ın uçtan uca bitirdiği tek bir vaka adı söylenemiyorTanımlı bir alt kümede bitirme yetkisi, geri alınamayan aksiyonlarda kapı
Gözden geçirme kuyruğu"Ölçeklendikçe yavaşladı"Kalite duruyor, çevrim süresi kötüleşiyor, devam eden iş birikiyorHer kalemi değil örneklem gözden geçirin, zarara göre kademelendirin, kuyruğu ölçün

Bunu yanlış teşhis etmenin bedeli, aynı yerde ölen ikinci bir yapay zeka agent pilotu. Tanım sorunu olan bir ekip platform değiştiriyor ve dört ay sonra yeni agent'ın tam olarak aynı kararda tutarsız olduğunu görüyor, çünkü o karar ikisi için de hiç yazılmamıştı. Araç değişikliği araç sorunlarını çözer. Yazılmamış bir süreci, esirgenmiş bir son mili veya bir kuyruğu çözmez.

Birinci arıza modu: süreç hiç tanımlanmamıştı

Bu, tanımsız süreç. Yapay zeka agent pilotu, sürecin tek bir deneyimli kişinin kafasındaki sürümüyle çalıştı ve o sürüm hiç yazılmadı. Bir kafada duruyor, kimsenin sayıp dökmediği istisnaları var ve geçen yıl iki kez değişti.

Belirti. İki deneyimli kişi aynı süreci farklı anlatıyor ve ikisi de haklı. Ya da yazılı bir sürüm var, ama asıl önemli karar noktasında "duruma göre" yazıyor ve kimse bu ifadeyi bir kurala açamıyor.

Somut bir örnek: iade sürecinde "müşteri düzenli müşteriyse esnek davranırız" yazıyor. Düzenli müşteri kaç siparişten sonra düzenli sayılıyor, esneklik hangi tutara kadar gidiyor ve kararı kim veriyor? Bu üç soru cevaplanmadan hiçbir agent o adımı tutarlı yürütemez. İşi bugün yapan kişi ise üçünü de kendi tecrübesinden dolduruyor ve doldurduğunu kimseye söylemiyor.

Bir agent bunu yeni işe alınan bir insandan daha hızlı açığa çıkarır; sorunun agent sorunu gibi hissettirmesinin nedeni de bu. Yeni gelen kişi boşluğu önceki işinden getirdiği sağduyuyla doldurur ve boşluğu kimseye söylemez. Agent ya sorar ya tahmin eder, ikisi de kayıtta görünür. Boşluk zaten oradaydı. Yapay zeka agent pilotu onu size gösteren ilk şey oldu.

Çözüm herhangi bir araç kararından önce gelir. İşin ihtiyaç duyduğu girdileri, her karar noktasındaki kuralları ve işin durup bir insana gittiği koşulları yazın. Politika belgesi değil. Tek sayfa, işi yapan kişinin yazdığı ve işi yapan ikinci bir kişinin kontrol ettiği bir sayfa.

Bu, daha iyi dokümantasyon alışkanlığı çağrısı değil. Bu yazıdaki en ucuz teşhis: bir öğleden sonra, bir sayfa ve çıkan anlaşmazlığın kendisi bulgudur.

İkinci arıza modu: agent'ın işi bitirmesine hiç izin verilmedi

Bu, esirgenen son mil. Yapay zeka agent pilotu taslak ya da öneri üretmekle sınırlandı. Vakayı hâlâ bir insan açıyor, bağlamı hâlâ o okuyor, taslağı hâlâ o kontrol ediyor ve son aksiyonu hâlâ o yapıyor. Agent işin ortasını yazıyor, iki ucu insanda kalıyor.

Aritmetiği işletin. Uçtan uca dokuz dakika süren bir vaka düşünün: bağlamı bulup okumak üç dakika, cevabı yazmak dört dakika, kapanış aksiyonlarını yapmak (kaydı güncellemek, göndermek) iki dakika. Taslak modunda insan üç dakikayı da iki dakikayı da ödemeye devam ediyor, üstüne taslağı okuyup kontrol etmek için yaklaşık bir buçuk dakika. Dokuz dakikaya karşılık 6,5 dakika, yani 2,5 dakikalık bir tasarruf, dokuz dakikanın dörtte birinin biraz üstü, üstelik yalnızca taslak doğruysa. Agent'ın tek başına bitirmesine izin verilen alt kümede tasarruf, o vakalarda dokuz dakikanın tamamı.

Belirti. Pilot raporundaki tasarruf kalem başına ve küçük; kimse agent'ın gelişten tamamlanmaya kadar götürdüğü tek bir vaka adı söyleyemiyor.

Çözüm her yere daha çok özerklik vermek değil. Tanımlı bir vaka alt kümesinde bitirme yetkisi vermek, geri alamayacağınız aksiyonlara kapı koymak. Pratikte bu, alt kümeyi pilot başlamadan yazmak ve izinleri ona göre vermek demek; tıpkı herhangi bir rolün neyi yapabileceğini sınırlandırdığınız gibi, her şeyi ya da hiçbir şeyi vermek yerine.

Taslak modunun altıncı aya kadar sürmesinin nedeni genellikle teknik değil. Kimse izni genişletmeye yetkili olduğunu düşünmüyor, kapsamı yazan bir belge yok ve mevcut hal kimseyi rahatsız etmediği için değişmiyor. Bu yüzden çözüm bir model tercihi değil, adı yazılı bir kişinin onayladığı bir liste.

Taslak modu makul bir ilk hafta. Makul olmayan bir altıncı ay.

Üçüncü arıza modu: gözden geçirme adımı kuyruğa dönüştü

Bu, gözden geçirme kuyruğu. Agent'ın ürettiği her kalem bir insana gidiyor ve gözden geçirme hızlı olduğu için kimse maliyetini hesaplamıyor. Kalem başına iki dakika, günde on kalemde yirmi dakika eder; bu hiçbir şey. Günde 240 kalemde 480 dakika eder, yani sekiz saat: bir kişinin başka hiçbir şey yapmadığı tam bir iş günü. Günde 400 kalemde 13 saatten fazla eder, ki bunu tek bir gözden geçiren karşılayamaz.

Asıl şaşırtıcı kısım şu. Kalem başına iki dakikayla çalışan bir gözden geçirenin kapasitesi saatte 30 kalem. Saatte 24 kalem geliyorsa, yani kapasitenin %80'i, kuyruk kısa kalır ve yapay zeka agent pilotu gayet iyi görünür. Saatte 28 kalemde, yani %93'te, gözden geçiren kâğıt üzerinde işten hâlâ hızlıdır, ama kalem başına bekleme birkaç katına çıkar, çünkü işler eşit aralıklarla gelmez.

Bunun altındaki ilişkinin bir adı ve bir tarihi var. John D. C. Little, kuyrukta bekleyen ortalama kalem sayısı, kalemlerin geliş hızı ve her birinin sistemde geçirdiği ortalama süre arasındaki bağı A Proof for the Queuing Formula: L = λW başlıklı çalışmasında kanıtladı; Operations Research, cilt 9, sayı 3, sayfa 383-387, 1961.

Belirti. Kalite metrikleri iyi görünüyor, çevrim süresi kötüleşiyor, devam eden iş birikiyor ve gözden geçirenler gün sonuna doğru toplu işlemeye başlıyor.

Çözüm. Her kalemi değil, bir örneklemi gözden geçirin. Gözden geçirmeyi yanlış bir kalemin verebileceği zarara göre kademelendirin; pahalı vakalar tam kontrolde kalsın, ucuz olanlar örneklensin. Doğruluğu değil, kuyruğu ölçün.

Bu, yalnızca büyük destek organizasyonlarının sorunu değil. On kişilik bir ekipte gözden geçirme genellikle tek bir kişiye, çoğu zaman ekip liderine düşer ve o kişinin günü zaten dolu. Kuyruk o kişinin masasında büyür, kimse kuyruğu ölçmediği için de sorun "agent yavaş" diye raporlanır.

Bir yan etki kendi satırını hak ediyor. Göstermelik gözden geçirme, hiç gözden geçirmemekten kötüdür, çünkü gerçekleşmemiş bir denetimin kaydını üretir.

Yayımlanmış bir yapay zeka başarısızlık oranı gerçek mi, nasıl anlarsınız?

Yapay zeka agent projelerine özgü, izlenebilir bir birincil kaynağı ve açıklanmış bir yöntemi olan yayımlanmış bir başarısızlık oranı yok. Dolaşımdaki rakamlar ya çok daha geniş bir iş kategorisini sayıyor ya da hiçbir kaynağa dayanmıyor. Bu yazı onları tekrar basmıyor.

Dört adımlı geri izleme şöyle işliyor. On dakika sürer ve önünüze konan her rakamda çalışır.

  1. Çalışmanın kendisini bulun, haberini değil. Rakamı, onu üreten belgeyi elinize alana kadar geriye doğru izleyin. İz, başka bir habere atıf yapan bir haberde bitiyorsa o rakamın kaynağı yok.
  2. Neyin sayıldığını okuyun. Üretken yapay zekanın her tür kullanımını kapsayan bir çalışma, agent kurulumlarına dair bir çalışma değildir.
  3. Tarihe ve ölçüm penceresine bakın. Bir yılın yarısında toplanmış ve ön bulgu olarak yayımlanmış bir rakam, o pencerenin fotoğrafıdır, başka bir şey değil.
  4. "Başarısızlık" ne demek, ona bakın. İptal edilmiş, durmuş, çalışıyor ama ölçülebilir bir finansal getirisi görünmüyor ve hiç ölçülmemiş: bunlar dört ayrı bulgu, rutin olarak tek bir rakam gibi aktarılıyor.

Dördüncü adım, bu rakamların çoğunun dağıldığı yer. "Ölçülebilir getiri yok" ile "yapay zeka agent pilotu çalışmadı" aynı iddia değil ve aradaki fark çoğu zaman hikayenin tamamı.

Bu testten geçen bir kaynak neye benzer, somut bir örnek: TÜİK'in Yapay Zeka İstatistikleri, 2025 bülteni (Sayı 57945, 1 Ekim 2025) neyi saydığını, kimde saydığını ve ne zaman saydığını söylüyor. Bültene göre 2025'te 10-49 çalışanı olan girişimlerin %6,6'sı, 50-249 çalışanı olanların %9,6'sı ve 250 ve üzeri çalışanı olanların %24,1'i herhangi bir yapay zeka teknolojisi kullandığını beyan etti. Dikkat edin: bu rakam kullanımı ölçüyor, sonucu değil. İkinci rakamı, yani kaçının işe yaradığını, aynı disiplinle kimse yayımlamıyor.

Kaynağı olmayan bir rakam, hiç rakam olmamasından kötüdür, çünkü başlatması gereken tartışmayı bitirir. Bir analist tahmini kullanacaksanız firmanın adını, tarihi ve "tahmin" kelimesini rakamı söylediğiniz cümlede söyleyin.

Yalnızca taslak üreten pilotlar, yenmelerine hiç izin verilmeyen bir referansa neden yeniliyor?

Çünkü yapay zeka agent pilotunun işin bir kısmını yapmasına izin verildi ve sonra işin tamamıyla karşılaştırıldı. Karşılaştırma baştan adil değildi ve aradaki fark bir yetenek sorunu olarak kaydedildi.

Akıl yürütme hatasını tek satırda söyleyelim: kısmi bir sistemi tam bir sistemle karşılaştırdınız ve farkı kısmi sistemin sınırı olarak yazdınız.

Alternatifine pilot başladıktan sonra değil, başlamadan önce karar verilir. Agent'ın tek başına tamamlayabileceği aksiyonlarla onay için duracak aksiyonları kararlaştırın, iki listeyi de yazın ve pilotu yalnızca o kapsama göre ölçün. Taslak üretmekle sınırlanmış bir pilot, taslak sonucu olarak raporlanmalı ve kaldırmadığı insan süresi aynı tabloda yazmalı.

Adil karşılaştırma şöyle görünür: agent'ın tek başına bitirdiği vakalarda uçtan uca süre ve maliyet, insanın uçtan uca yaptığı aynı tipteki vakalarla karşılaştırılır. Taslakla sınırlı kalan vakalar tabloya ayrı bir satır olarak girer ve orada kazancın küçük olması bir bulgu değil, kapsamın doğrudan sonucudur.

Gelen kutusu triyajı buna iyi bir örnek. Agent gelen mesajı sınıflandırıp doğru kişiye yönlendirebiliyor ama yanıtı gönderemiyorsa, ölçtüğünüz şey sınıflandırma kalitesidir, sürecin süresi değil.

Bitirme yetkisi vermeye karşı en sık duyulan itiraz, agent'ın geri alınamaz bir şey yapacağıdır. Bu bir tasarım sorusu, altı ay taslak modunda kalmanın gerekçesi değil. Hangi aksiyonlar bir insan için durur, hangi eşikte durur ve onayı kim verir: bunu bir kez karar verip yazarsınız, ve bu karar pilot başlamadan önce kendi belgesinde durmalı.

Öğleden Sonra Testi: bir süreci finanse etmeden önce sorulacak 10 soru

Öğleden Sonra Testi, tek bir süreç hakkında tek bir öğleden sonrada cevaplayabileceğiniz on sorudur; bir yapay zeka agent pilotuna bütçe ayırmadan önce koşulur. Bir puanlama modeli değil. Bir eleme.

Adayı dikkatli seçin; seçim işin çoğunu yapar. Etkileyici olanı değil, sıkıcı, yüksek frekanslı ve yanlışının ucuza yakalandığı süreci seçin. Etkileyici olan genellikle doğrulamada düşer, çünkü onu etkileyici yapan şey doğru yargılamanın zor olmasıdır.

Beş ila yirmi kişilik ekiplerde bu tanıma en çok uyan üç iş var: tekrarlayan raporlama, mutabakat ve gelen kutusu triyajı. Üçü de sık koşuyor, üçünün de çıktısına bakınca doğru olup olmadığı anlaşılıyor ve üçünde de yanlış tek bir kalem pahalı değil. Etkileyici olanlar (fiyat kararı, bir şikayette ton kararı) tam tersi: seyrek koşuyor, doğrulaması zor ve yanlışı pahalı.

İki cazip tuzağı baştan adlandıralım. Birincisi genel müdürün şikayet ettiği süreçtir; çoğu zaman tam da belirsiz olduğu için şikayet konusudur. İkincisi sahibi olmayan süreçtir; boşta durmasının nedeni tam olarak kimsenin onu savunmayacak ve onun için izin genişletmeyecek olmasıdır.

#GrupSoruNe "evet" sayılır
1TanımBir kişi bu süreci uçtan uca, tek sayfada yazabiliyor mu?Sayfa var ve bu toplantıdan önce yazılmış
2TanımHer karar noktası kendi koşulunu ve sonucunu adıyla söylüyor mu?Hiçbir dal "duruma göre" ile bitmiyor; yargı gerekiyorsa sayfa kimin yargısı olduğunu yazıyor
3GirdilerAgent, insanın kullandığı her girdiyi okuyabileceği biçimde alıyor mu?Sistemler ve alanlar listelenmiş, alışkanlıkla bakılan ikinci ekran dahil
4GirdilerGirdiler iş başlarken orada mı, sonradan mı toplanıyor?Gerçek bir vaka baştan sona yürütülmüş, her girdinin nereden ve ne zaman geldiği görülmüş
5YetkiAgent'ın tek başına tamamlayabileceği aksiyonların yazılı listesi var mı?Liste niyetleri değil aksiyonları adıyla yazıyor
6YetkiO izinleri verebilecek biri listeyi onayladı mı?Adı yazılı bir kişi; rol değil, komite değil, tedarikçi değil
7DoğrulamaYanlış bir çıktı, üretilebileceğinden daha hızlı fark edilebiliyor mu?Kontrolü ve süresini söyleyebiliyorsunuz; işten uzun sürüyorsa cevap hayır
8DoğrulamaYanlış bir aksiyon geri alınabiliyor mu, kim tarafından, hangi süre içinde?Yetki listesindeki her aksiyonun geri alma yolu ya da kapısı var
9HacimSüreç, bir haftası istisnaları gösterecek kadar sık koşuyor mu?Sistemden çekilmiş haftalık vaka sayısı, tahmin değil
10SahiplikBu süreci bugün sahiplenen, adı yazılı tek bir kişi var mı?Adını söyleyebiliyorsunuz ve o kişi sahiplendiğini biliyor

Puanlama kuralı bir puan değil. Tanım grubundaki veya yetki grubundaki herhangi bir hayır durdurmadır, puan kırma değil. Birinci veya altıncı soruda kalan bir süreç düşük puanlı aday değil, yanlış adaydır ve başka yerlerdeki evetler bunu değiştirmez.

Bir öğleden sonra sürer, çünkü hazırlık değil üç kişi gerektirir: işi bugün yapan kişi, sonuçtan sorumlu olan kişi ve izin verebilen kişi. Bu üçünü iki saatliğine bir odaya toplayamıyorsanız, onuncu soru hakkında daha başlamadan bir şey öğrendiniz demektir.

Öğleden Sonra Testi bir sürecin uygun olup olmadığını söyler, adayları birbiriyle sıralamaz; sıralama, bir çıktının ne kadar hızlı doğrulandığına ve yanlışının ne kadar ucuza geri alındığına bakan ayrı bir iştir.

Bir süreci doğrudan eleyen nedir? Beş durdurma koşulu

Öğleden Sonra Testi'nin geri kalanı ne sonuç verirse versin, beş koşul yapay zeka agent pilotunu hiç başlatmamak anlamına gelir. Bunlar beş durdurma koşulu ve her biri tek başına ölümcül.

  1. Kimse süreci yazamıyor. "Biraz zaman alır" değil. Kimse o sayfayı üretemiyor.
  2. Çıktı, üretilebileceğinden daha hızlı kontrol edilemiyor. Bir kalemi doğrulamak onu yapmaktan pahalıysa, hacim gerçekleşir gerçekleşmez darboğaz gözden geçirme olur.
  3. Yanlış bir aksiyon ne geri alınabiliyor ne de kapıya alınabiliyor. Aksiyon geri alınamazsa ve sürdürmeye razı olduğunuz bir onay adımı yoksa, süreç aday değildir.
  4. Sürecin dokunduğu sistemlerin gerçek bir çağrıyı yürüttüğü kanıtlanmamış. Dokümante edilmiş değil. Bir kişi tarafından, canlı sisteme karşı yürütülmüş ve sonucu size gösterilmiş olmalı.
  5. Agent'ın yetkisini genişletebilecek, adı yazılı bir sahip yok. O kişi olmadan pilot başarılı olur ve orada durur, çünkü kimse bir gösterimi izne çeviremez. O kişi agent'ın yazılı görev tanımında durmalı.

Elemenin ağırlıklı puanı yenmesinin tek bir nedeni var: ağırlıklı puan, ölümcül tek bir koşulu dört rahat koşulun ortalamasında kaybettirir. Doğrulanamayan ama başka her yerde iyi puan alan bir süreç, umut vadeden aday olarak çıkar; oysa değildir.

Dördüncü koşul, herkesin el sallayıp geçtiği koşul. Herhangi bir tedarikçinin entegrasyon listesine kanıt değil iddia muamelesi yapın; buna bizimki de dahil. Kendi yetenek kataloğumuzu denetlediğimizde, listelenen kayıtların çoğunun arkasında çalışır durumda bir servis olmadığını ve kendi keşif aracımızın onları agent'lara hâlâ önerdiğini gördük. Canlı uç noktası olmayan her şeyi gizleyen bir kapı yayımladık. Bir pilotu finanse etmeden önce, yoldaki her sisteme karşı birine gerçek bir çağrı yürüttürün ve sonucu size göstertin.

Kişisel veriye dokunan süreçler için ek bir koşul. Süreç kişisel veri işliyorsa, hazırlık sorusundan önce onay sorusunu cevaplamanız gerekir: hangi veriye kim erişiyor, hangi gerekçeyle erişiyor ve yanlış bir aksiyonun sorumluluğu kimde. Bu, teknik bir sorun değil, yetki ve kayıt tasarımı sorunu; ayrıntısı onay kapıları yazısında.

Bu kaygı Türkiye'de ölçülmüş bir şey. TÜİK'in Yapay Zeka İstatistikleri, 2025 bülteninde, yapay zeka kullanmayan ama kullanmayı düşünen girişimlerin kullanmama nedenleri arasında %74,2 ile uzmanlık eksikliği, %67,4 ile maliyetlerin yüksekliği ve %62,4 ile zarar durumunda sorumluluğun kimde olacağına dair hukuki belirsizlik yer aldı. Sorumluluk sorusu bu listede, teknik nedenlerin hemen yanında duruyor.

Yapay zeka agent pilotunu, çıkan rakam bir şey ifade edecek şekilde nasıl ölçersiniz?

Tamamlanmış sonuçları, kuyruk uzunluğunu ve sonuç başına maliyeti ölçün. Örneklenmiş vakalarda model doğruluğu, toplanması en kolay ve raporlayacağınız en işe yaramaz sayıdır, çünkü işin hiçbir zaman kısıt olmayan kısmını tarif eder.

Dört ölçüm, her biri tek satırlık tanımıyla:

  • İnsan dokunmadan tamamlanma oranı. Agent'ın uçtan uca tek başına bitirdiği vakaların payı.
  • Tepe gözden geçirme kuyruğu uzunluğu. Bir insanı bekleyen en büyük birikim, ortalama günde değil en yoğun günde ölçülür.
  • Yanlış bir çıktının maliyeti. Yanlış bir sonucun düzeltmesi dahil maliyeti, yalnızca işlem maliyeti değil.
  • Tamamlanmış sonuç başına maliyet. Toplam maliyetin, denenen vakalara değil, gerçekten bitirilen sonuçlara bölümü.

Bu dört sayının ikisi bugün muhtemelen hiç ölçülmüyor. Kuyruk uzunluğu için özel bir araca ihtiyacınız yok: bir hafta boyunca günün en yoğun saatinde gözden geçirmeyi bekleyen kalemleri saymak yeterli.

Referans ölçümü yapay zeka agent pilotu başlamadan önce ve aynı hacimde kurun. Sonradan kurulan bir referans ölçüm değil, argümandır ve hangi yöne işaret edeceğini herkes bilir.

Dördüncü ölçüm hakkında: kendi sistemimizde tekrarlayan işlerin tek bir hesap toplamı yerine iş başına maliyet sayacı taşımasının nedeni bu. Bir pilotun tamamlanmış sonuç başına maliyete ihtiyacı var, hesap toplamı ise böyle bir sayı üretemez.

"Koşu hata vermedi" bir ölçüm değildir.

İyi bir pilot raporu kısadır. Dört sayı, bir öncesi, bir sonrası ve ikisinin de alındığı hacim.

Üretime geçen yapay zeka agent pilotları neyi farklı yaptı?

Süreci daralttılar, yetkiyi genişlettiler ve tek bir sahip adlandırdılar. Bunların üçü de erdem değil, gözlemlenebilir davranış.

Daraltmak, vaka tiplerini yarıya indirip en sık gelen ikisini almak gibi görünür. Genişletmek, agent'ın tek başına bitirebileceği aksiyonların yazılı bir listesi gibi görünür ve o listeyi izinleri verebilen kişi onaylamıştır. Sahip adlandırmak, adı kapsam belgesinde yazan ve belgeyi kimseyi toplamadan değiştirebilen bir kişi gibi görünür.

Buradaki daralma, kapsamı küçültmek değil vaka çeşidini azaltmak demek. Yirmi farklı talep tipiyle başlayan bir pilot yirmi ayrı tanım sorunu taşır; en sık gelen ikisiyle başlayan pilot iki tanım sorunu taşır ve ikisi de bir öğleden sonrada çözülür. Yetki genişletmesi de tek seferde olmadı: önce yanlışı en ucuz olan aksiyonlar açıldı, kayıt bir hafta izlendi, sonra bir sonraki aksiyon açıldı.

Dördüncüsü daha az bariz: yapay zeka agent pilotunu seçilmiş vakalarda değil, işleri bozan hacimde koşturdular ve bunu bozulmanın atlatılabildiği kadar erken yaptılar. Yalnızca temiz örnekler görmüş bir pilot test edilmemiştir, prova edilmiştir.

Bir dürüstlük kaydı, dipnotta değil tam burada. Bu, izini sürebildiğimiz anlatılardan ve kendi sistemlerimizi işletmekten çıkan bir örüntü, kontrollü bir çalışma değil. Bir bulgu olarak değil, kendi sürecinize karşı sınayacağınız bir hipotez olarak okuyun.

Yapay zeka agent pilotunuz zaten durduysa ne yapmalısınız?

Hiçbir şeyi değiştirmeden önce üç arıza modundan hangisinde olduğunuzu teşhis edin, çünkü üç çözüm aynı bütçenin birbirini dışlayan kullanımları. Sorun tanım sorunuyken araç değiştirmek, size ikinci bir duran pilot alır.

Karar yolunu sırasıyla yürüyün:

  1. Süreç yazılı mı? Değilse durun ve yazın. Tanımsız sürecin içindesiniz ve bunu hiçbir platform çözmez.
  2. Yazılıysa, agent'ın bitirmesine izin verilen bir şey var mıydı? Yoksa çözüm budur ve bu teknoloji kararı değil, izin kararıdır. Esirgenen son milin içindesiniz.
  3. İzin verildiyse, gözden geçirme kuyruğu hareket etti mi? Hacim arttıkça birikim büyüdüyse çözüm budur. Gözden geçirme kuyruğunun içindesiniz ve cevap daha hızlı bir gözden geçiren değil, örnekleme ve kademelendirme.

Bu üç soruyu tek bir toplantıda cevaplayabilirsiniz ve cevaplar genellikle odadaki kimse için sürpriz olmaz. Sürpriz olan, üç çözümün de aynı bütçeyi istemesi. İkisine aynı anda bütçe ayırmak, ikisini de yarım bırakmanın en yaygın yolu.

Dördüncü bir cevap daha var ve bazen doğru olan o: durmak. Süreç beş durdurma koşulundan birine takılıyorsa iptal doğru sonuçtur ve harcamanın bu noktasında ucuzdur. Bu kararın pahalı sürümü, ikinci yapay zeka agent pilotundan sonra verilenidir.

Son kısmı açıkça söyleyelim. Net bir eleme üreten bir yapay zeka agent pilotu, bir sonuç üretmiştir. Size hangi süreci finanse etmemeniz gerektiğini söyledi; bu, hangisini finanse edeceğinizi bilmekle aynı kategoride bir bilgidir.

Aklınızdaki süreç için tanım ve yetki sorularını cevaplayamıyorsanız, sonucunuz budur ve bu kararın üretebileceği en ucuz sonuçtur. Süreci yazın, agent'ın neyi bitirmesine izin verildiğine karar verin ve Öğleden Sonra Testi'ni haftaya tekrar koşun.

Tek bir süreç yerine bütün operasyonu değerlendirmek isterseniz, AIQ değerlendirmesi bir hazırlık puanı, bir arketip ve boyut kırılımı döndürür.

Sık sorulan sorular

Karar vermeden önce bir yapay zeka agent pilotu ne kadar sürmeli?

Sabit bir hafta sayısı kadar değil, işleri bozan hacme ulaşacak kadar. Yapay zeka agent pilotunu işin tam bir döngüsünden geçirin: yoğun dönem ve insanların normalde etrafından dolaştığı zor vakalar dahil. Yalnızca seçilmiş örnekler görmüş bir pilot size hiçbir şey söylememiştir.

Şirket içinde bir yapay zeka agent pilotunun sahibi kim olmalı?

Süreci bugün sahiplenen, adı yazılı tek bir kişi; komite değil, tedarikçi değil. Yetki kapsamını o belirler, agent'ın tek başına neyi bitirebileceğini o onaylar ve sonucun hesabını o verir. Tek bir sorumlu sahibi olmayan yapay zeka agent pilotları sessizce durur, çünkü kimse agent'ın izinlerini genişletemez.

Bu süreç için agent mı, iş akışı otomasyonu mu kullanmalıyım?

Tek bir soru sorun: adımlardan herhangi biri yapılandırılmamış bir girdiyi okumayı ya da belirsiz bir vakayı yargılamayı gerektiriyor mu? Gerektirmiyorsa kural tabanlı iş akışı otomasyonu daha ucuz ve daha öngörülebilir. Gerektiriyorsa o adım agent'ın, geri kalanı kuralların işi. Gerçek süreçlerin çoğu birini değil ikisini birden ister.

Üretim sistemlerine bağlamadan bir yapay zeka agent pilotu koşturabilir miyiz?

Koşturabilirsiniz, ama sonuç taşınmaz. Dışa aktarılmış veri üzerinde koşan bir pilot, agent'ın iş hakkında akıl yürütebildiğini kanıtlar, işi gerçekten yapabildiğini değil. Yaygınlaştırmayı durduran arızalar bağlantılarda yaşar: izinler, hız sınırları, bayatlamış kayıtlar. Pilottan önce, yoldaki her sisteme karşı gerçek bir çağrının yürüdüğünü kanıtlayın.

Yapay zeka agent pilotumuz başarılı oldu ama kimse yaygınlaştırmayı onaylamıyor. Neden?

Genellikle pilot yeteneği kanıtladığı, yaygınlaştırma ise yetki gerektirdiği ve odada bunu verebilecek kimse olmadığı için. Agent'ın izinlerini genişletebilecek kişiyi bulun ve ona ihtiyacı olanı verin: agent'ın tek başına bitireceği aksiyonların listesi ve bunlardan biri yanlış olduğunda ne olacağı.

AI çalışanlarınız işe başlamaya hazırSiz işe almaya hazır mısınız?

Kredi kartı gerekmez5 dakikada kurulumİstediğiniz zaman iptal