Megbízható a mesterséges intelligencia?

Megbízható a mesterséges intelligencia? [Videó és kvíz]

Rövid válasz: A mesterséges intelligencia, mint tulajdonság, nem megbízható: függ a feladattól, a visszakeresési ciklustól és attól, hogy az ember még mindig a horogra van-e kötve. Az üzemidő az, hogy a végpont válaszolt-e; az igazságtartalom az, hogy a válasz igen volt-e. Használd, ha a hiba olcsó vagy elkapható; lassíts, ha a hiba drága.

Főbb tanulságok:

Felelősségre vonhatóság: Nevezze meg, kik vizsgálják felül, ki állíthatja meg, és ki a felelős.

Átláthatóság: Vizsgáld meg a visszakeresett adatrészletet, különben még mindig ködben leszel.

Auditálhatóság: Naplózza a promptokat, a lekért adatcsomagokat és az elküldött üzeneteket, hogy a hibák nyomon követhetők legyenek.

Visszaélés-ellenállás: Pénzügyi kérdésekben kudarcot vallunk; soha ne találjunk ki számokat, ablakokat vagy szabályokat.

Szemléltető eredmények: Egy 20 kérdéses szemléltető tesztet térképként kezelj, ne 95%-os bizonyításként.

Megbízható a mesterséges intelligencia? Infografika

Cikkek, amiket esetleg ezután érdemes elolvasnod:

🔗 Hogyan használjuk a mesterséges intelligenciát a mindennapi életben?
Fedezd fel a gyakorlati módszereket, amelyekkel a mesterséges intelligencia leegyszerűsítheti a mindennapi feladatokat és rutinokat.

🔗 Hogyan használjuk a mesterséges intelligenciát a munkahelyen?
Tanulj meg gyakorlati módszereket a termelékenység és a hatékonyság növelésére a mesterséges intelligencia segítségével.

🔗 Képes-e a mesterséges intelligencia önállóan gondolkodni?
Fedezd fel, hogy a mesterséges intelligencia valóban képes-e önállóan gondolkodni és érvelni.

🔗 Milyen típusú mesterséges intelligenciák léteznek?
Ismerd meg a főbb mesterséges intelligencia típusokat, képességeket és a legfontosabb különbségeket.

Mit jelent a „megbízható”, amikor a gép egy statisztikai papagáj?

A megbízhatóság a mindennapi beszédben azt jelenti, hogy valamire támaszkodhatunk.

A beszélő automatizálással egy halom különböző tulajdonság rejtőzik egyetlen szó alatt. Tényszerűség. Konzisztencia. Kalibráció – hogy a modell megbízhatósága megegyezik-e a helyesség valószínűségével, vagy csak... biztosnak hangzik. Biztonság. Üzemidő. Azonnali érzékenység. Viselkedés szélső esetekben. Viselkedés az eloszlásváltás után, amikor az élő világ nem a betanító világ. Ezek közül egyik sem vall kudarcot együtt. Ez az a rész, amit az emberek kihagynak.

Egy chatbot egész héten „érintetlen” lehet, és kedd délután még mindig tévedhet. Egy kódoló másodpilóta jól elboldogulhat a sablonos megoldásokkal, majd hallucinálhat egy API-t, ami pontosan úgy néz ki, mint az eredeti. Az emberek a „junior kolléga” metaforát keresik. Ez egy tökéletlen metafora – a juniorok zavarba jönnek –, de közelebb áll a „jóslás” metaforájához.

Az élő teszt megbízható a „mi”, a „kinek”és a „melyik” kategóriákban. Egyébként egy turmixgépet az alapján osztályozol, hogy megfelel-e az adózási követelményeknek.

Az üzemidő nem az igazmondás – két különböző „megbízhatóság”

Az ops-emberek és az igazságszerető emberek ugyanazt a szót használják, és elbeszélnek egymás mellett.

Az üzemidő a „végpont válaszát adta-e”. Az igazmondás a „szó szerint volt a válasz”. Az irányítás mindkettőre törekszik, és a modellkockázat a csúnya résben helyezkedik el. Lehet egy szolgáltatásod, ami soha nem pislog, és mégis folyékonyan hazugságokat küldhetsz az ügyféljegyekbe. Megbízható az SRE értelmében. Nem megbízható a „kérlek, ne találj ki visszatérítési szabályzatot” értelmében.

Gondolom, ez leírva is nyilvánvaló. Délután 4-kor már nem egyértelmű, amikor a válasz gyors, és a sor hatalmas. A gyorsaság a kompetencia jele. Régen a lassúság azt jelentette, hogy valaki gondolkodik. Most a gyorsaság annak a jele, hogy senki sem gondolkodik.

A biztonság egy újabb tengely. Egy olyan modell, amely ellenáll egy csúnya jailbreaknek, biztonsági szempontból "megbízható", és mégis összezavarhatja a saját jegyzeteid összefoglalását.

A gördülékeny és helytelen szókimondás rosszabb, mint az ügyetlen és őszinte

Ez az önbizalom problémája, és ez az, ami fáj.

A pontosság és a folyékonyság elvált egymástól, és a folyékonyság tartotta a latban a dominanciát. Egy LLM fokozat ritmust ad, a megfelelő helyeken kitérő mondatokat, talán egy hamis, de szép idézetformát. Az agyad azt olvassa, hogy "ez a személy tudja". Csakhogy nem egy személyről van szó, és a kalibráció gyakran szörnyű - nagy magabiztosság, közepes igazság, úgy előadva, mint egy vitaindító előadást.

Egy ügyetlen rossz válasz gyanakvóvá tesz. Egy gördülékeny rossz válasz miatt abbahagyod az ellenőrzést. Ez nem kis különbség; ez az egész történet egyetlen kissé csúnya mondatban.

Az elfogultság is jelen van, nem mindig rágalmazásként, inkább alapértelmezettként arról, hogy kik vannak a szobában, és az angol melyik változata számít semlegesnek. Az embereket becsapják, mert a nyelv a legrégebbi bizalmi interfészünk. Ha úgy beszél, mint egy ügyirat, akkor mi is úgy bánunk vele. Folyton cinikusabb akarok lenni ezzel kapcsolatban. Aztán elolvasok egy tiszta összefoglalót, és leesik a vállam. Amikor belépek egy megbeszélésre, az összefoglaló késznek tűnik. Ez a mondat túl sok munkát végez, és mégis: így kerül a hiba a pakliba.

Megbízhatóság helyzettől, nem márkától függően

A márkák csak figyelemelterelők. Az összehasonlítás a lényeg. A viták vitatkozni fognak egymással. Ez rendben van.

Használati eset Hogyan hajlamos kudarcot vallani Amikor „elég jó” Amit az embernek még meg kell tennie Miért hagyják magukat becsapni az emberektől?
Fogalmazás / összefoglalás Elveti a kivételt; egy talán-ból kötelezővé fejleszt Első lépésként küldj egy szöveget, amit már ismersz Ellenőrizd a neveket, számokat, a sort, ami fájna Úgy hangzik, mint te. Küldd el.
Keresés-szerű kérdések és válaszok Ködös válaszok; a majdnem baleset utáni mentés tényként van leírva Tájékozódás, nem az utolsó szó Nyisd meg a forrást, különben csak megérzéseid vannak Ugyanaz a hangvétel a visszaszerzett és a feltalált szavakhoz
Kódsegítség Kitalált API-k; a hibát állító tesztek Boilermake, ragasztó, "magyarázd el ezt a hibát" Futtasd le. Olvasd el a különbséget. (Prédikátor sor, bocsánat.) Ház stílus. Zöld kinézetű tesztek.
Ügyfélszolgálat Kitalált politika; az udvarias, rossz nem Szigorú szabályzaton belüli tervezetek Birtokold a pénzküldést és a bizalmat Gyors + kedves. Senki sem ellenőrzi az ötödik üzenetet.
Orvosi/jogi tanácsadás Folyékony, strukturált, katasztrofálisan biztos Szinte soha nem termékként Légy profi. A modell csak egy tuskó. Ha ez keményen hangzik, rendben. Úgy beszél, mint egy rövid összefoglaló.
Pontozás / rangsorolás Proxy funkciók; sodródás; süllyesztett élű esetek Felülírandó triázs A farok szúrópróbaszerű ellenőrzése A számok felnőttesnek érződnek. Az irányítópultok irányításnak tűnnek. Önmagukban nem azok.
Képgenerálás Kezek, plusz könyökök, sztereotípia-maradványok Hangulattáblák, eldobható komplett könyvek – nem bizonyítékok Nézd meg kétszer, hogy mi is a lényeg, nem csak a tárgyak Pretty elhallgattatja a szkeptikus részt
Autonóm ügynökök Magabiztos szerszámhívás; hibák, amelyek halmozódnak Keskeny hurkok kill switch kapcsolóval Maradj a horgon. Zárd le, amit elérhet. Egy számozott terv kompetenciának tűnik. Gyakran egy teendőlista egy motorral.

Mindenesetre. Ha a kedvenc eszközöd ügyesen tud vázlatokat készíteni, és azon kapod magad, hogy éjfélkor jogilag is megfelelő kényelmet kérsz tőle, az nem fejlesztés. Az a térkép, amely szerint elhagytad.

Hallucinációk, sodródás és a csendes fajta tévedés

A hallucináció azért kerül a címlapokra, mert pikáns: egy könyv, ami nem létezik, egy soha nem leszállított funkció, egy hivatalosnak tűnő számú szabályzati záradék.

A sodródás kevésbé filmszerű. A világ mozog. A modell maradványai megmaradnak. Felteszel egy kérdést, ami friss kontextust igényel, és jól megszerkesztett választ kapsz a korábbi időjárásból. Majdnem azt írtam, hogy "egy másik korszakból", ami a téma által kiváltott túlzás. Ez nem egy másik korszak. Egyszerűen nem most van.

A csendes tévedés az, ami jobban érdekel. Egy összefoglalás, ami elhagyja a kivételt. Egy parafrázis, ami a talánt kötelezővé teszi. A tényszerűség lehet „technikailag rendben”, miközben a jelentés elhalványult.

A gyors érzékenység csak ront a helyzeten. Változtasd meg a csomagolást, és a "tények" csillogni fognak. Kérdezz szkeptikusként, szerezz fedezéket. Kérdezz sietve főnökként, és túlzásba ess. Ha az értékelésed csak egyetlen kosztümöt használ, az értékelésed egy kicsit hazugság. Bocsánat.

A börtönszökések a szakadék szélén állnak, és én nem akarok rablófilmet. Ha egy rendszert rá lehet beszélni a modorának feladására, a megbízhatóság nem csak az igazságról szól; arról is, hogy a korlát hurok vagy plakát-e.

Edzésmaradékok, elavult tudás, és miért nem varázspálca a földelés

A generatív modelleket egy heap-en (kupacon) képezik, majd a keddünkre mutatnak. A visszakeresés (retriery) a felnőtt kísérlet arra, hogy a jelent erre a heap-re rögzítsük. A földelés azt jelenti, hogy "innen adjunk választ, ne a ködből". Amikor kudarcot vall, akkor udvariasan kudarcot vall.

Klasszikus hiba: a visszakereső egy majdnem sikerült dokumentumot talál. A generátor teljes nyugalommal átnézi. Látsz egy forrás alakú objektumot, és az ellenőrző ösztönöd kikapcsol. Én ezt csinálom. Te is valószínűleg ezt csinálod. A hivatkozási ötlet jó; a megvalósítás csak annyira jó, mint a találat.

Az elavult tudás a másik szivárgási pont. Egyes feladatok élő állapotot igényelnek – árak, készlet, egy szabályzat aktuális megfogalmazása. Mások stabil szakértelmet igényelnek, például egy feljegyzés strukturálása. Ezeket összekeverve egy nagyon biztos választ kapsz egy olyan világról, amely már meg is változott. Az eloszlás eltolódása a felnőtt elnevezés: az élő eloszlás nem a betanítási eloszlás, és a szélső esetek a résben élnek.

Még valami, rossz helyre tett kötőjellel jegyezve, mert így néznek ki a jegyzeteim: a földelés egy padló - nem egy glória. Ha nem tudod megvizsgálni a visszaszerzett darabot, akkor még mindig ködben vagy, csak jobb a megvilágítás.

Értékelő színház: miért szörnyű teszt egy demó?

A demók villámgyorsak. A benchmarkok kicsit őszintébbek, de még mindig nem a te dolgod.

Egy letisztult prompt és egy olyan feladat, aminek a modell ezernyi unokatestvérét látta már – persze, hogy jól néz ki. Az értékelés, ami csak ezt méri, egy színpadi darab mérése. Az élő munkafolyamatokban kusza a beillesztés, hiányzó fájlok és egy felhasználó, aki elfogadja az első választ, csökkenti a szorongását.

A benchmarkok számítanak. Csak nem olyan jól terjednek, mint ahogy a paklik állítják. A ranglista pontszáma nem a jegyeid kalibrálása. Egy vállalatnál a modellkockázat azt jelenti, hogy „mi történik, ha valami nagy mennyiségben hibás”, nem azt, hogy „átment-e egy kvízkérdésen”. A szükséges tesztek szárazak: maradj a visszakeresett szövegrészen belül; jelezd a bizonytalanságot blöffölés helyett; maradj következetes az átfogalmazáskor; inkább zárd le a hibát (utasítsd el, kérdezd meg, halaszd el), mintsem zárd le a hibát (találj ki).

Láttam már embereket, akik egyetlen lenyűgöző befejezést is bizonyítéknak tekintenek. Ez olyan, mintha egy éttermet azért "megbízhatónak" minősítenének, mert az előétel szép volt. Talán az is. Talán a konyhának volt jó tíz perce.

Egy kis ellentmondás: Még mindig használok demókat, hogy képet kapjak. Csak nem bérelem fel az érzést.

Megbízható a mesterséges intelligencia? Csak akkor, ha valaki még mindig szorult helyzetben van

Az ember által vezérelt áramkör az egyetlen olyan kialakítás, amely megfelel a hibamódoknak.

Ha senki sem felelős, a rendszert úgy fogják használni, mintha az lenne. Az irányítás a „ki vizsgálja felül, ki állíthatja meg, mi kerül naplózásra, mi történik egy hiba után” kifejezések unalmas elnevezése. Az ügynökök élesebbé teszik ezt, mert intézkedéseket is végrehajtanak, nem csak bekezdéseket. Egy olyan vázlat, amit nem küldtél el, olcsó. Egy olyan eszközhívás, amire nem gondoltál, nem az.

Nevezd meg, ki a hibás. Ha a válasz „a modell”, akkor nincs válaszod. A modellek nem mennek el a megbeszélésre az incidens után. Vagy egy személy, vagy egy porszívó, majd egy ügyvéd.

Válaszd ki a robbanási sugárnak megfelelő ellenőrzéseket. Helyesírás-ellenőrző szintű értékelés egy közösségi poszthoz. Forrás-ellenőrzés mindenhez, ami tényt állít. Szakértő mindenhez, ami az orvostudományhoz, joghoz, hitelhez, biztonságkritikus műveletekhez kapcsolódik. Ezeknél az ember nincs "a ciklusban". Az ember a ciklus. A modell egy csonk. Ez nem személyiség-szkepticizmus. Ez ízlés kérdése.

Mostanában az a divat, hogy a csekket egy csillogó küldés gomb mögé rejtik. Manapság így lehet véletlenül automatizálni egy pletykát. Az utóbbi időben már kevésbé vagyok oda ezért, és a munkám is jobb lett.

Hogyan kérdezz úgy, hogy észrevedd a hibát?

Ezeket a rendszereket lekérdezheted anélkül, hogy a napfény professzionális kételkedőjévé válnál.

  • Szándékosan kérdezd a bizonytalanságot. A „Mi tenné ezt rosszá?” jobb, mint a „tedd magabiztossá”.

  • Amikor csak lehetséges, a visszakeresést különítsd el a létrehozástól. Először nézd meg a szövegrészeket. Aztán kérd a leírást.

  • Változtasd meg a jelmezt. Fogalmazd át. Kérd meg, hogy érveljen az ellenkezője mellett. Az azonnali érzékenység olyan, mint egy zseblámpa, ha így használod.

  • Kényszerfeltételek: „csak a beillesztett szövegből”, „ha hiányzik, akkor írja ki, hogy hiányzik”. A modellek meglepően engedelmesek ennek... amíg már nem azok. Mindenesetre ellenőrizd.

  • Előnyben részesítsd azokat a feladatokat, amelyekhez ellenőrző tartozik. Fordítóprogramok, linterek, sémaellenőrzések, egy második szem. A megbízhatóság imádja az értékelőt.

  • Figyelj a lényegre: extra specifikusság. Egy precízen kinéző alak, egy megnevezett eset, egy rendezett számozású záradék – ebben ölt testet a hallucináció.

  • Tartsd láthatóan az emberi lépést. Ha a felhasználói felület elrejti a csekket, az emberek kihagyják. Ez bútor, nem erkölcsi hiba.

Ettől a modell nem lesz „igaz”. Kevésbé teszi hiszékenysé a ciklust. Ami, gondolom, a szorzat.

Ahol a térkép elhagy

Szóval. Az igen/nem kérdés csak egyfajta kapuként működik.

Megbízható a mesterséges intelligencia? Nem tulajdonságként. Egy feladat, egy adathalmaz, egy visszakeresési ciklus, egy olyan kiértékelés, ami nem bemutató, és egy olyan ember tulajdonságaként, akinek továbbra is komolyan kell gondolnia. A folyékony beszéd továbbra is átverni fog minket, mert mi nyelvi állatok vagyunk, ezek a rendszerek pedig nyelvi gépek. Az üzemidő folyamatosan összekeveredik az igazsággal, mert mindkettő úgy tűnik, mintha "működött volna". A másodpilóták továbbra is keresni fogják a kenyerüket a kusza közepén - vázlatok, összefoglalók, amiket átfuthatsz, kód, amit összeállíthatsz - és veszélyesek lesznek, ha az ítélkezést egy olyan bekezdésre bízzuk, aminek semmi köze hozzá.

Használd őket ott, ahol olcsó vagy könnyen elkapható a hiba. Lassíts, ahol drága a hiba. Ez az egyenes válasz, és többet ér, mint egy szlogen.

Ha egy dolgot veszel figyelembe: ne kérdezd meg a modelltől, hogy biztos-e benne. Figyeld meg, mi történik, amikor megkérdezed tőle, hogy miben lehet a hiba. Aztán ellenőrizd.

Valós példa: Tagsági szabályzat AI asszisztens létrehozása

Forgatókönyv

Priya a Harbour Membership, egy 70 fős brit szakmai szervezet független edzőtermeinek tudását adja. Három ember válaszol a tagok kérdéseire. Az igazság forrása egy 180 oldalas kézikönyv, amelyet negyedévente frissítenek, valamint régi PDF-fájlok egy megosztott meghajtón, amelyeket senkinek sincs szíve törölni.

A vezetőség már vett egy helpdesk másodpilótát. A demó egész jó volt. Az üzemidő is rendben volt. A második héten egy gördülékeny vázlat azt mondja a tagnak, hogy 14 napra befagyaszthatja az előfizetést, és teljes visszatérítést kaphat "alapértelmezetten". Ez nem a szabályzat. Az ügynök észrevette, mert továbbra is kinyitják a kézikönyvet, ha pénzről van szó. A vezetőség kérdése, amelyet úgy küldtek el, mintha igen vagy nem lenne, a következő: megbízható-e a mesterséges intelligencia?

Priya elutasítja az ítéletet. Úgy kezeli, mint egy térképet. A feladat nem az, hogy „jóslatot adjon a tagoknak”. Hanem az, hogy „felvázoljon egy választ a jelenlegi kézikönyvből, mutassa meg a részt, és zárja le a hibát, ha a rész hiányzik”. Ha a másodpilóta ezt nem tudja megtenni, akkor az egy szerkesztőeszköz, nem pedig egy szabályzatíró asztal.

Amire szüksége van az asszisztensnek

  • A 2026. áprilisi kézikönyv, mint egyetlen engedélyezett korpusz, a szakaszszámok épségével

  • A régi, 2023-as PDF-et szándékosan hagyták a meghajtóban, hogy lássák, a visszakeresés során meg lehet-e találni a majdnem elkövetett hibát

  • Írásos szabály: nincsenek ügyfél-személyes adatok a fogyasztói eszközökben; tilos ember nélkül küldeni; tilos számokat, ablakokat vagy „standard” záradékokat kitalálni

  • Engedély a promptok, a lekért adatcsomagok és a végső küldés naplózására

  • Egy megnevezett tulajdonos (Priya), aki pontot szerez egy tesztkészletből és leállítja a másodpilótát, ha az nem sikerül, rosszabbul zárt, mint egy pénzfeldobás pénzkérdéseknél

  • Ha az eszköz támogatja a visszakeresést, akkor a visszakeresett darabnak láthatónak kell lennie a vázlat mellett. Ha nem, akkor kézzel fogják beilleszteni a részt. A földelés ellenőrizhető átjáró nélkül továbbra is köd.

Példa utasítás

Priya ezt hétköznapi nyelven fogalmazza meg, nem egy színpadi játékbeli feladatban:

Csak a 2026 áprilisában kapott kézikönyvből származó részekből válaszolj. Add meg a szakasz számát. Ha a válasz nincs benne ezekben a részekben, mondd azt, hogy „nincs a jelenlegi kézikönyvben”, és hagyd abba. Ne találj ki befagyasztási időszakokat, visszatérítési szabályokat vagy díjakat. Ne frissítsd az „edzőterem belátása szerint” állapotot az „alapértelmezett” állapotra. Ha két rész ütközik, mutasd meg mindkettőt, és mondd meg, melyik a legfrissebb. Egy olyan embernek írsz, aki megnyitja a forráskódot, mielőtt bármi is eljutna egy taghoz.

Aztán megtart magának egy második utasítást, mivel a cikk lényege a ciklus, nem a modell:

Küldés előtt nyisd meg a hivatkozott részt. Kérdezd meg: „mi lenne ebben a hiba?” Ha a vázlat olyan számot tartalmaz, amely nincs benne a szövegben, utasítsd el. Ha úgy kérdeztem, mint egy sietős főnök, kérdezz újra, mint egy szkeptikus, és hasonlítsd össze.

Egy jó tervezet így néz ki: „Nincs benne a jelenlegi kézikönyvben (2026. április, 4.2. szakasz). A befagyasztásról az edzőterem dönt. A visszatérítés nem automatikus. Eszkaláld.” Egy rossz tervezet így néz ki: „A tagok 14 napra befagyaszthatják az előfizetést, és alapértelmezés szerint teljes visszatérítést kaphatnak. Megerősítve a kézikönyvben.” Ugyanaz a hangnem. Ezek közül csak az egyik a szabályzat.

Hogyan teszteljük

Priya 20 kérdést ír, mielőtt megnézné a másodpilóta kimenetét. A sorrend számít. Egy demó villámgyors. Ez a száraz teszt.

A készlet nem kvízkérdés. Ez az élő asztal:

  • Nyolc kérdés, amelyekre a válaszok egy aktuális részben találhatók (a könnyűek)

  • Négy majdnem baleset, ahol a 2023-as PDF szövegezése pontosabb, mint az áprilisi szövegé

  • Három „a kézikönyvben nem szereplő” kérdés (számlázási viták, orvosi szempontból „biztonságos-e ez a képzés”, jogi szempontból szerződésmódosítás)

  • Három pénzügyi kérdés (befagyasztás, visszatérítés, csatlakozási díj)

  • Két hétköznapi tagi kérdés (nyitvatartás, edzőbiztosítás)

A húsz elem közül kettőt egy második jelmezben is újra megkérdeztek, egyszer egy sietős főnök, egyszer pedig egy szkeptikus szerepében, egy gyors érzékenységi teszt keretében. Ezeket az ismételt kérdéseket rögzítették, nem vették bele a 20 elemes pontszámba.

Priya pontozta a rubrikát nyitott kézikönyvvel: a sikeres megoldáshoz a megfelelő aktuális szabályra, egy valós szakaszszámra és semmilyen extra kitalált záradékra van szükség. A csendes hiba egy technikailag kifogástalan mondat, amely elvetette a kivételt, vagy a talánból kötelezőt csinált. A nyílt hiba egy kitalált szám vagy egy majdnem hibás PDF, amelyet aktuálisként kezelnek. Az üzemidőt külön számolják, mert a "válaszolt" nem azt jelenti, hogy "úgy volt".

Elfogadás a további lépésekhez: pénzügyi kérdésekben inkább a sikertelen lezárást válassza a sikertelen megnyitás helyett. Ha a másodpilóta kitalál egy visszatérítési ablakot, nem készít élő jegyeket. Ha senki sem nyitja meg a forrást, akkor sem készít élő jegyeket.

Eredmény

Szemléltető eredmény, egy kitalált 20 kérdéses tesztből, nem publikált kikötői tagsági adat.

Feltételezések: egy ügyfélszolgálati másodpilóta; a 2026. áprilisi kézikönyv, valamint a fennmaradó 2023-as PDF; Priya a fenti rubrika alapján pontozott; az időmérést telefonos stopperóra végezte a beillesztett kérdéstől az „Ezt elküldeném” kérdésig; az áttekintési idő szándékosan benne van a ciklusos feltételben, és kimarad a nem ellenőrzött feltételből, hogy az összehasonlítás kiegyenlített maradjon.

Ellenőrizetlen másodpilóta, demó stílusú feladat: 20 kérdésből 20-ra gördülékeny válasz érkezett (a rendelkezésre állás tökéletesnek tűnt). 20-ból 11 felelt meg a kritériumoknak. Öt csendes hiba volt. Négy nyílt hiba volt, beleértve a 14 napos befagyasztást is. A négy nyílt hiba közül kettő a 2023-as PDF forráskód alakú adatrészletére hivatkozott. Egy elküldhetőnek tűnő vázlat elkészítésének medián ideje 1 perc volt.

Ugyanaz a 20 kérdés, korlátozott utasítások, látható a lekért rész: az áprilisi szövegből 20-ból 15 teljesen helyes volt. Három helyesen írta le, hogy "nincs benne a jelenlegi kézikönyvben" (az orvosi és jogi vonatkozású tételek, plusz egy számlázási vita), tehát 20-ból 18 elfogadható volt. Kettő továbbra sem sikerült: az egyik végigírta a 2023-as majdnem balesetről szóló PDF-et, a másik pedig kitalált egy belépési díjra vonatkozó adatot, ami nem szerepelt a szövegrészben. A tervezet átlagos elkészítési ideje továbbra is körülbelül 1 perc volt.

Ugyanaz a 20, plusz Priya megnyitotta a hivatkozott részt egy szimulált küldés előtt: a 20-ból 19 elfogadható lett volna. Elkapta a majdnem hibás PDF-et. A fennmaradó hiba az volt, hogy a bíráló átfutott egy folyékony bekezdést, és nem vette észre a kitalált csatlakozási díj összegét. Az átlagos idő, a bírálattal együtt, 3 perc volt.

Régi folyamat, csak kézikönyv szerinti keresés, másodpilóta nélkül: 20-ból 20 elfogadható. Átlagosan 9 perc.

Ebben a mintában a ciklusos másodpilóta 6 perccel gyorsabb volt, mint a kézikönyv szerinti vadászat (9 mínusz 3), vagyis 120 percet 20 kérdésen keresztül, 20-ból 19 elfogadható volt a 20 helyett. Az ellenőrizetlen másodpilóta 8 perccel gyorsabb volt (9 mínusz 1), és 20-ból 9-ben hibázott, halkan vagy hangosan. Ez nem egy 67%-os időmegtakarítás, amit egy kormányműbe építettél volna. Ez egy 9 kihagyásos szivárgás, amit automatizáltál volna.

A két ismételt kérdés sietős, főnökös verziói egyaránt túlzóak voltak. A szkeptikus verziók viszont háttérbe szorították a figyelmet. Ugyanaz a modell, ugyanaz a kézikönyv, más jelmez. Priya ezt felfedezésként, nem pedig személyiségjegyként könyvelte el.

Ezek a számok egy példabecslés, amely a megadott teszten, egy kis készleten, egy dühös tagnál könnyebb jegyeken és egy olyan véleményezőn alapul, aki már ismerte a könyvet. Nem bizonyítják, hogy a másodpilóta "95%-ban megbízható", vagy hogy a Harbournak le kellene mondania egy íróasztalnál dolgozó személyről. Azt mutatják, hogy az üzemidő nem volt a kérdés, hanem az ellenőrzés.

Mi romolhat el

  • A vezetőség az 1 perces draftidőt idézi, és kihagyja a 9 kihagyott dobást. A gyorsaság még délután 4-kor is kompetenciának érződik.

  • A 2023-as PDF az indexben marad. A keresés folyamatosan előhozza. A „földelés” felnőttesnek tűnik, és még mindig majdnem sikerült.

  • A felhasználói felület egy csillogó küldés gomb mögé rejti a lekért adatrészletet. Az emberek abbahagyják a kézikönyv megnyitását, így jut el a válasz befagyasztása a tagokhoz.

  • Priya csak a nyolc könnyű kérdést pontozza, mert jobban mutatnak egy dián. Értékelési színház, csak egy táblázattal.

  • Egy orvosi témájú „biztonságos ez a képzés?” kérdésre adott válasz tűnhet egy rövid összefoglalónak. A térképen szinte soha nem szerepelt. A hangnemben viszont az állt, hogy folytasd.

  • A naplók ki vannak kapcsolva, mert "ez extra érzésnek tűnt". Egy kihagyott rész után senki sem láthatja, melyik részt sikerült visszaszerezni.

  • Megkérdezik a modellt, hogy biztos-e benne. De igen. Ez sosem volt a teszt.

Gyakorlati elvitel

A megbízhatóság nem a Harbour által megvásárolt másodpilóta tulajdonsága. 20 kérdés, egy aktuális kézikönyv, egy látható szövegrész és egy olyan személy tulajdonsága, aki továbbra is megnyitja a forráskódot, ha pénzről van szó. A folyékonyság továbbra is átmegy az üzemidő-teszten. A ciklus az egyetlen dolog, ami átmegy a szabályzatteszten.

GYIK

Mit jelent egyáltalán a megbízhatóság a generatív mesterséges intelligencia esetében?

A mindennapi megbízhatóság azt jelenti, hogy valamire támaszkodhatsz. A beszélő automatizálással a tulajdonságok egész halmaza egyetlen szó alatt rejtőzik: tényszerűség, konzisztencia, kalibráció, biztonság, üzemidő, azonnali érzékenység, szélsőséges esetek és viselkedés az elosztási váltás után. Ezek közül egyik sem vall kudarcot együtt. Az élő teszt megbízható abban, hogy mit, kinek és melyik ciklussal. Különben egy turmixgépet aszerint osztályozol, hogy képes-e adózni.

Megbízható a mesterséges intelligencia?

Nem tulajdonságként. Egy LLM képes kőkeményen teljesíteni az egyik munkahelyen, és csendben kiborulni a következőben, néha ugyanabban az ülésben, néha azért, mert elmozdítottál egy vesszőt. A megbízhatóság egy feladat, egy adathalmaz, egy visszakeresési ciklus, egy olyan értékelés, amely nem bemutató, és egy olyan ember tulajdonsága, akinek továbbra is komolyan kell gondolnia. Használd ott, ahol a hiba olcsó vagy észrevehető. Lassíts, ahol a hiba drága.

Az MI üzemideje ugyanaz, mint az igazmondás?

Nem. Az üzemidő az, hogy a végpont válaszolt-e. Az igazmondás az, hogy a válasz igen volt-e. Lehet egy olyan szolgáltatásod, ami soha nem pislog, és mégis folyékonyan hazugságokat küldhetsz az ügyféljegyekbe. A sebesség a kompetenciának tűnik, amikor a sor egy szörnyeteg. A biztonság egy újabb tengely: egy modell, ami nem hajlandó jailbreakelni, akkor is összekuszálhatja a saját jegyzeteid összefoglalóját.

Miért tűnik megbízhatónak a folyékonyan működő mesterséges intelligencia, még akkor is, ha téved?

A pontosság és a folyékonyság elvált egymástól, és a folyékonyság tartotta a latban a lécet. Egy LLM fokozat ritmust, kitérőket, talán egy hamis, de szép idézetformát ad, és az agyad azt olvassa, hogy „ez a személy tudja”. A kalibráció gyakran szörnyű: nagy magabiztosság, közepes igazság, úgy adják elő, mint egy fő gondolatot. Egy ügyetlen rossz válasz gyanakvóvá tesz. Egy folyékony rossz válasz miatt abbahagyod az ellenőrzést. Ha úgy hangzik, mint egy beadandó, akkor mi is úgy kezeljük, mint egy beadandót, és így kerül a hiba a pakliba.

Megbízható a mesterséges intelligencia orvosi, jogi vagy ügyfélszolgálati munkában?

A munkától függ, nem a márkától. Az orvosi és jogi tanácsadás szinte soha nem elég jó termékként: a modell csak egy csonk, az ember pedig a szakember. Az ügyfélszolgálat szigorú szabályzat keretein belül fogalmazhat, de egy személynek kell vállalnia a pénzküldést és a bizalmat, mert a kitalált szabályzat és az udvarias, rossz nem a szokásos kudarc. A vázlatok és összefoglalók olyan első kézből származó szövegek, amelyeket már ismersz. Ellenőrizd a neveket, a számokat és azt a sort, amelyik fájhatna.

Miért hallucinál, sodródik, vagy téved csendben a mesterséges intelligencia?

A hallucináció a pikáns kihagyás: egy könyv, ami nem létezik, egy funkció, amit soha nem szállítottak le, egy szabályzati záradék hivatalosnak tűnő számmal. A sodródás kevésbé filmes: a világ mozog, a modell maradványai ott maradnak, és jól strukturált választ kapsz a korábbi időjárásból. A csendes tévedés egy összefoglalás, ami elveti a kivételt. Vagy egy parafrázis, ami a talánt kötelezővé teszi. A tényszerűség technikailag rendben lévőnek tűnhet, miközben a jelentés elhalványult. Az azonnali érzékenység csillogóvá teszi a tényeket, amikor megváltoztatod a csomagolást.

A földelés vagy a visszahívás teszi megbízhatóvá a mesterséges intelligenciát?

A földelés azt jelenti, hogy innen, nem a ködből kell választ kapni. A visszakeresés a jelent egy képzett halomra szegezi. Ha kudarcot vall, akkor udvariasan kudarcot vall: egy majdnem sikerült dokumentum, egy megírt írás, és az ellenőrző ösztönöd leáll. A földelés egy padló, nem pedig egy glória. Ha nem tudod megvizsgálni a visszakeresett adathalmazt, akkor még mindig a ködben vagy, csak jobb megvilágításban. Keverd össze az olyan élő állapotú feladatokat, mint az árak vagy a szabályzatok megfogalmazása, a stabil tudással, és nagyon biztos választ kapsz egy olyan világról, amely már megmozdult.

Miért rossz teszt egy demó a mesterséges intelligencia megbízhatóságára?

Egy letisztult prompt és egy olyan feladat, aminek a modell ezernyi rokonát látott, remekül fog kinézni. Az élő munkafolyamatok kusza beillesztést, hiányzó fájlokat és egy olyan felhasználót tartalmaznak, aki elfogadja az első választ, ami csökkenti a szorongását. A ranglista pontszáma nem a jegyeid kalibrálása. A modell kockázata az, ami akkor történik, ha ez nagy mennyiségben hibás, nem pedig az, hogy átment-e egy kvízkérdésen. A szükséges tesztek szárazak: maradj a visszakeresett szövegrészen belül, jelezd a bizonytalanságot a blöffölés helyett, maradj következetes az átfogalmazáskor, és zárd le a hibát a kitalálások helyett.

Megbízható-e a mesterséges intelligencia, ha senki sem felelős érte?

Nem. Ha senki sem felelős, a rendszert úgy fogják használni, mintha az lenne. Az ember-a-hurokban az egyetlen olyan terv, amely megfelel a hibamódoknak: ki vizsgálja felül, ki tudja megállítani, mi kerül naplózásra, mi történik egy hiba után. Ha a válasz "a modell", akkor nincs válaszod. A modellek nem vesznek részt a megbeszélésen az incidens után. Az orvostudományban, a jogban, a hitelezésben vagy a biztonságkritikus műveletekben az ember a ciklus, a modell pedig egy csonk.

Hogyan tudom a mesterséges intelligenciát úgy használni, hogy észrevegyem a hibákat?

Szándékosan kérdezz rá a bizonytalanságra: a „Mi tenné ezt rosszá?” jobb, mint a „tedd magabiztossá”. Amikor csak lehetséges, válaszd szét a visszakeresést a generálástól. Először nézd meg a szövegrészeket, majd kérd meg a leírást. Változtasd meg a jelmezt: fogalmazd át, vagy kérd meg, hogy az ellenkezőjét állítsa. Erőltesd a feltételeket, például a „csak a beillesztett szövegből” vagy a „ha hiányzik, mondd, hogy hiányzik”, és akkor is ellenőrizd. Előnyben részesítsd az ellenőrzővel ellátott feladatokat, és figyelj a fokozott specifikusságra, mert a hallucináció itt szeret öltözködni.

Referenciák

  1. NIST - nvlpubs.nist.gov

  2. NIST - airc.nist.gov

  3. NIST - airc.nist.gov

  4. ICO - ico.org.uk

  5. NCSC - www.ncsc.gov.uk

  6. NCSC - www.ncsc.gov.uk

  7. OWASP - genai.owasp.org

Találd meg a legújabb mesterséges intelligenciát a hivatalos AI Assistant áruházban

Rólunk

Kvíz
1. A cikk szerint megbízható-e a mesterséges intelligencia, mint tulajdonság?

2. Mi a különbség az üzemidő és a hitelesség között?

3. Miért veszélyesebb egy folyékonyan adott rossz válasz, mint egy ügyetlen?

4. A szemléltető Harbour Membership 20 kérdéses tesztben mi történt az ellenőrizetlen másodpilótával?

5. A cikk szerint mi a földelés egy megvizsgálható, visszaszerzett darab nélkül?


Vissza a bloghoz