1931 előtti szövegekkel tesztelik az új mesterséges intelligenciát
Egy kizárólag 1931 előtti, közkincsnek számító angol nyelvű szövegeken betanított mesterséges intelligencia-modellt, az úgynevezett Talkie-t mutatta be Nick Levine, David Duvenaud és Alec Radford kutatócsoportja. A részben az Anthropic technológiai vállalat által finanszírozott kutatás újdonsága, hogy a 13 milliárd paraméteres rendszer a digitális korszak előtti emberi tudást és logikát modellezi, rávilágítva arra, miként képes egy algoritmus modern logikai folyamatokat értelmezni pusztán kora 20. századi adatok alapján.
A Talkie nevű nyelvi modell betanítása során a fejlesztők 260 milliárd szöveges egységet használtak fel, amelyek kivétel nélkül 1930. december 31. előtt keletkezett könyvekből, újságokból, folyóiratokból, tudományos publikációkból, szabadalmakból és bírósági határozatokból származnak. A dátumválasztás jogi okokra vezethető vissza: az Egyesült Államok hatályos szerzői jogi törvényei értelmében a korábban megjelent művek már mentesültek a korlátozások alól, így szabadon hozzáférhető közkincsnek (public domain) minősülnek.
A kutatók tesztelték a rendszer absztrakt problémamegoldó képességét is a HumanEval nevű, Python-programozási feladatokat tartalmazó adatbázison. Noha a modell betanítási adatai között értelemszerűen nem szerepeltek modern számítástechnikai kódok, a kontextus megadása után az algoritmus képes volt felmérni a logikai összefüggéseket. Egy kódolási feladatnál például sikeresen azonosította, hogy a megfelelő matematikai inverz művelet elvégzésével (az összeadás kivonásra cserélésével) dekódolható egy elméleti rejtjel.
A projekt részeként a kutatók egy folyamatosan frissülő felületet is létrehoztak, ahol a Claude Sonnet 4.6 nyelvi modell folyamatosan kérdésekkel teszteli a Talkie történelmi és kulturális ismereteit. A modell a korabeli források alapján hibátlanul ismeri és alkalmazza például a korszak szigorú társadalmi, látogatási és etikett-szabályait.
A fejlesztők ugyanakkor egy „időbeli szivárgásnak” nevezett anomáliát is azonosítottak a rendszerben. Bár a betanítási adatbázis elméletileg 1930 végén lezárul, a tesztek során az algoritmus helyesen nevezte meg Franklin D. Rooseveltet mint az 1936-os év amerikai elnökét, és pontos dátumokkal sorolt fel 1933 és 1936 közötti, a New Deal gazdasági programhoz köthető törvényeket. A kutatócsoport jelenleg is elemzi a későbbi évtizedekből származó információk beszivárgásának technikai okait.
Ez is érdekelhet
A Talkie megalkotása egyedülálló kísérlet a gépi tanulás területén. Az 1930-as évek eleje a nagy gazdasági világválság időszaka volt, amelyet globális társadalmi, gazdasági és tudományos átrendeződések jellemeztek, évtizedekkel a modern számítógépek és a digitális információrobbanás megjelenése előtt. A hagyományos nyelvi modellek az internet teljes, kortárs szövegállományán nevelkednek, ami magában foglalja a modern kor technológiai fogalomkészletét és huszonegyedik századi kulturális torzításait.
Az 1931-es kronológiai határidővel izolált mesterséges intelligencia viszont egyfajta digitális időkapszulaként működik, amely lehetővé teszi a kutatók számára a nyelvhasználat történelmi evolúciójának, valamint a kora 20. századi emberi tudásbázis határainak egzakt vizsgálatát.