1931 előtti szövegekkel tesztelik az új mesterséges intelligenciát

2026. május 7.-Múlt-kor

Egy kizárólag 1931 előtti, közkincsnek számító angol nyelvű szövegeken betanított mesterséges intelligencia-modellt, az úgynevezett Talkie-t mutatta be Nick Levine, David Duvenaud és Alec Radford kutatócsoportja. A részben az Anthropic technológiai vállalat által finanszírozott kutatás újdonsága, hogy a 13 milliárd paraméteres rendszer a digitális korszak előtti emberi tudást és logikát modellezi, rávilágítva arra, miként képes egy algoritmus modern logikai folyamatokat értelmezni pusztán kora 20. századi adatok alapján.

1931 előtti szövegekkel tesztelik az új mesterséges intelligenciát

A Talkie nevű nyelvi modell betanítása során a fejlesztők 260 milliárd szöveges egységet használtak fel, amelyek kivétel nélkül 1930. december 31. előtt keletkezett könyvekből, újságokból, folyóiratokból, tudományos publikációkból, szabadalmakból és bírósági határozatokból származnak. A dátumválasztás jogi okokra vezethető vissza: az Egyesült Államok hatályos szerzői jogi törvényei értelmében a korábban megjelent művek már mentesültek a korlátozások alól, így szabadon hozzáférhető közkincsnek (public domain) minősülnek.

A kutatók tesztelték a rendszer absztrakt problémamegoldó képességét is a HumanEval nevű, Python-programozási feladatokat tartalmazó adatbázison. Noha a modell betanítási adatai között értelemszerűen nem szerepeltek modern számítástechnikai kódok, a kontextus megadása után az algoritmus képes volt felmérni a logikai összefüggéseket. Egy kódolási feladatnál például sikeresen azonosította, hogy a megfelelő matematikai inverz művelet elvégzésével (az összeadás kivonásra cserélésével) dekódolható egy elméleti rejtjel.

A projekt részeként a kutatók egy folyamatosan frissülő felületet is létrehoztak, ahol a Claude Sonnet 4.6 nyelvi modell folyamatosan kérdésekkel teszteli a Talkie történelmi és kulturális ismereteit. A modell a korabeli források alapján hibátlanul ismeri és alkalmazza például a korszak szigorú társadalmi, látogatási és etikett-szabályait.

A fejlesztők ugyanakkor egy „időbeli szivárgásnak” nevezett anomáliát is azonosítottak a rendszerben. Bár a betanítási adatbázis elméletileg 1930 végén lezárul, a tesztek során az algoritmus helyesen nevezte meg Franklin D. Rooseveltet mint az 1936-os év amerikai elnökét, és pontos dátumokkal sorolt fel 1933 és 1936 közötti, a New Deal gazdasági programhoz köthető törvényeket. A kutatócsoport jelenleg is elemzi a későbbi évtizedekből származó információk beszivárgásának technikai okait.

A Talkie megalkotása egyedülálló kísérlet a gépi tanulás területén. Az 1930-as évek eleje a nagy gazdasági világválság időszaka volt, amelyet globális társadalmi, gazdasági és tudományos átrendeződések jellemeztek, évtizedekkel a modern számítógépek és a digitális információrobbanás megjelenése előtt. A hagyományos nyelvi modellek az internet teljes, kortárs szövegállományán nevelkednek, ami magában foglalja a modern kor technológiai fogalomkészletét és huszonegyedik századi kulturális torzításait.

Az 1931-es kronológiai határidővel izolált mesterséges intelligencia viszont egyfajta digitális időkapszulaként működik, amely lehetővé teszi a kutatók számára a nyelvhasználat történelmi evolúciójának, valamint a kora 20. századi emberi tudásbázis határainak egzakt vizsgálatát.