Régi könyvekkel tanítják a mesterséges intelligenciát
A mesterséges intelligencia rendszereket fejlesztő technológiai nagyvállalatok tömegesen vásárolják fel, majd semmisítik meg a régebbi kiadású, nyomtatott könyveket annak érdekében, hogy tiszta adatbázisokat hozzanak létre. Ahogy arról a 404 Media technológiai portál újságírója egy friss oknyomozó cikkében beszámolt, az ipari méretű adatgyűjtési módszer célja a gépi tanuló algoritmusok minőségromlásának megakadályozása. A jelenség rávilágít arra, hogy a digitális tér szintetikus tartalmakkal való telítődése miatt a hagyományos nyomtatott források informatikai szempontból jelentősen felértékelődtek.
- A technológiai vállalatok elkezdték felvásárolni és megsemmisíteni a nehezen eladható, marginális témájú, régebbi kiadású nyomtatott könyveket.
- A kötetek gerincét levágják, a lapokat pedig nagysebességű eszközökkel beszkennelik, hogy kizárólag ember által alkotott, tiszta szövegekhez jussanak.
- A folyamat célja a nyelvi modellek összeomlásának megakadályozása, amely akkor következik be, ha az algoritmusok gépi úton generált adatokon tanulnak.
Az elmúlt időszakban a nemzetközi könyvkereskedők szokatlan piaci tendenciára lettek figyelmesek, mivel ismeretlen megrendelők ártól függetlenül kezdték felvásárolni a nehezen eladható kiadványokat. A 404 Media újságírója egy ilyen kötet útját követve egy Las Vegas-i, az Amazon által üzemeltetett digitalizáló központig jutott.
A létesítményben a beérkező könyvek gerincét levágják, a különálló lapokat nagysebességű szkennerekkel feldolgozzák, a fizikai példányokat pedig a folyamat végén megsemmisítik. Az eljárás elsősorban nem a gyűjtők által keresett irodalmi ritkaságokat, hanem az eddig értéktelennek tartott, de kizárólag emberi szerzők által írt szakkönyveket, jogi esetleírásokat és használati utasításokat érinti.
A könyvek megsemmisítésével járó adatgyűjtés hátterében az informatikai szektor egyik legkomolyabb kihívása, az úgynevezett modellösszeomlás áll. A nagy nyelvi modellek korai verzióit az interneten fellelhető, hatalmas mennyiségű emberi szöveg felhasználásával tanították be. Napjainkra azonban a világháló tartalmainak egyre nagyobb részét már maguk az algoritmusok generálják.
Amennyiben egy mesterséges intelligencia az általa vagy más rendszerek által létrehozott szintetikus adatokon tanul, a kimeneti eredmények minősége idővel drasztikusan romlik, a hálózat pedig logikai hibákat kezd halmozni. Ennek elkerülése érdekében a piacvezető fejlesztők, köztük az Amazon és az Anthropic kénytelenek a nyelvi modellek megjelenése előtt nyomtatott, garantáltan gépi beavatkozástól mentes forrásokhoz nyúlni.
Ez is érdekelhet
A nyomtatott tudásbázis technológiai célú felemésztése új kontextusba helyezi az írott kultúra megőrzésének évszázados gyakorlatát. Míg a korábbi történelmi korszakokban a fizikai dokumentumok gyűjtése a tudás átörökítésének elsődleges formája volt, az információs korszakban a könyvpusztító digitalizáció a gépi intelligencia fenntartásának nyersanyagává vált.
Melissa Korn, a Wall Street Journal újságírója a nyomtatott kultúra és a digitális technológia ezen sajátos találkozását úgy értékelte, hogy a mesterséges intelligencia a szó szoros értelmében felfalja az irodalmi és kulturális örökséget, visszafordíthatatlan fizikai pusztulást hagyva maga után az adatok kinyerése során.
