Mesterséges intelligencia veszélyezteti az Internet Archive digitális archívumát

2026. április 17.-Múlt-kor

Veszélybe került a webes tartalmak digitális megőrzése, miután a mesterséges intelligencia-fejlesztők adatgyűjtési gyakorlata miatt számos globális kiadó letiltotta az Internet Archive archiváló robotjainak hozzáférését – derül ki a Nieman Lab újságírói kutatóintézet legfrissebb oknyomozó jelentéséből.

Mesterséges intelligencia veszélyezteti az Internet Archive digitális archívumát

A Nieman Lab vizsgálata szerint kilenc ország összesen 241 jelentős hírportálja, köztük a The New York Times, a Financial Times és a The Guardian módosította a weboldalak feltérképezését szabályozó robots.txt fájlját, hogy blokkolja az Internet Archive letöltő algoritmusait.

A médiumok – amelyekhez 2025 augusztusában a Reddit közösségi platform is csatlakozott – azzal indokolják a defenzív lépést, hogy a generatív mesterséges intelligenciát fejlesztő vállalatok a nyílt archívumokat kiskapuként használva, engedély nélkül gyűjtik be a jogvédett tartalmakat a nyelvi modellek tanításához. A korlátozások a webes megőrzés másik nagy, szintén nonprofit projektjét, a Common Crawl rendszert is érintik, amelyet az elemzett oldalak közül 240 szintén kizárt a feltérképezésből.

Brewster Kahle, az Internet Archive alapítója a kutatóintézetnek nyilatkozva hangsúlyozta: ha a kiadók korlátozzák a digitális könyvtárak hozzáférését, a nyilvánosság és a kutatók egyre kevesebb történelmi feljegyzéshez férhetnek hozzá.

A tartalommegőrzés elleni fellépés eltérő mértékű az egyes orgánumoknál: míg a The Guardian kizárólag a cikkoldalait szűrte ki az archiválásból, addig más platformok, mint a The New York Times és a The Athletic, teljes blokkolást alkalmaznak a szervereiken. Ha a tendencia tartós marad, a jövőben lehetetlenné válhat a törölt cikkek, korábbi közösségi média-bejegyzések vagy módosított webes tartalmak visszakeresése.

A nyílt internet korszaka

A webes archiválás a modern kori történetírás, a forráskritika és az információkutatás alapköve. Az 1996-ban alapított, San Franciscó-i székhelyű Internet Archive a világ legnagyobb nonprofit digitális könyvtáraként jött létre azzal a céllal, hogy megakadályozza a digitális emlékezetkiesést, vagyis az internetes hivatkozások végleges eltűnését (az úgynevezett link rot jelenséget).

Legismertebb szolgáltatása, a Wayback Machine az elmúlt harminc évben több százmilliárd weboldal korábbi állapotát rögzítette, ezáltal a digitális korszak egyfajta modern alexandriai könyvtáraként funkcionál.

A jelenlegi folyamatok a nyílt internet korszakának végét jelezhetik. Míg a webes hőskorban és az elmúlt évtizedekben a tartalommegőrzés a globális kulturális örökségvédelem részét képezte, és az archiváló robotok működését a kiadók hallgatólagosan támogatták, a nagy nyelvi modellek térnyerésével az adatok piaci és tréningértéke felülírja a szabad és egyetemes információhozzáférés korábbi alapelveit. Az adatvédelmi szigorítások következtében a webtörténet jelentős szegmensei tűnhetnek el végleg a nyilvánosság és a jövőbeli kutatók elől.