Sites haasten zich om de ChatGPT-webcrawler te blokkeren nadat er instructies zijn verschenen

Sites haasten zich om de ChatGPT-webcrawler te blokkeren nadat er instructies zijn verschenen

Zonder aankondiging heeft OpenAI onlangs details over zijn webcrawler, GPTBot , toegevoegd aan zijn online documentatiesite. GPTBot is de naam van de user-agent die het bedrijf gebruikt om webpagina’s op te halen om de AI-modellen achter ChatGPT , zoals GPT-4 , te trainen . Eerder deze week kondigden sommige sites al snel hun voornemen aan om de toegang van GPTBot tot hun inhoud te blokkeren.

In de nieuwe documentatie zegt OpenAI dat webpagina’s die zijn gecrawld met GPTBot “mogelijk kunnen worden gebruikt om toekomstige modellen te verbeteren”, en dat het toestaan ​​van GPTBot om toegang te krijgen tot uw site “AI-modellen kan helpen nauwkeuriger te worden en hun algemene mogelijkheden en veiligheid te verbeteren.”

OpenAI beweert dat het filters heeft geïmplementeerd die ervoor zorgen dat bronnen achter betaalmuren, degenen die persoonlijk identificeerbare informatie verzamelen of inhoud die het beleid van OpenAI schendt, niet toegankelijk zijn voor GPTBot.

Het nieuws dat OpenAI’s trainingsschrapers mogelijk kunnen worden geblokkeerd (als ze deze respecteren) komt te laat om de huidige trainingsgegevens van ChatGPT of GPT-4 te beïnvloeden, die jaren geleden zonder aankondiging werden geschraapt. OpenAI verzamelde de gegevens eindigend in september 2021, wat de huidige “kennis” -grens is voor de taalmodellen van OpenAI.

Het is vermeldenswaard dat de nieuwe instructies mogelijk niet verhinderen dat web-browsing-versies van ChatGPT of ChatGPT-plug-ins toegang krijgen tot huidige websites om up-to-date informatie door te geven aan de gebruiker. Dat punt werd niet beschreven in de documentatie en we hebben contact opgenomen met OpenAI voor opheldering.

Het antwoord ligt bij robots.txt

Volgens de documentatie van OpenAI zal GPTBot herkenbaar zijn aan de user-agent-token “GPTBot”, met als volledige tekenreeks “Mozilla/5.0 AppleWebKit/537.36 (KHTML, zoals Gecko; compatibel; GPTBot/1.0; +https://openai.com /gptbot)”.

De OpenAI-documenten geven ook instructies over hoe GPTBot kan worden geblokkeerd voor het crawlen van websites met behulp van het industriestandaard robots.txt- bestand, een tekstbestand dat zich in de hoofdmap van een website bevindt en webcrawlers instrueert (zoals die worden gebruikt door zoekmachines ) om de site niet te indexeren.

Het is net zo eenvoudig als het toevoegen van deze twee regels aan het robots.txt-bestand van een site:

User-agent: GPTBot

Disallow: /

OpenAI zegt ook dat beheerders GPTBot kunnen beperken tot bepaalde delen van de site in robots.txt met verschillende tokens:

User-agent: GPTBot

Allow: /directory-1/


Disallow: /directory-2/

Bovendien heeft OpenAI de specifieke IP-adresblokken geleverd van waaruit de GPTBot zal werken, die ook door firewalls kunnen worden geblokkeerd.

Ondanks deze optie garandeert het blokkeren van GPTBot niet dat de gegevens van een site niet alle AI-modellen van de toekomst trainen. Afgezien van problemen met scrapers die robots.txt-bestanden negeren, zijn er andere grote datasets van geschraapte websites (zoals The Pile ) die niet zijn aangesloten bij OpenAI. Deze datasets worden vaak gebruikt om open source (of source-available) LLM’s te trainen, zoals Meta’s Llama 2 .

Sommige sites reageren haastig

Hoewel ChatGPT vanuit technisch oogpunt enorm succesvol was, was het ook controversieel door de manier waarop het zonder toestemming auteursrechtelijk beschermde gegevens schraapte en die waarde concentreerde in een commercieel product dat het typische online publicatiemodel omzeilt . OpenAI is beschuldigd van (en aangeklaagd voor ) plagiaat in deze zin.

Het is dan ook niet verwonderlijk om te zien dat sommige mensen reageren op het nieuws dat ze mogelijk hun inhoud van toekomstige GPT-modellen kunnen blokkeren met een soort opgekropte smaak . Op dinsdag merkte VentureBeat bijvoorbeeld op dat The Verge , Substack-schrijver Casey Newton en Neil Clarke van Clarkesworld allemaal zeiden dat ze GPTBot zouden blokkeren kort nadat het nieuws over de bot uitbrak.

Maar voor grote website-exploitanten is de keuze om crawlers met grote taalmodellen (LLM) te blokkeren niet zo eenvoudig als het lijkt. Door sommige LLM’s blind te maken voor bepaalde websitegegevens, ontstaan ​​hiaten in de kennis die sommige sites heel goed van pas kunnen komen (zoals sites die geen bezoekers willen verliezen als ChatGPT hun informatie voor hen levert), maar het kan anderen ook schaden. Het blokkeren van inhoud van toekomstige AI-modellen kan bijvoorbeeld de culturele voetafdruk van een site of een merk verkleinen als AI-chatbots in de toekomst een primaire gebruikersinterface worden. Stel je bij wijze van gedachte-experiment een online bedrijf voor dat in 2002 verklaarde dat het niet wilde dat zijn website door Google werd geïndexeerd – een zelfvernietigende zet toen dat de meest populaire oprit was om online informatie te vinden.

Het is nog vroeg in het generatieve AI-spel, en het maakt niet uit welke kant de technologie op gaat – of welke individuele sites proberen af ​​te zien van AI-modeltraining – OpenAI biedt in ieder geval de mogelijkheid.


Warning: Undefined variable $html_req in /var/www/vhosts/4pmtech.com/httpdocs/wp-content/themes/fourpmtech/comments.php on line 79

Warning: Undefined variable $html5 in /var/www/vhosts/4pmtech.com/httpdocs/wp-content/themes/fourpmtech/comments.php on line 82

Warning: Undefined variable $html_req in /var/www/vhosts/4pmtech.com/httpdocs/wp-content/themes/fourpmtech/comments.php on line 82

Warning: Undefined variable $consent in /var/www/vhosts/4pmtech.com/httpdocs/wp-content/themes/fourpmtech/comments.php on line 86

Geef een reactie

Het e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *


Warning: Undefined array key "url" in /var/www/vhosts/4pmtech.com/httpdocs/wp-content/themes/fourpmtech/inc/template-functions.php on line 315