Je eigen website afschermen tegen AI-bots
De Auteurswet regelt dat je als maker mag ‘opt-outen’ voor AI’s met commerciële doeleinden. Je geeft hiermee aan dat je werk niet mag worden gebruikt voor het trainen van AI. De wet geeft geen toelichting over wat de opt-out inhoudt en hoe dit eruit moet zien, alleen dat deze machinaal leesbaar moet zijn. Hoe een opt-out precies moet worden gedaan, is op dit moment onduidelijk. Er is (nog) geen standaard voor.
Robots.txt is een tekstbestand dat in de backend-code van een website kan worden geplaatst. Dit bestand vertelt crawlers, geautomatiseerde programma’s die het internet afspeuren en inhoud verzamelen, wat ze wel en niet kunnen scannen.
Je kunt robots.txt gebruiken om het crawlen te beperken of volledig te blokkeren. Je kiest er zelf voor welke crawler je uitsluit.
Voorkom dat je onvindbaar bent voor zoekmachines
Google maakt ook gebruik van crawling. Om te voorkomen dat je onvindbaar bent voor zoekmachines zoals Google, is het belangrijk goed op te letten welke bots je kiest.
Over Robots.txt
Robots.txt is afkomstig uit het Robot Exclusion Protocol, een richtlijn om websites af te schermen tegen bots. Het protocol is slechts een richtlijn en dus niet dwingend. Dit houdt in dat een crawler de richtlijn kan naleven, maar ook geprogrammeerd kan zijn om dat niet te doen.
Kwaadwillende crawlers zullen het robots.txt-bestand negeren. Maar door het robots.txt-bestand toe te voegen, maak je je voorbehoud expliciet en machinaal leesbaar en zet je een goede stap voor je bescherming.
Als je een websitebouwer hebt, vraag dan of deze een robots.txt-bestand toevoegt. Beheer je je eigen website, voeg dit bestand dan toe aan de root van je website. Om bijvoorbeeld de bots van OpenAI uit te sluiten, kun je de volgende tekst gebruiken:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
Voor de meer gevorderde websitebouwers kan er ook worden gekeken naar de initiatieven van W3C (TDM-protocol)1 en het integreren van NoAI-tags in HTML.2
Een uitgebreid stappenplan voor jouw robots.txt.
STAPPENPLAN
Stap 1: controleer of je een robots.txt-bestand hebt door je domeinnaam in te voeren gevolgd door /robots.txt. Bijvoorbeeld: https://kunstenbond.nl/robots.txt
Stap 2: als je nog geen robots.txt-bestand hebt op je website en de websitebouwer biedt dit niet aan, kun je zelf een robots.txt-bestand creëren. Open hiervoor Notepad (Windows) of TextEdit (Mac).
Stap 3: in je robots.txt-bestand kun je specifieke bots uitsluiten.
Voor het maken van een robots.txt kun je ook terecht bij W3Schools: https://www.w3schools.com/tools/tool_robots_txt.php
Om de bots van OpenAI uit te sluiten, kun je de volgende tekst gebruiken:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
Sla het bestand op als robots.txt, in kleine letters. Het robots.txt-bestand moet worden opgeslagen met een UTF-8 codering.
Stap 4: upload het bestand naar de root van je website. Voor het uploaden van het robots.txt-bestand is geen standaardadvies, dit is namelijk sterk afhankelijk van de architectuur van de website. Neem contact op met de hosting company van je website of zoek op het internet hoe je dit moet doen.
LET OP: elke dag verschijnen er nieuwe bots en sommige AI’s geven niet vrij welke bots ze gebruiken. Daarom is het belangrijk om ook de andere tips te volgen.
Disclaimer op je website
Je kunt op je website een clausule plaatsen waarin je aangeeft dat je het auteursrecht op je werk behoudt en dat je niet wilt dat AI-systemen je beelden gebruiken. Dit wordt ook wel een opt-out genoemd. Zo maak je voor bezoekers duidelijk dat jouw werk niet vrij gebruikt mag worden.
Het is niet zeker of crawlers deze tekst ook echt lezen of volgen, maar jij laat hiermee wel zien zien dat jij als maker bezwaar maakt tegen het gebruik van je werk voor AI. Dit kan ook belangrijk zijn voor je rechtspositie, zéker als er in de toekomst meer duidelijkheid is over auteursrecht en het trainen van AI-systemen.
Een voorbeeld: “© Copyright reserved. No automated text and data mining is permitted on this website.”