ShopReadableBot
ShopReadableBot ist der Crawler von ShopReadable. Er prüft öffentlich abrufbare Seiten eines Online-Shops darauf, ob Maschinen – Suchmaschinen, Feed-Verarbeiter und KI-Agenten – die Produkte finden und verstehen können. Eine Prüfung startet, wenn jemand die Adresse eines Shops auf ShopReadable eingibt; ob diese Person zum Shop gehört, prüft ShopReadable nicht.
User-Agent: ShopReadableBot/1.0 (+…/bot). Der Crawler gibt sich nie als ein anderer Crawler aus.
Was er abruft
- robots.txt, die Startseite (oder den angegebenen kurzen Startpfad wie
/shop/) und die Sitemaps des Shops – nur auf dem geprüften Host. - Eine Stichprobe von Seiten: bei einem kostenlosen Scan höchstens 8, bei einem Deep Audit und dessen Nachprüfungen höchstens 50.
- Nach einem Deep Audit einmalig der Katalog-Check: robots.txt, Startseite und Sitemaps (höchstens 50 Dateien), dann je gefundener Produktseite ein einfacher Abruf – höchstens 2.000 Seiten in 60 Minuten Prüfzeit, ein Abruf nach dem anderen mit derselben Pause. Läuft gleichzeitig eine andere Prüfung desselben Shops, wartet er so lange. Verlangt der Shop per 429/503 eine Pause, hält er sie ein (höchstens eine Minute), sonst und bei wiederholter Drosselung hört er auf.
- Je Prüfung einmal
/.well-known/ucpund/llms.txtsowie bis zu 3 Endpunkte, die das UCP-Profil des Shops auf seinem eigenen Host ankündigt – jeweils ein einfacher Abruf, kein Aufruf einer Schnittstelle. - Bis zu 1 Produktseite (kostenlos) bzw. 5 Produktseiten (bezahlt) werden in einem Browser dargestellt. Dafür lädt er je Seite bis zu 200 Skripte, Stylesheets und Datenabrufe nach – keine Bilder, Videos oder Schriften. Skripte und Stylesheets auch von eingebundenen fremden Hosts (etwa CDNs), Datenabrufe nur vom Shop selbst. Für fremde Hosts gilt deren robots.txt dabei nicht; sie werden nur geladen, weil die Seite des Shops sie einbindet.
Was er nie tut
- Formulare absenden oder andere Anfragen als Lese-Abrufe (GET) stellen – auch nicht aus Skripten der Seite.
- Warenkorb, Kasse, Konto oder Suche aufrufen, sich anmelden oder etwas bestellen.
- CAPTCHAs oder Bot-Schutz umgehen.
- Seiten abrufen, die robots.txt für ShopReadableBot sperrt – auch nicht die Nachlade-Abrufe des Browsers auf dem Shop.
Wie oft
- Zwischen zwei Seitenabrufen liegt mindestens 1 Sekunde; ein längeres
Crawl-delayin robots.txt wird eingehalten. Ist es länger als 1 Sekunde, verzichtet er auf die Browser-Darstellung. - Ausnahme: Beim Darstellen einer Seite lädt der Browser deren Skripte, Stylesheets und Datenabrufe ohne diese Pause und teils parallel nach – wie ein gewöhnlicher Browser.
- Wird dieselbe Adresse innerhalb von 10 Minuten erneut eingegeben, wird das vorhandene Ergebnis wiederverwendet – außer bei einer ausdrücklich erneuten Prüfung („Neuer Scan“ oder „Dieselbe Stichprobe erneut prüfen“), für die dieselben Obergrenzen gelten. Schreibweisen mit und ohne
www.oder mit http und https gelten dabei als verschiedene Adressen. Je Schreibweise und Prüfungsart nimmt ShopReadable in 10 Minuten höchstens 10 Prüfungen an, nach 3 gescheiterten keine weitere. Über alle Subdomains einer registrierbaren Domain zusammen (nach der Public Suffix List, etwaa.shop.exampleundb.shop.example) sind es höchstens 20. Bezahlte Audits und deren Nachprüfungen kommen hinzu.
Wie man ihn sperrt
In der robots.txt des Shops, ganz oder für einzelne Bereiche:
User-agent: ShopReadableBot
Disallow: /Die robots.txt wird bei jeder Prüfung neu gelesen; die Sperre wirkt ab der nächsten Prüfung. Sie verhindert das Abrufen, nicht, dass jemand die Adresse eingibt: Die Prüfung wird dann angelegt, liest nur die robots.txt und endet mit dem Hinweis, dass der Crawler gesperrt ist.
Was gespeichert wird
Gespeichert werden die Adresse des Shops und technische Prüfergebnisse – Regelergebnisse mit Adressen öffentlicher Seiten und Fundstellen, Zahlen und Kennungen. Gehört der Shop einer Einzelperson, können schon Adresse und Seitenadressen personenbezogen sein. Seiteninhalte, Beschriftungen, Verkäufer- und Bewertungsdaten speichert ShopReadable nicht. Kostenlose Scans werden nach 30 Tagen gelöscht, Deep Audits nach 90 Tagen. Einzelheiten stehen in der Methodik.
Kontakt
Fragen oder Löschwünsche zu einem geprüften Shop: kontakt@shopreadable.de.