AIvataryBot
Jeśli widzisz w logach AIvataryBot, to znaczy, że ktoś korzystający z AIvatary wskazał Twoją stronę jako źródło wiedzy dla swojego agenta. Ta strona mówi, co ten bot robi, jak szybko chodzi i jak go zatrzymać.
Jak się przedstawia
Każde żądanie ma ten nagłówek, bez wyjątków i bez wariantów:
AIvataryBot/1.0 (+https://aivatary.com/bot)Nie podszywamy się pod przeglądarkę i nie rozsypujemy się na wiele nazw. Reguła, którą wpiszesz na tę nazwę, faktycznie nas dotyczy.
Jak go zablokować
Zwykłym wpisem w robots.txt. Czytamy ten plik przed pierwszym żądaniem do strony i szanujemy każdą dyrektywę Disallow:
User-agent: AIvataryBot
Disallow: /Możesz też zamknąć sam fragment serwisu, na przykład Disallow: /panel/. Blokada działa od następnego skanu.
Jakie obciążenie wnosi
Skan nie jest wyścigiem. Strony idą jedna po drugiej, nigdy równolegle.
| Odstęp między żądaniami | Co najmniej sekunda. Jeśli w robots.txt podasz Crawl-delay, bierzemy Twoją wartość, o ile jest większa, do dziesięciu sekund. |
| Równoległość | Brak. Jedno żądanie naraz do jednej strony. |
| Ile stron w jednym skanie | Najwyżej pięćdziesiąt, do trzech kliknięć od adresu startowego. |
| Zakres | Wyłącznie ta sama domena i ten sam protokół co adres startowy. Subdomeny są poza zakresem. |
| Wielkość pobrania | Do dwóch megabajtów na stronę, z limitem czasu dziesięciu sekund. Grafikę, wideo i archiwa pomijamy w ogóle. |
Czego bot nie robi
Nie loguje się i nie wysyła formularzy
Wysyła wyłącznie żądania GET i nie dokłada do nich żadnych nagłówków uwierzytelniających. Nie kliknie „wyślij”, nie doda do koszyka, nie założy konta.
Nie wykonuje JavaScriptu
Czyta HTML, który odesłał serwer. Jeśli treść dokłada się dopiero w przeglądarce, bot jej nie zobaczy i tak to zaraportuje osobie zlecającej skan.
Nie omija zabezpieczeń
Nie rozwiązuje CAPTCHA, nie zmienia nazwy, żeby ominąć regułę, i nie próbuje ponownie z innego adresu. Ściana ochronna kończy sprawę.
Nie trenuje modeli na Twojej treści
Pobrany tekst służy wyłącznie do odpowiadania na pytania w instancji tego klienta, który skan zlecił. Modele językowe bierzemy z komercyjnych interfejsów w trybie bez trenowania.
Nie chodzi bez powodu
Nie prowadzimy własnego indeksu internetu. Bot rusza wtedy, gdy człowiek w panelu AIvatary poda konkretny adres, i kończy, gdy przejdzie tę jedną stronę.
Nie publikuje niczego sam
Pobrana treść czeka jako materiał roboczy, dopóki człowiek jej nie zatwierdzi. Bez tej decyzji agent nie zacytuje ani zdania.
Masz pytanie albo skargę
Napisz na contact@aivatary.com. Podaj domenę i przybliżoną godzinę wpisów w logu, a sprawdzimy, który skan to był, i zatrzymamy go, jeśli o to poprosisz.
Nie utrzymujemy stałej listy adresów IP, z których wychodzi bot, więc nie prosimy o wpisywanie nas na listę dozwolonych po adresie. Rozpoznawaj nas po nazwie w nagłówku User-Agent.