OrbitaOpenData/0.3
Crawler, якому можна
сказати «ні».
Як Orbita читає публічний веб, і як власник сайту може обмежити, виправити або видалити запис.
1. Ідентифікація
User-Agent: OrbitaOpenData/0.3 (+https://orbita.dev/crawler.html; contact: hello@orbita.ai)
У parser policy використовується product token OrbitaOpenData — той самий token, який бачить robots.txt.
2. Правила обходу
- Звичайні websites: robots.txt перевіряється; недоступний robots із помилкою fail-closed; crawl-delay дотримується.
- Не подаються credentials і не обходяться login/paywall/access controls.
- Кожен redirect повторно проходить allowlist, DNS/SSRF і origin checks.
- Завантаження має byte/time limits; host pacing обмежує паралельність.
- Офіційні open-data APIs можуть читатися за їхніми API/open-data правилами, де robots.txt не є відповідним control plane.
3. Robots opt-out
User-agent: OrbitaOpenData Disallow: /
Для часткового обмеження вкажіть конкретні paths. Зміна застосовується при наступній перевірці robots cache/recrawl; для термінового видалення надішліть request.
4. Removal / correction
Напишіть на hello@orbita.ai і додайте: URL або prefix, підтвердження контролю домену чи прав, що саме потрібно видалити/виправити, підставу та бажану відповідь. Security/identity details не публікуються.
Production launch gate: окрема ticket queue, monitored mailbox, audit trail, emergency disable і виміряний response target. До цього сторінка не обіцяє SLA, якого код не виконує.
5. Авторське право й personal data
Публічність URL не скасовує copyright або privacy. Orbita зберігає source URL/attribution, мінімізує excerpts у відповідях і приймає обґрунтовані requests від правовласників та суб’єктів даних. Повний content reuse потребує правової підстави клієнта.
6. Не training crawler
Мета OrbitaOpenData — retrieval/indexing, а не навчання foundation model. Окремі embeddings/OCR/Compact у поточному prototype можуть виконуватися зовнішніми model providers; це розкрито окремо і не перетворює crawl corpus на training dataset Orbita.