איזה בוט AI לחסום ואיזה להתיר — הטבלה המלאה וקובץ מוכן להעתקה
חסימת בוט אימון לא מוציאה אתכם מתשובות ה-AI. חסימת בוט אחזור כן — מיידית. כל מזהה בטבלה הזו נלקח מתיעוד רשמי של הספק, ולא מרשימה של צד שלישי.

הטעות הנפוצה ביותר שראינו בקבצי robots.txt בעברית היא שורה אחת: חסימה גורפת של כל מה שנראה כמו AI. התוצאה היא שהאתר נעלם מתשובות של ChatGPT ו-Perplexity — בדיוק המקום שאליו כולם רוצים להיכנס — בזמן שהאימון על התוכן ממשיך דרך ערוצים אחרים.
ההבחנה שחייבים לעשות היא לא בין "AI" ל"לא AI". היא בין שלושה סוגי בוטים.
שלוש קטגוריות, שלוש החלטות שונות
בוט אימון אוסף תוכן כדי לאמן מודלים. חסימה שלו לא מוציאה אתכם מתשובות — היא מוציאה אתכם ממשקלי המודל הבא. בוט אחזור בונה את האינדקס שממנו נשלפות ומצוטטות תשובות. חסימה שלו מוציאה אתכם מתשובות ה-AI, מיידית. מושך לפי בקשת משתמש מביא עמוד אחד כי אדם ביקש עכשיו. חסימה שלו כמעט לא עושה כלום — כי רובם מצהירים במפורש שהם מתעלמים מ-robots.txt.
הטבלה — רק מזהים מתיעוד רשמי
כל מזהה כאן נקרא מדף התיעוד של הספק עצמו, לא מרשימת בוטים של צד שלישי. זה חשוב: מזהה שגוי בקובץ robots.txt הוא שורה שלא עושה כלום, ואתם לא תדעו.
| מזהה | ספק | קטגוריה | מציית ל-robots.txt |
|---|---|---|---|
GPTBot | OpenAI | אימון | כן1 |
OAI-SearchBot | OpenAI | אחזור | כן — חסימה מוציאה מתשובות החיפוש של ChatGPT1 |
ChatGPT-User | OpenAI | בקשת משתמש | לא בהכרח — "ייתכן שכללי robots.txt לא יחולו"1 |
OAI-AdsBot | OpenAI | פרסום | כן2 |
ClaudeBot | Anthropic | אימון | כן3 |
Claude-SearchBot | Anthropic | אחזור | כן3 |
Claude-User | Anthropic | בקשת משתמש | כן — היוצא מן הכלל3 |
Googlebot | חיפוש + AI Overviews | כן4 | |
Google-Extended | אימון וביסוס Gemini — מזהה בלבד | כן4 | |
PerplexityBot | Perplexity | אחזור | כן8 |
Perplexity-User | Perplexity | בקשת משתמש | לא — "מתעלם בדרך כלל מ-robots.txt"8 |
bingbot | Microsoft | חיפוש + Copilot | כן13 |
meta-externalagent | Meta | אימון | כן9 |
meta-webindexer | Meta | אחזור | כן9 |
meta-externalfetcher | Meta | בקשת משתמש | לא — "עשוי לעקוף robots.txt"9 |
Applebot | Apple | חיפוש | כן10 |
Applebot-Extended | Apple | אימון — מזהה בלבד | כן10 |
Amazonbot | Amazon | מעורב — מוצרים ושירותים, "עשוי לשמש לאימון" | כן11 |
Amzn-SearchBot | Amazon | אחזור | כן11 |
CCBot | Common Crawl | אימון (מזין מאגרי אימון) | כן12 |
שלושה מקומות שבהם החלוקה נשברת
Google-Extended ו-Applebot-Extended הם לא זחלנים. גוגל כותבת במפורש שאין להם מחרוזת User-Agent נפרדת, ואפל כותבת ש-Applebot-Extended לא סורק עמודים כלל.4 10 הם מזהי מדיניות שנקראים מתוך robots.txt. לעולם לא תראו אותם בלוגים שלכם — וזו הסיבה הנפוצה למחשבה ש"החסימה לא עובדת".
Amazonbot הוא באמת מעורב-שימושים. אמזון אומרת שהוא משמש לשיפור מוצרים ושירותים וגם עשוי לשמש לאימון מודלים. אי אפשר לחסום את האימון בלי לחסום את השאר.
Googlebot הוא גם בוט חיפוש וגם בוט ה-AI Overviews. ראו את הסעיף הבא — זה הבלבול היקר ביותר בתחום.
השאלה של AI Overviews — ומה שהשתנה ביוני 2026
זו הנקודה שבה כמעט כל מדריך שקראנו שגוי, כולל מדריכים שעודכנו השנה.
חסימת Google-Extended לא מוציאה אתכם מ-AI Overviews. גוגל כותבת מפורשות ש-Google-Extended לא משפיע על הכללת אתר בחיפוש ואינו אות דירוג.4 הוא שולט אך ורק על אימון מודלי Gemini עתידיים, על אפליקציות Gemini ועל ביסוס תשובות ב-Vertex AI.
AI Overviews ו-AI Mode הם משטחי חיפוש, והם ניזונים מהאינדקס של Googlebot. גוגל הפנתה שנים ל-nosnippet, data-nosnippet, max-snippet ו-noindex כדרך להגביל מה מוצג.5 בפועל, הדרך היחידה ברמת robots.txt לצאת מ-AI Overviews הייתה לחסום את Googlebot — כלומר לצאת מגוגל.
מה חדש: מתג ב-Search Console
ב-3 ביוני 2026 גוגל הכריזה על שליטה חדשה — לא מזהה ב-robots.txt אלא מתג בממשק.7 הוא נמצא ב-Search Console תחת Settings → Search generative AI, ומונע הצגה של תוכן האתר ב-AI Overviews, ב-AI Mode ובתכונות ה-AI ב-Discover. גוגל מציינת במפורש שהתוצאה היא אפס תנועה ואפס חשיפות מהמשטחים האלה, ושהשינוי נכנס לתוקף תוך יום-יומיים.6
הוא לא משפיע על אימון — לזה עדיין Google-Extended.
סייג חשוב: דף העזרה של גוגל מציין שהמתג בהשקה הדרגתית לחלק מבעלי האתרים. ייתכן שהוא עדיין לא אצלכם.
קובץ מוכן להעתקה
הקובץ הזה מבטא את העמדה הנפוצה ביותר בקרב אתרי תוכן: כן להופיע בתשובות AI, לא לשמש כחומר אימון חינם.
# robots.txt — מותר לאחזור וציטוט, אסור לאימון
# עודכן: 30.08.2026
# --- בוטי אחזור: מותר. חסימה כאן = היעלמות מתשובות ---
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: meta-webindexer
Allow: /
User-agent: Amzn-SearchBot
Allow: /
User-agent: Googlebot
Allow: /
User-agent: bingbot
Allow: /
User-agent: Applebot
Allow: /
# --- בוטי אימון: אסור ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: CCBot
Disallow: /
# --- מעורב-שימושים: החלטה שלכם ---
# Amazonbot משמש גם למוצרים וגם עשוי לשמש לאימון.
# בטלו את ההערה כדי לחסום את שניהם יחד:
# User-agent: Amazonbot
# Disallow: /
# --- ברירת מחדל ---
User-agent: *
Allow: /
Sitemap: https://example.co.il/sitemap.xml
מה בכוונה לא נמצא בקובץ
ChatGPT-User, Perplexity-User, meta-externalfetcher — שלושתם מצהירים שהם עשויים להתעלם מ-robots.txt כשמשתמש יזם את הבקשה. שורת חסימה עבורם היא בעיקר הצהרת כוונות. Claude-User הוא היחיד מהקבוצה ש-Anthropic מתעדת כמציית.3
Bytespider — המזהה הזה מופיע בכל מדריך, אבל ByteDance לא מפרסמת תיעוד זחלנים רשמי כלשהו. המזהה נצפה בלוגים ומיוחס לה, אך לא אימתנו אותו מול מקור ראשוני. אם תוסיפו אותו, דעו שאתם מסתמכים על תצפית ולא על תיעוד.
FacebookBot — כבר לא מופיע בתיעוד הנוכחי של Meta. אל תסמכו על מדריכים שעדיין ממליצים עליו כשליטה על AI של Meta.9
מיקרוסופט: אין מזהה AI נפרד
מיקרוסופט לא מתעדת בוט AI נפרד. bingbot משרת גם את האינדקס וגם את התשובות של Copilot. הפתרון הרשמי הוא מטא-תגים ולא robots.txt:13
<!-- התוכן עשוי להופיע בתשובות, אך רק ככותרת, קישור וקטע -->
<meta name="bingbot" content="nocache">
<!-- התוכן לא ייכלל בתשובות ולא יקושר מהן -->
<meta name="bingbot" content="noarchive">
שניהם משמרים נראוּת רגילה בחיפוש של Bing.
מה שקובץ robots.txt לא יכול לעשות
זה החלק שמדריכים נוטים לדלג עליו, והוא החשוב ביותר להבנה של מה קניתם.
robots.txt הוא בקשה, לא מנעול. RFC 9309 קובע את הכללים לזחלנים מצייתים, אבל מציין במפורש: "כללים אלה אינם צורה של הרשאת גישה".14 אין אכיפה טכנית ואין מנגנון משפטי שהופך את הקובץ למחייב מעצם קיומו. חסימה אמיתית מחייבת שכבת WAF או ניהול בוטים בקצה.
וזה לא תיאורטי. באוגוסט 2025 Cloudflare פרסמה שרכשה דומיינים חדשים לגמרי, הגדירה בהם robots.txt שאוסר כל גישה אוטומטית — ואז שאלה את Perplexity עליהם וקיבלה תוכן מפורט. לטענתה זוהה זחלן לא מוצהר שהתחזה לדפדפן כרום רגיל.15 Perplexity הכחישה, וטענה ש-Cloudflare ייחסה לה בטעות תנועה של שירות צד שלישי, ושחלקה האמיתי קטן בסדרי גודל.16 המחלוקת לא הוכרעה בפומבי, ואנחנו מביאים את שני הצדדים. באוקטובר 2025 Reddit הגישה תביעה נגד Perplexity וגורמים נוספים בטענה לגריפה בהיקף תעשייתי.17
וגם ההפך נכון: אם האתר שלכם מאחורי Cloudflare, ההחלטה בקצה עשויה לגבור על robots.txt בשני הכיוונים. Cloudflare הודיעה שמ-15 בספטמבר 2026, זחלנים מעורבי-שימושים ייחסמו כברירת מחדל מעמודים שמציגים פרסומות — עבור לקוחות חדשים ועבור כל לקוחות התוכנית החינמית.19 שווה לבדוק מה מוגדר אצלכם לפני שמשקיעים בניסוח הקובץ.
מה מגיע אחרי robots.txt
שני מהלכים בעיצומם, ואף אחד מהם עדיין לא תקן.
IETF AIPREF. קבוצת עבודה פעילה שמנסחת אוצר מילים אחיד להעדפות שימוש ב-AI. הטיוטה מגדירה שתי קטגוריות בלבד — train-ai ו-search — ומצרפת אותן דרך כותרת HTTP בשם Content-Usage וכלל מקביל ב-robots.txt.20 21 נכון ל-30 באוגוסט 2026 שתי הטיוטות עדיין Internet-Drafts ולא RFC. אל תפרסו את זה כתקן.
Cloudflare Content Signals. שורה נוספת ב-robots.txt עם שלושה אותות: search, ai-input ו-ai-train.18 Cloudflare הוסיפה אותה אוטומטית לכ-3.8 מיליון דומיינים בניהולה. חשוב לדעת מה זה: Cloudflare עצמה כותבת שאלה העדפות ולא אמצעי נגד טכני לגריפה.
User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /
סיכום מעשי
- תפרידו אחזור מאימון. זו ההחלטה היחידה שבאמת משנה. אל תחסמו
OAI-SearchBot,PerplexityBotאוClaude-SearchBotאלא אם אתם באמת רוצים להיעלם מהתשובות. Google-Extendedהוא לא היציאה מ-AI Overviews. אם זה מה שאתם רוצים — המתג ב-Search Console, אם הוא כבר אצלכם.- תעתיקו מזהים מתיעוד הספק בלבד. מזהה שגוי הוא שורה מתה.
- תבדקו את הלוגים אחרי שבוע.
Google-Extendedו-Applebot-Extendedלא יופיעו שם לעולם — זה תקין. - אם אתם צריכים חסימה אמיתית ולא בקשה מנומסת — זה עובר בקצה, לא בקובץ טקסט.
כל המזהים בטבלה נקראו מתיעוד הספק ב-30 באוגוסט 2026. ספקים משנים את הרשימות האלה — אם מצאתם פער, נשמח לעדכון.
מקורות
כל מספר במאמר מקושר לשורה כאן. מחקרים שנערכו על ידי ספקי כלים מסומנים במפורש. כך אנחנו בוחרים מקורות.
- תיעוד הזחלנים של OpenAI
- Advertiser guidance for allowing OpenAI web crawlers
- Does Anthropic crawl data from the web, and how can site owners block the crawler
- Google crawlers and fetchers
- AI features and your website
- Search generative AI controlבהשקה הדרגתית לחלק מבעלי האתרים
- New controls for website owners
- PerplexityBot documentation
- Meta web crawlers
- About Applebot
- Amazonbot
- CCBot
- Announcing new options for webmasters to control usage of their content in Bing Chat
- RFC 9309 — Robots Exclusion Protocol
- Perplexity is using stealth, undeclared crawlers to evade website no-crawl directivesטענה שנויה במחלוקת; ראו את תגובת Perplexity
- Agents or bots? Making sense of AI on the open web
- Reddit sues Perplexity and others over scraping
- Content Signals Policy
- Cloudflare's new policy pushes AI companies to pay for publishers' content
- draft-ietf-aipref-vocabטיוטה, טרם RFC
- draft-ietf-aipref-attachטיוטה, טרם RFC