דילוג לתוכן הראשי
robots.txt ·13 דק׳ קריאה ·מערכת ALBR

איזה בוט AI לחסום ואיזה להתיר — הטבלה המלאה וקובץ מוכן להעתקה

חסימת בוט אימון לא מוציאה אתכם מתשובות ה-AI. חסימת בוט אחזור כן — מיידית. כל מזהה בטבלה הזו נלקח מתיעוד רשמי של הספק, ולא מרשימה של צד שלישי.

שדה כדורי זכוכית, מעטים מהם מוארים ומחוברים בקווים

הטעות הנפוצה ביותר שראינו בקבצי robots.txt בעברית היא שורה אחת: חסימה גורפת של כל מה שנראה כמו AI. התוצאה היא שהאתר נעלם מתשובות של ChatGPT ו-Perplexity — בדיוק המקום שאליו כולם רוצים להיכנס — בזמן שהאימון על התוכן ממשיך דרך ערוצים אחרים.

ההבחנה שחייבים לעשות היא לא בין "AI" ל"לא AI". היא בין שלושה סוגי בוטים.

שלוש קטגוריות, שלוש החלטות שונות

בוט אימון אוסף תוכן כדי לאמן מודלים. חסימה שלו לא מוציאה אתכם מתשובות — היא מוציאה אתכם ממשקלי המודל הבא. בוט אחזור בונה את האינדקס שממנו נשלפות ומצוטטות תשובות. חסימה שלו מוציאה אתכם מתשובות ה-AI, מיידית. מושך לפי בקשת משתמש מביא עמוד אחד כי אדם ביקש עכשיו. חסימה שלו כמעט לא עושה כלום — כי רובם מצהירים במפורש שהם מתעלמים מ-robots.txt.

הטבלה — רק מזהים מתיעוד רשמי

כל מזהה כאן נקרא מדף התיעוד של הספק עצמו, לא מרשימת בוטים של צד שלישי. זה חשוב: מזהה שגוי בקובץ robots.txt הוא שורה שלא עושה כלום, ואתם לא תדעו.

מזההספקקטגוריהמציית ל-robots.txt
GPTBotOpenAIאימוןכן1
OAI-SearchBotOpenAIאחזורכן — חסימה מוציאה מתשובות החיפוש של ChatGPT1
ChatGPT-UserOpenAIבקשת משתמשלא בהכרח — "ייתכן שכללי robots.txt לא יחולו"1
OAI-AdsBotOpenAIפרסוםכן2
ClaudeBotAnthropicאימוןכן3
Claude-SearchBotAnthropicאחזורכן3
Claude-UserAnthropicבקשת משתמשכן — היוצא מן הכלל3
GooglebotGoogleחיפוש + AI Overviewsכן4
Google-ExtendedGoogleאימון וביסוס Gemini — מזהה בלבדכן4
PerplexityBotPerplexityאחזורכן8
Perplexity-UserPerplexityבקשת משתמשלא — "מתעלם בדרך כלל מ-robots.txt"8
bingbotMicrosoftחיפוש + Copilotכן13
meta-externalagentMetaאימוןכן9
meta-webindexerMetaאחזורכן9
meta-externalfetcherMetaבקשת משתמשלא — "עשוי לעקוף robots.txt"9
ApplebotAppleחיפושכן10
Applebot-ExtendedAppleאימון — מזהה בלבדכן10
AmazonbotAmazonמעורב — מוצרים ושירותים, "עשוי לשמש לאימון"כן11
Amzn-SearchBotAmazonאחזורכן11
CCBotCommon Crawlאימון (מזין מאגרי אימון)כן12

שלושה מקומות שבהם החלוקה נשברת

Google-Extended ו-Applebot-Extended הם לא זחלנים. גוגל כותבת במפורש שאין להם מחרוזת User-Agent נפרדת, ואפל כותבת ש-Applebot-Extended לא סורק עמודים כלל.4 10 הם מזהי מדיניות שנקראים מתוך robots.txt. לעולם לא תראו אותם בלוגים שלכם — וזו הסיבה הנפוצה למחשבה ש"החסימה לא עובדת".

Amazonbot הוא באמת מעורב-שימושים. אמזון אומרת שהוא משמש לשיפור מוצרים ושירותים וגם עשוי לשמש לאימון מודלים. אי אפשר לחסום את האימון בלי לחסום את השאר.

Googlebot הוא גם בוט חיפוש וגם בוט ה-AI Overviews. ראו את הסעיף הבא — זה הבלבול היקר ביותר בתחום.

השאלה של AI Overviews — ומה שהשתנה ביוני 2026

זו הנקודה שבה כמעט כל מדריך שקראנו שגוי, כולל מדריכים שעודכנו השנה.

חסימת Google-Extended לא מוציאה אתכם מ-AI Overviews. גוגל כותבת מפורשות ש-Google-Extended לא משפיע על הכללת אתר בחיפוש ואינו אות דירוג.4 הוא שולט אך ורק על אימון מודלי Gemini עתידיים, על אפליקציות Gemini ועל ביסוס תשובות ב-Vertex AI.

AI Overviews ו-AI Mode הם משטחי חיפוש, והם ניזונים מהאינדקס של Googlebot. גוגל הפנתה שנים ל-nosnippet, data-nosnippet, max-snippet ו-noindex כדרך להגביל מה מוצג.5 בפועל, הדרך היחידה ברמת robots.txt לצאת מ-AI Overviews הייתה לחסום את Googlebot — כלומר לצאת מגוגל.

מה חדש: מתג ב-Search Console

ב-3 ביוני 2026 גוגל הכריזה על שליטה חדשה — לא מזהה ב-robots.txt אלא מתג בממשק.7 הוא נמצא ב-Search Console תחת Settings → Search generative AI, ומונע הצגה של תוכן האתר ב-AI Overviews, ב-AI Mode ובתכונות ה-AI ב-Discover. גוגל מציינת במפורש שהתוצאה היא אפס תנועה ואפס חשיפות מהמשטחים האלה, ושהשינוי נכנס לתוקף תוך יום-יומיים.6

הוא לא משפיע על אימון — לזה עדיין Google-Extended.

סייג חשוב: דף העזרה של גוגל מציין שהמתג בהשקה הדרגתית לחלק מבעלי האתרים. ייתכן שהוא עדיין לא אצלכם.

קובץ מוכן להעתקה

הקובץ הזה מבטא את העמדה הנפוצה ביותר בקרב אתרי תוכן: כן להופיע בתשובות AI, לא לשמש כחומר אימון חינם.

# robots.txt — מותר לאחזור וציטוט, אסור לאימון
# עודכן: 30.08.2026

# --- בוטי אחזור: מותר. חסימה כאן = היעלמות מתשובות ---
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: meta-webindexer
Allow: /

User-agent: Amzn-SearchBot
Allow: /

User-agent: Googlebot
Allow: /

User-agent: bingbot
Allow: /

User-agent: Applebot
Allow: /

# --- בוטי אימון: אסור ---
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: CCBot
Disallow: /

# --- מעורב-שימושים: החלטה שלכם ---
# Amazonbot משמש גם למוצרים וגם עשוי לשמש לאימון.
# בטלו את ההערה כדי לחסום את שניהם יחד:
# User-agent: Amazonbot
# Disallow: /

# --- ברירת מחדל ---
User-agent: *
Allow: /

Sitemap: https://example.co.il/sitemap.xml

מה בכוונה לא נמצא בקובץ

ChatGPT-User, Perplexity-User, meta-externalfetcher — שלושתם מצהירים שהם עשויים להתעלם מ-robots.txt כשמשתמש יזם את הבקשה. שורת חסימה עבורם היא בעיקר הצהרת כוונות. Claude-User הוא היחיד מהקבוצה ש-Anthropic מתעדת כמציית.3

Bytespider — המזהה הזה מופיע בכל מדריך, אבל ByteDance לא מפרסמת תיעוד זחלנים רשמי כלשהו. המזהה נצפה בלוגים ומיוחס לה, אך לא אימתנו אותו מול מקור ראשוני. אם תוסיפו אותו, דעו שאתם מסתמכים על תצפית ולא על תיעוד.

FacebookBot — כבר לא מופיע בתיעוד הנוכחי של Meta. אל תסמכו על מדריכים שעדיין ממליצים עליו כשליטה על AI של Meta.9

מיקרוסופט: אין מזהה AI נפרד

מיקרוסופט לא מתעדת בוט AI נפרד. bingbot משרת גם את האינדקס וגם את התשובות של Copilot. הפתרון הרשמי הוא מטא-תגים ולא robots.txt:13

<!-- התוכן עשוי להופיע בתשובות, אך רק ככותרת, קישור וקטע -->
<meta name="bingbot" content="nocache">

<!-- התוכן לא ייכלל בתשובות ולא יקושר מהן -->
<meta name="bingbot" content="noarchive">

שניהם משמרים נראוּת רגילה בחיפוש של Bing.

מה שקובץ robots.txt לא יכול לעשות

זה החלק שמדריכים נוטים לדלג עליו, והוא החשוב ביותר להבנה של מה קניתם.

robots.txt הוא בקשה, לא מנעול. RFC 9309 קובע את הכללים לזחלנים מצייתים, אבל מציין במפורש: "כללים אלה אינם צורה של הרשאת גישה".14 אין אכיפה טכנית ואין מנגנון משפטי שהופך את הקובץ למחייב מעצם קיומו. חסימה אמיתית מחייבת שכבת WAF או ניהול בוטים בקצה.

וזה לא תיאורטי. באוגוסט 2025 Cloudflare פרסמה שרכשה דומיינים חדשים לגמרי, הגדירה בהם robots.txt שאוסר כל גישה אוטומטית — ואז שאלה את Perplexity עליהם וקיבלה תוכן מפורט. לטענתה זוהה זחלן לא מוצהר שהתחזה לדפדפן כרום רגיל.15 Perplexity הכחישה, וטענה ש-Cloudflare ייחסה לה בטעות תנועה של שירות צד שלישי, ושחלקה האמיתי קטן בסדרי גודל.16 המחלוקת לא הוכרעה בפומבי, ואנחנו מביאים את שני הצדדים. באוקטובר 2025 Reddit הגישה תביעה נגד Perplexity וגורמים נוספים בטענה לגריפה בהיקף תעשייתי.17

וגם ההפך נכון: אם האתר שלכם מאחורי Cloudflare, ההחלטה בקצה עשויה לגבור על robots.txt בשני הכיוונים. Cloudflare הודיעה שמ-15 בספטמבר 2026, זחלנים מעורבי-שימושים ייחסמו כברירת מחדל מעמודים שמציגים פרסומות — עבור לקוחות חדשים ועבור כל לקוחות התוכנית החינמית.19 שווה לבדוק מה מוגדר אצלכם לפני שמשקיעים בניסוח הקובץ.

מה מגיע אחרי robots.txt

שני מהלכים בעיצומם, ואף אחד מהם עדיין לא תקן.

IETF AIPREF. קבוצת עבודה פעילה שמנסחת אוצר מילים אחיד להעדפות שימוש ב-AI. הטיוטה מגדירה שתי קטגוריות בלבד — train-ai ו-search — ומצרפת אותן דרך כותרת HTTP בשם Content-Usage וכלל מקביל ב-robots.txt.20 21 נכון ל-30 באוגוסט 2026 שתי הטיוטות עדיין Internet-Drafts ולא RFC. אל תפרסו את זה כתקן.

Cloudflare Content Signals. שורה נוספת ב-robots.txt עם שלושה אותות: search, ai-input ו-ai-train.18 Cloudflare הוסיפה אותה אוטומטית לכ-3.8 מיליון דומיינים בניהולה. חשוב לדעת מה זה: Cloudflare עצמה כותבת שאלה העדפות ולא אמצעי נגד טכני לגריפה.

User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

סיכום מעשי

  1. תפרידו אחזור מאימון. זו ההחלטה היחידה שבאמת משנה. אל תחסמו OAI-SearchBot, PerplexityBot או Claude-SearchBot אלא אם אתם באמת רוצים להיעלם מהתשובות.
  2. Google-Extended הוא לא היציאה מ-AI Overviews. אם זה מה שאתם רוצים — המתג ב-Search Console, אם הוא כבר אצלכם.
  3. תעתיקו מזהים מתיעוד הספק בלבד. מזהה שגוי הוא שורה מתה.
  4. תבדקו את הלוגים אחרי שבוע. Google-Extended ו-Applebot-Extended לא יופיעו שם לעולם — זה תקין.
  5. אם אתם צריכים חסימה אמיתית ולא בקשה מנומסת — זה עובר בקצה, לא בקובץ טקסט.

כל המזהים בטבלה נקראו מתיעוד הספק ב-30 באוגוסט 2026. ספקים משנים את הרשימות האלה — אם מצאתם פער, נשמח לעדכון.

מקורות

כל מספר במאמר מקושר לשורה כאן. מחקרים שנערכו על ידי ספקי כלים מסומנים במפורש. כך אנחנו בוחרים מקורות.

  1. תיעוד הזחלנים של OpenAIOpenAI · נצפה 30.8.2026
  2. Advertiser guidance for allowing OpenAI web crawlersOpenAI · נצפה 30.8.2026
  3. Does Anthropic crawl data from the web, and how can site owners block the crawlerAnthropic · 7.4.2026
  4. Google crawlers and fetchersGoogle Search Central · עודכן 14.7.2026
  5. AI features and your websiteGoogle Search Central · עודכן 10.12.2025
  6. Search generative AI controlGoogle Search Console Help · נצפה 30.8.2026בהשקה הדרגתית לחלק מבעלי האתרים
  7. New controls for website ownersGoogle · 3.6.2026
  8. PerplexityBot documentationPerplexity · נצפה 30.8.2026
  9. Meta web crawlersMeta · נצפה 30.8.2026
  10. About ApplebotApple · 8.6.2026
  11. AmazonbotAmazon · נצפה 30.8.2026
  12. CCBotCommon Crawl · נצפה 30.8.2026
  13. Announcing new options for webmasters to control usage of their content in Bing ChatMicrosoft Bing · 22.9.2023
  14. RFC 9309 — Robots Exclusion ProtocolIETF · ספטמבר 2022
  15. Perplexity is using stealth, undeclared crawlers to evade website no-crawl directivesCloudflare · 4.8.2025טענה שנויה במחלוקת; ראו את תגובת Perplexity
  16. Agents or bots? Making sense of AI on the open webPerplexity · 4.8.2025
  17. Reddit sues Perplexity and others over scrapingSearch Engine Land · 22.10.2025
  18. Content Signals PolicyCloudflare · 24.9.2025
  19. Cloudflare's new policy pushes AI companies to pay for publishers' contentTechCrunch · 1.7.2026
  20. draft-ietf-aipref-vocabIETF AIPREF · טיוטה 07, 19.8.2026טיוטה, טרם RFC
  21. draft-ietf-aipref-attachIETF AIPREF · טיוטה 05, 18.8.2026טיוטה, טרם RFC

אנחנו משתמשים בעוגיות מדידה כדי להבין אילו מאמרים נקראים. הן נטענות רק אם תאשרו. פרטים מלאים במדיניות הפרטיות.