GPT
מגזין · חדשות · 3 דקות קריאה ·

קלאודפלייר מאפשרת לחסום אימון AI בלי להיעלם מגוגל

מנגנון חדש של ענקית התשתית מפסיק את הבחירה האכזרית בין חשיפה בחיפוש לשאיבת תכנים, אבל מול בינג תצטרכו לעבוד קשה יותר והמסלול החינמי מסתמך על אמון.

מסדרון שרתי מחשוב שבו נתיבי אור דיגיטליים מתפצלים לשני כיוונים שונים
הפרדת נתיבים: מנועי החיפוש מקבלים אישור מעבר, מודלי השפה נשארים בחוץ. איור: GPT.org.il
מה לעשות עכשיו
  • היכנסו ללוח הבקרה של קלאודפלייר, ודאו שאימון מוגדר על Disallow AI Training ולא על Block, והוסיפו תגית NOARCHIVE אם אכפת לכם מבינג.

עברית קשה שפה, אבל מודלי שפה לומדים אותה מהר מדי על חשבון האתר שלכם. במשך שנתיים בעלי אתרים ומוציאים לאור בישראל נאלצו לבלוע גלולה מרה: מי שרצה שגולשים ימצאו אותו במנועי חיפוש נאלץ לאפשר לאותם סורקים לקחת את הטקסטים שלו ישירות לחוות האימון של מודלי ה־AI. עכשיו Cloudflare מנסה לפרק את המלכוד הזה באמצעות ארכיטקטורה חדשה שמפרידה בין אינדוקס לאימון.

פחות מ־1% מהאתרים ברשת חוסמים סורקי חיפוש מסורתיים, לעומת 17% שמנסים לחסום אימון מודלים. הבעיה נולדה כתוצאה מסורקים היברידיים (mixed-use crawlers). גוגל או אפל מפעילות בוט יחיד שמבצע שתי פעולות שונות לחלוטין. חסימה שלו ברמת ה־IP או ה־WAF פשוט מחקה את האתר מתוצאות החיפוש. ההגדרה החדשה, Disallow AI Training, נועדה לפתור את זה בדיוק מול חברות שזכו לסטטוס שקלאודפלייר מכנה Accountable.

סוף למלכוד של גוגל

השחקניות הקריטיות כאן הן Google ו־Apple, שמפעילות את הסורקים ההיברידיים הגדולים ברשת. הדרישה לקבלת הסטטוס כוללת התחייבות רשמית של המפעיל לכבד סירוב לאימון, מתן שקיפות ברמת הכתובת הבודדת (URL), ואבטחה מפורשת שסירוב לאימון לא יפגע בדירוג האורגני בחיפוש.

אם האתר שלכם חי מתנועה של גוגל אבל מסרב להאכיל מודלים בחינם, ההגדרה הזו היא מה שחיכיתם לו. אבל אל תמהרו לחגוג ניצחון מוחלט. סטטוס של אחריות הדדית נשמע נהדר על הנייר, אלא שמדובר בהסכם ג'נטלמני שמסתמך על הצהרות של ענקיות הטכנולוגיה ולא על מחסום קריפטוגרפי הרמטי.

לא הייתי ממהר לבנות על הבטחות של חברות שצריכות דאטה כדי לשרוד.

לוח מתגים מטאלי עם מחווני תאורה המציגים מצבי פעולה שונים
שליטה עדינה במקום חסימה גורפת: המעבר ממתג בינארי לסיווג משולש. איור: GPT.org.il

רובוט אחד, שני תפקידים

כדי שההפרדה הזו תעבוד, החברה השיקה את Bot Preference Sync. המערכת לוקחת את ההגדרות שלכם בלוח הבקרה ומזריקה אותן באופן דינמי לקובץ ה־robots.txt בראש העמוד, בלי שתצטרכו לערוך קבצים סטטיים בשרת. כאשר אתם מגדירים סירוב לאימון, המערכת מוסיפה פקודות Disallow מותאמות לסורקים ייעודיים כמו Google-Extended או Applebot-Extended, בזמן שהסורק הראשי ממשיך לגשת לתוכן עבור אינדקס החיפוש.

גוגל ואפל הצהירו שתגיות אלה אינן משפיעות על מיקומי האתר בתוצאות הרגילות. עם זאת, יש כאן מלכוד שקלאודפלייר מודה בו בחצי פה: המערכת עדיין אינה פותרת את בעיית סיכומי ה־AI בתוצאות החיפוש (AI Overviews). חסימת אימון לא מונעת מגוגל להציג את התשובה שלכם ישירות למשתמש בלי שהוא יקליק לאתר. החברה מבטיחה לפתח שליטה עדינה יותר על סיכומים עד תחילת השנה הבאה, אבל בינתיים התקצירים ממשיכים להישאב כרגיל.

האותיות הקטנות של מיקרוסופט

אם אתם בונים על מנוע החיפוש של מיקרוסופט, יש בעיה קונקרטית. Bingbot הוחרג מהסנכרון האוטומטי של robots.txt. מיקרוסופט מסרה שהיא תתמוך בהוראות no-training ברמת קובץ ה־robots.txt רק בתחילת 2027. עד אז, סימון Disallow AI Training בלוח הבקרה פשוט לא משפיע עליה.

Until that support launches, selecting Disallow AI Training will not automatically convey a no-training preference to Bing through robots.txt.פוסט ההשקה הרשמי של Cloudflare

כדי לחסום את מיקרוסופט מאימון בלי לפגוע באינדוקס בבינג נכון להיום, אתם חייבים להטמיע תגית מטא NOARCHIVE בתוך קוד העמודים שלכם, או להשתמש ידנית בכלי ניהול הכתובות בתוך Bing Webmaster Tools. שוב, ההבטחה לפשטות בלחיצת כפתור אחת נעצרת בתאימות הטכנולוגית של הצד השני.

חינם מול תשלום והסכנה

השירות אמנם זמין ממרכזי הנתונים בתל אביב ובחיפה לכל המשתמשים, אך קיים הבדל תהומי בין החבילות. במסלול החינמי של קלאודפלייר, זיהוי הבוטים נשען אך ורק על הצהרת ה־User-Agent שהסורק שולח. אם סורק של חברה לא מוכרת מתחזה לדפדפן רגיל ומפר את הכללים, החבילה החינמית לא תעצור אותו. זיהוי התנהגותי מתקדם שמנתח חתימות תעבורה נשאר פריבילגיה של לקוחות משלמים.

מגבלה נוספת פוגעת באתרים מבוססי פרסומות. קלאודפלייר מאפשרת לחסום סורקים רק בעמודים עם מודעות, אבל אי אפשר להחיל את Disallow AI Training רק על עמודים מסוימים דרך robots.txt. קובץ הכללים הוא אתרי וגורף, ורשימת הכתובות המציגות פרסומות דינמית מדי מכדי לייצג אותה שם. מי שמממן את האתר שלו מפרסומות חייב לבחור בין חסימה כוללת של אימון בכל הדומיין לבין חשיפה מלאה.

הדמיה נקייה של רשת צמתים ומרכזי נתונים מקושרים ברחבי העולם
במסלול החינמי ההסתמכות היא על מחרוזת בלבד, ללא ניתוח התנהגותי מלא ברשת. איור: GPT.org.il
השוואת מנגנוני הציות והחסימה של סורקי הענקיות תחת Disallow AI Training
מפעיל וסורקאיך זה עובד בפועלהשפעה על חיפושמגבלות ולוח זמנים
Google (Googlebot)חסימת Google-Extended ב־robots.txt דרך Bot Preference Syncאין פגיעה באינדוקס או בדירוג לפי גוגללא מונע שימוש בתוכן עבור AI Overviews בתוצאות החיפוש
Apple (Applebot)חסימת Applebot-Extended ב־robots.txtאין פגיעה באינדוקס החיפוש של אפלכלי שקיפות ברמת URL יושקו רק במהלך 2027
Microsoft (Bingbot)דרישה לתגית מטא NOARCHIVE בעמוד או חסימה בפורטלאין פגיעה בתוצאות בינג לפי מיקרוסופטתמיכה ב־robots.txt אוטומטי תחל רק בתחילת 2027
OpenAI / Anthropicחסימת סורקי אימון ייעודיים ברמת שרתי הקצהללא השפעה על מנועי חיפוש מסורתייםתקף מיידית; מופרד מבוטים המשמשים לחיפוש

מה לשנות בלוח הבקרה

החל מהשבוע, קלאודפלייר ביצעה מיגרציה אוטומטית להגדרות קיימות. אם הגדרתם בעבר חסימת AI גורפת, ברירת המחדל שלכם שונתה ל־Disallow AI Training לצד התרת סריקת חיפוש. עבור אתרי תוכן ומו״לים ישראליים, מומלץ לוודא שההגדרה הזו פעילה כדי להגן על זכויות היוצרים בלי לספוג צניחה בדירוגים בעברית. חנויות מקוונות, לעומת זאת, עשויות להעדיף לאפשר אימון כדי שמוצריהן יופיעו בהמלצות של מודלי שפה.

זה שווה רק אם אתם באמת עוקבים אחרי הלוגים שלכם.

מי שלא מנהל את ה־DNS שלו דרך קלאודפלייר לא מושפע מהשינוי ויצטרך להמשיך לנהל קובצי robots.txt ידנית. המחיר לחוסר תשומת לב הוא כפול: תבחרו ב־Block במקום Disallow, ותגלו שנעלמתם מגוגל תוך כמה ימים.

שאלות ותשובות

מה שואלים על זה

לפי הצהרות רשמיות של גוגל וקלאודפלייר, חסימת Google-Extended אינה משמשת כאות דירוג ואינה משפיעה על הופעת האתר בתוצאות החיפוש המסורתיות.

מיקרוסופט עדיין אינה תומכת בהוראות אימון AI מתוך קובץ robots.txt ותכבד אותן רק בתחילת 2027. כרגע יש להשתמש בתגית מטא NOARCHIVE או בכלי הניהול של בינג.

לא. ההגדרה מונעת אימון של מודלי תשתית אך אינה חוסמת סיכומי תשובות בתוך מנוע החיפוש. שליטה על סיכומים מתוכננת על ידי קלאודפלייר לתחילת השנה הבאה.

לא באופן מלא. במסלול החינמי הזיהוי נשען על מחרוזת ה־User-Agent בלבד. בוטים שמתחזים לדפדפנים רגילים ייחסמו רק באמצעות מנגנוני זיהוי התנהגותי ששמורים למנויים משלמים.
מקורות
  1. Have it both ways: stay discoverable in search while disallowing AI trainingblog.cloudflare.com · המקור
  2. Say it once: introducing Bot Preference Syncblog.cloudflare.com · דוקומנטציה
  3. Posts tagged "Developers" — Cloudflare Blogblog.cloudflare.com · דוקומנטציה
  4. Disallow AI Trainingblog.cloudflare.com · מקושר מההודעה
איך בדקנו

0 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ב־15 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.