סורקי עוזרים: את מי להכניס לאתר ואיך לבדוק

סורקי עוזרים קובעים אם המותג יופיע בתשובות AI. כאן תמצאו איך מזהים אותם בלוג, איך חוסמים או פותחים גישה, ומה ההשפעה על התנועה.

צוות העריכה של ADS Beastפורסם 8 דקות קריאה

סורקי עוזרים הם תוכנות של צד שלישי, כמו GPTBot של OpenAI, PerplexityBot ו-ClaudeBot, שמורידות דפים מהאתר כדי לבנות תשובות לשאלות של משתמשים. הם לא מחזירים קליק כמו גוגל. הם קובעים אם המותג יופיע בתשובה. את מי להכניס תלוי במודל העסקי, ואיך בודקים זה לוג השרת.

בקצרה

  • קראולר של עוזר שולף תוכן בזמן אמת כדי לענות למשתמש, ולא כדי לאנדקס דפים בתוצאות חיפוש.
  • הזהות של כל סורק נמצאת ב-User-Agent שלו, ושם מתחילה כל בדיקה.
  • רוב הסורקים מצייתים ל-robots.txt, אבל זו בקשה ולא אכיפה.
  • חסימה לא פוגעת בדירוג בגוגל, אבל מוציאה את האתר מהתשובות של ChatGPT, Perplexity ו-AI Overviews.
  • הבדיקה המעשית היא לוג השרת: תדירות, נתיבים וכתובות IP.

מהם סורקי עוזרים ומה הם עושים בפועל

סורק עוזר הוא תוכנה שסורקת דפים בשם צד שלישי כדי לענות על שאלות משתמשים. הבוט מגיע לכתובת, מוריד את ה-HTML, מפרש את הטקסט, ולפעמים גם את הקישורים שבתוכו, ומחזיר את החומר למודל שמנסח תשובה. אין כאן כניסה של גולש, אין רישום ב-Analytics, ואין קליק.

ההבדל המרכזי מול בוט אינדוקס כמו Googlebot הוא המטרה. Googlebot אוסף דפים כדי לבנות אינדקס שממנו יגיעו תוצאות חיפוש, וזו תנועה עתידית פוטנציאלית. קראולר של עוזר אוסף תוכן כדי לספק תשובה אחת עכשיו. אם האתר לא נכלל במקורות שהמודל שולף מהם, התשובה תיבנה בלעדיו.

יש לזכור שרוב העוזרים לא סורקים את כל האינטרנט בכל שאלה. הם משלבים בין מה שהם מושכים בזמן אמת לבין מה שנמצא באינדקס פנימי או במודל עצמו. לכן נוכחות עקבית של תוכן ברור ומעודכן משפיעה יותר מאשר דף בודד.

אילו סורקים קיימים ואיך מזהים אותם

כל סורק מזדהה במחרוזת User-Agent משלו, ושם מתחילה הזהות שלו. רשימה חלקית של שמות שמופיעים בלוגים:

סורקUser-Agentמטרה עיקרית
OpenAIGPTBotאיסוף תוכן לאימון ולשיפור מודלים
OpenAIChatGPT-Userשליפת דף בזמן אמת כשמשתמש מבקש
AnthropicClaudeBotאיסוף תוכן עבור המודל
PerplexityPerplexityBotבניית תשובות עם מקורות
GoogleGoogle-Extendedשליטה בשימוש בתוכן למודלי AI של גוגל

הטבלה לא ממצה את השוק. סורקים חדשים מופיעים, וחלקם משנים שם או מתחזים ל-User-Agent של דפדפן רגיל. זו הסיבה שזיהוי לפי מחרוזת בלבד לא מספיק. אימות מלא דורש השוואה בין ה-User-Agent לבין כתובות ה-IP שמהן הגיעה הבקשה, ולכן חשוב לבדוק את המקור ולא רק את השם.

הערה מעשית: Google-Extended לא סורק בעצמו. הוא כלי הצהרתי שקובע אם התוכן ישמש למודלי ה-AI של גוגל, ובפועל נשלט דרך robots.txt. אם אתם רוצים להשאיר את גוגל בחיפוש אבל להוציא אותו מהמודל, זה הכלי.

איך בודקים אם סורק עוזר נכנס לאתר

הבדיקה המעשית היא לוג השרת. פותחים את הקובץ, מחפשים את מחרוזות ה-User-Agent של הסורקים, ומסתכלים על שלושה דברים: תדירות הביקורים, כתובות ה-IP, ונתיבי הדפים שנסרקו. אם אין רשומות כאלה, הסורק לא מגיע או שהוא חסום.

סדר הבדיקה:

  1. פתחו את לוג הגישה של השרת או של ה-CDN.
  2. סננו לפי User-Agent: GPTBot, ChatGPT-User, PerplexityBot, ClaudeBot, Google-Extended.
  3. בדקו את כתובות ה-IP מול הטווחים המפורסמים של כל ספק.
  4. בדקו אילו נתיבים נסרקו: דף הבית בלבד, בלוג, דפי מוצר, קבצי sitemap.
  5. בדקו את קוד התגובה: 200 אומר שהתוכן נמסר, 403 או 429 אומרים שהשרת חסם.
  6. השוו בין תקופות. ירידה חדה בסריקה אחרי שינוי ב-robots.txt או ב-WAF מעידה שהחסימה עבדה.

כלים כמו Cloudflare, לוג אנלייזרים או סקריפטים ייעודיים חוסכים את הסינון הידני, במיוחד באתרים עם תנועה גבוהה. בלי כלי כזה, סינון של קובץ לוג גדול הופך למשימה של שעות.

מה שבודקים אחר כך הוא לא רק אם הסורק נכנס, אלא מה הוא לקח. אם הוא סורק רק את דף הבית ולא נכנס לעמודי התוכן, כנראה שהקישורים הפנימיים לא מספיק ברורים או שה-sitemap לא מעודכן. תיקון המבנה הפנימי משפיע על הסריקה יותר מאשר כל בקשה ידנית.

בדיקת סורקי עוזרים בלוג השרת. פתחו את לוג הגישה: בשרת או ב-CDN, שם נשמרות כל הבקשות; סננו לפי User-Agent: GPTBot, ChatGPT-User, PerplexityBot, ClaudeBot, Google-Extended; בדקו כתובות IP: השוו לטווחים המפורסמים של כל ספק; בדקו נתיבים וקודי תגובה: 200 נמסר, 403 או 429 נחסם; השוו בין תקופות: שינוי ב-ro
שישה שלבים מסינון הלוג ועד השוואה בין תקופות

איך חוסמים סורק עוזר ב-robots.txt

חוסמים על ידי הוספת שורה עם שם הסוכן ופקודת Disallow. לדוגמה, User-agent: GPTBot ואחריה Disallow: /. אפשר לחסום סוכן בודד בלי לפגוע בגוגל, למשל User-agent: PerplexityBot עם Disallow: /.

שתי מגבלות שחייבות להיות ברורות. robots.txt הוא בקשה, לא אכיפה, וחלק מהסורקים פשוט מתעלמים ממנו. מעבר לזה, גם סורק שמכבד את הקובץ לא ייחסם אם הוא מגיע דרך צד שלישי שמסתיר את זהותו. חסימה חזקה יותר נעשית ברמת השרת או ה-CDN לפי User-Agent, ולפעמים גם לפי טווחי IP.

אם אתם רוצים לשלוט במדויק, הפעולה הנכונה היא לחסום ברמת ה-WAF ולהחזיר קוד 403. זה עובד גם מול סורקים שלא קוראים robots.txt. החסרון: כל שינוי בכללי החסימה דורש תחזוקה, וטעות בהגדרה עלולה לחסום גם בוטים לגיטימיים.

קובץ נפרד שרלוונטי כאן הוא llms.txt: קובץ שמכוון מודלי שפה לתוכן שלך. הוא לא מחליף robots.txt, אבל הוא נותן למודלים מפה של התוכן שאתם רוצים שישתמשו בו.

ההשפעה על דירוג בגוגל ועל התנועה

אין השפעה ישירה על הדירוג בגוגל כשחוסמים סורקי עוזרים, כי Googlebot נשאר פתוח. החסימה לא מורידה מיקומים בתוצאות החיפוש. מה שכן קורה הוא אובדן נוכחות בתשובות של ChatGPT, Perplexity ו-AI Overviews.

התנועה שמגיעה ממנועי חיפוש מבוססי AI עדיין קטנה ביחס לתנועה הכוללת באתרי תוכן. ההערכות שפורסמו ב-2024 דיברו על פחות מ-2% מהתנועה הכוללת. המספר המדויק משתנה מאוד לפי נישה, סוג אתר ומדינה, ולכן אין להסתמך על אחוז גורף. אתר תוכן טכני עם קהל שמשתמש בכלי AI יראה נתח גבוה יותר מאתר מקומי.

ההחלטה תלויה במודל העסקי. אתרי תוכן שתלויים בחשיפה ובמיתוג מפסידים כשהם חוסמים, כי השיחה על הנושא תתקיים בלעדיהם. חנויות ועסקים שמכרו דרך קליקים ישירים פחות מושפעים, כי המשתמש שמגיע מעוזר AI עדיין צריך להשלים רכישה באתר.

יש גם היבט שלא נמדד באנליטיקס: איך שהמותג מתואר בתשובות. אם התוכן שלכם הוא המקור שממנו נבנית התשובה, המותג מופיע כסמכות בתחום. אם חסמתם, מישהו אחר ממלא את התפקיד הזה.

לפתוח או לחסום סורק עוזר. פתיחה: חשיפה למותג: המותג מופיע בתשובה גם בלי קליק; פתיחה: תנועה ממוקדת: חלק מהעוזרים מוסיפים קישור למקור; חסימה: שליטה בתוכן: התוכן לא משמש לבניית תשובות; חסימה: אובדן נוכחות: השיחה על הנושא תתקיים בלעדיכם; חסימה: אין פגיעה בדירוג גוגל: Googlebot נשאר פתוח
ההחלטה תלויה במודל העסקי ובסוג הקהל

איך מחליטים את מי להכניס ואת מי לא

ההחלטה צריכה להיות מפורשת, מתועדת ומבוססת על שיקולים עסקיים. ברירת המחדל של רוב האתרים היא לפתוח גישה לסורקים שמוסיפים קישור למקור, ולשקול חסימה של סורקים שאוספים תוכן לאימון בלי להחזיר חשיפה.

גורמים שמשפיעים על ההחלטה:

  • מודל הכנסה: תוכן שנשען על פרסום וחשיפה מרוויח מנוכחות בתשובות; תוכן פרימיום בתשלום עלול להעדיף חסימה.
  • סוג הקהל: אם הקהל שלכם שואל שאלות בכלי AI, הנוכחות שם חשובה יותר.
  • עלות השרת: סריקה אגרסיבית של אתר כבד מייצרת עומס. לפעמים מגבילים בקצב במקום לחסום.
  • בלעדיות התוכן: תוכן ייחודי שקשה לשחזר הוא נכס. תוכן גנרי פחות.
  • תחרות: אם המתחרים פתוחים ואתם חסומים, התשובה תיבנה מהם.

העיקרון המעשי הוא לא לחסום כברירת מחדל ולא לפתוח כברירת מחדל. מגדירים מטרה, בודקים בלוג מה קורה בפועל, ומשנים לפי התוצאה.

טעויות נפוצות בבדיקה ובחסימה

הטעות הנפוצה ביותר היא להסתמך על Analytics בלבד. סורקי עוזרים לא מריצים JavaScript ולא נרשמים כמשתמשים, ולכן הם פשוט לא יופיעו שם. מי שבודק רק דרך Analytics מסיק בטעות שהסורק לא נכנס.

טעות שנייה היא חסימה גורפת של כל מה שמכיל "bot" ב-User-Agent. זה חוסם גם סורקים לגיטימיים שהאתר צריך, כמו בוטים של כלי SEO או ניטור זמינות. ההגדרה צריכה להיות מפורשת לפי שם.

טעות שלישית היא התעלמות מעומס. סריקה אגרסיבית יכולה להכביד על שרת חלש ולפגוע בזמני תגובה לגולשים אמיתיים. הפתרון הוא הגבלת קצב, לא בהכרח חסימה מלאה.

טעות רביעית היא שינוי ב-robots.txt בלי תיעוד. בעוד חצי שנה אף אחד לא יזכור למה סוכן מסוים חסום. רשמו את ההחלטה, את התאריך ואת הסיבה.

הצעד הבא

לפני שמחליטים את מי להכניס, בדקו מה קורה באתר עכשיו. סננו את לוג השרת לפי שמות הסורקים, ראו אילו דפים נסרקו ומה קוד התגובה. אם אין רשומות, סימן שהגישה חסומה או שהסורק לא מגיע, וזה הפער הראשון לתקן.

כדי לראות את התמונה המלאה של הנוכחות שלכם בתשובות AI, כולל אילו סורקים מגיעים ואיפה המותג מופיע, התחילו מסורקי עוזרים.

שאלות נפוצות

מה זה קראולר של עוזר ואיך הוא שונה מבוט רגיל? קראולר של עוזר הוא תוכנה שסורקת דפים בשם צד שלישי כמו ChatGPT, Perplexity או Google Gemini כדי לענות על שאלות משתמשים. בוט רגיל כמו Googlebot סורק בעיקר בשביל אינדוקס, בעוד שקראולר של עוזר שולף תוכן בזמן אמת כדי לבנות תשובה. ההבדל המרכזי הוא שהקראולר של העוזר לא מחזיר תנועה ישירה לאתר, אלא משמש כמקור מידע.

איך בודקים אם קראולר של עוזר נכנס לאתר? פותחים את לוג השרת ומסננים לפי User-Agent כמו GPTBot, ChatGPT-User, PerplexityBot, ClaudeBot או Google-Extended. בודקים את תדירות הביקורים, כתובות ה-IP ונתיבי הדפים שנסרקו. כלים כמו Cloudflare או לוג אנלייזר חוסכים את הסינון הידני. אם אין רשומות כאלה בלוג, סימן שהקראולר חסום או לא מגיע.

איך חוסמים קראולר של עוזר ב-robots.txt? מוסיפים לקובץ robots.txt שורה כמו User-agent: GPTBot ואחריה Disallow: /. אפשר לחסום סוכן ספציפי בלי לפגוע בגוגל, למשל User-agent: PerplexityBot עם Disallow: /. חשוב לזכור ש-robots.txt הוא בקשה ולא אכיפה, וחלק מהקראולרים מתעלמים ממנו. חסימה חזקה יותר נעשית ברמת השרת או ה-CDN לפי User-Agent.

מה קורה לדירוג בגוגל אם חוסמים קראולרים של עוזרים? אין השפעה ישירה על הדירוג בגוגל, כי Googlebot נשאר פתוח. אבל חסימת עוזרים מפחיתה סיכוי להופיע בתשובות של ChatGPT, Perplexity ו-AI Overviews. מחקרים מ-2024 מראים שתנועה ממנועי חיפוש מבוססי AI עדיין קטנה, פחות מ-2% מהתנועה הכוללת באתרי תוכן. ההחלטה תלויה במודל העסקי: אתרי תוכן מפסידים חשיפה, חנויות פחות מושפעות.

למה כדאי להכניס קראולר של עוזר לאתר בכלל? קראולרים של עוזרים מביאים חשיפה למותג גם בלי קליק, כי המשתמש רואה את שם האתר בתשובה. חלק מהעוזרים מוסיפים קישור למקור, וזה מייצר תנועה ממוקדת. בנוסף, נוכחות במקורות שמזינים מודלים משפיעה על איך שהמותג מתואר בעתיד. אם התוכן שלך הוא מקור סמכות בתחום, חסימה עלולה להשאיר את השיחה בלי הקול שלך.

מה ההבדל בין חסימה ב-robots.txt לחסימה ב-CDN? robots.txt הוא קובץ שהסורק אמור לקרוא ולכבד, אבל אין דרך לאכוף אותו. חסימה ב-CDN או ב-WAF פועלת ברמת השרת ומחזירה קוד שגיאה לכל בקשה, גם אם הסורק מתעלם מהקובץ. היתרון של CDN הוא אכיפה אמיתית; החיסרון הוא תחזוקה וסיכון לחסום בטעות בוטים לגיטימיים. אתרים רבים משלבים: robots.txt להצהרת כוונות, ו-CDN לאכיפה.