كراولرات المساعدين: من تسمح له بالدخول إلى موقعك وكيف تتحقق من ذلك

دليل عملي لكراولرات المساعدين: كيف تتحقق من الزواحف المزيفة عبر DNS العكسي، وتفرّق بينها وبين زواحف البحث، وتضبط robots.txt أو الحجب على السيرفر.

فريق تحرير ADS Beastنُشر 9 دقائق قراءة

كراولرات المساعدين هي زواحف تجمع محتوى موقعك لتغذية نماذج الذكاء الاصطناعي أو لتوليد إجابات مباشرة داخل المحادثة، لا لعرض روابط في صفحة نتائج. التحقق منها لا يعتمد على سلسلة User-Agent لأنها قابلة للتزوير، بل على تحقق عكسي عبر DNS يقارن عنوان IP بالنطاق الرسمي المعلن. من فهم هذه الآلية يستطيع أن يقرر بوعي من يدخل ومن يُحجب.

باختصار

  • كراولرات المساعدين تستهلك محتواك وقد لا تعيد إليك زائراً، بخلاف زاحف محرك البحث الذي يجلب زيارات قابلة للقياس.
  • سلسلة User-Agent وحدها دليل ضعيف، لأن أي طرف يستطيع كتابة GPTBot في ترويسته.
  • التحقق الصحيح يمر بثلاث مراحل: عكس IP إلى نطاق، فحص لاحقة النطاق الرسمية، ثم إعادة تحويل النطاق إلى IP ومطابقته.
  • robots.txt بروتوكول طوعي، والحجب الفعلي يحتاج طبقة على مستوى السيرفر أو الشبكة.
  • لكل زاحف اسم User-agent مستقل، وسياسة الوصول تُكتب لكل واحد على حدة.

ما الذي يفرّق كراولرات المساعدين عن زواحف محركات البحث؟

زاحف محرك البحث يزحف لبناء فهرس يعرض روابط ومقتطفات، وهدفه النهائي إرسال زائر إلى صفحتك. زاحف المساعد يجمع المحتوى لتدريب نموذج أو لتوليد إجابة داخل المحادثة، وقد يلخّص صفحتك كاملة دون أن يفتحها أحد. الفرق العملي أن الأول يعيد إليك زيارات قابلة للقياس في سجلات التحليلات، أما الثاني فقد يستهلك المحتوى ويترك أثراً في سجلات الخادم فقط.

هذه التفرقة تحدد كل ما يأتي بعدها. إذا كنت تقيس نجاح موقعك بعدد الزيارات من محركات البحث، فزاحف المساعد ليس ضمن هذه المعادلة. وإذا كنت تعتبر المحتوى أصلاً له قيمة تدريبية، فأنت تتنازل عن جزء منه في كل زيارة. القرار ليس تقنياً فقط، بل تجاري.

من الأسماء الشائعة في هذه الفئة GPTBot وClaudeBot وGoogle-Extended وCCBot وPerplexityBot. لكل واحد منها ترويسة User-agent خاصة، ولكل منها سياسة وصول مستقلة في ملف robots.txt. لا تتعامل معها ككتلة واحدة، لأن غاياتها وأثرها على مواردك تختلف.

التحقق العكسي من زاحف مشتبه فيه. عكس عنوان IP: حوّل IP الزائر إلى اسم نطاق عبر استعلام PTR; فحص لاحقة النطاق: تأكد أنها googlebot.com أو google.com بالضبط; إعادة التحويل إلى IP: طابق الناتج مع العنوان الأصلي قبل القرار
ثلاث خطوات تثبت ملكية النطاق قبل السماح بالوصول

كيف تتحقق من أن الزاحف الذي يزور موقعك هو فعلاً من Googlebot؟

تعمل التحقق العكسي عبر DNS على ثلاث خطوات متتالية. لا تتوقف عند الخطوة الأولى، لأن أي مزوّر يستطيع شراء نطاق يشبه النطاق الرسمي.

  1. خذ عنوان IP الزائر من سجل الخادم، ثم حوّله إلى اسم نطاق عبر استعلام PTR عكسي.
  2. افحص النطاق الناتج: يجب أن ينتهي بـ googlebot.com أو google.com بالضبط، لا بنطاق يشبهه.
  3. حوّل النطاق نفسه مرة أخرى إلى عنوان IP، وتأكد أنه يطابق العنوان الأصلي الذي بدأت منه.

إذا نجحت الخطوات الثلاث، فالزاحف حقيقي. إذا فشلت واحدة منها، تعامل مع الزائر كمجهول بغض النظر عن ترويسته. هذا الأسلوب ينطبق على Google، وتتبعه محركات أخرى بمنهجيات مشابهة تنشرها في وثائقها الرسمية.

الخطأ الشائع هو الاعتماد على سلسلة User-Agent لأنها سهلة القراءة. سلسلة النص لا تثبت شيئاً، لأنها مجرد حقل يكتبه الطرف المتصل. التحقق العكسي يثبت ملكية النطاق، وهذه هي الفائدة الحقيقية.

من المفيد أيضاً مراجعة النطاقات الرسمية المنشورة من Google، مثل النمط crawl-66-249-66-1.googlebot.com، ومقارنة ما يظهر في سجلاتك بهذا النمط. الاختلاف في بنية الاسم مؤشر على تزوير أو على زاحف من جهة أخرى.

زاحف البحث مقابل زاحف المساعد. الهدف: فهرس روابط مقابل تدريب نموذج أو إجابة مباشرة; الزيارات: قابلة للقياس مقابل قد لا تجلب أي زائر; robots.txt: احترام مرتفع عادة مقابل احترام متغيّر; الحمل: منظم ومتوقع مقابل قد يكون كثيفاً على النصوص الطويلة
الفارق العملي يظهر في الزيارات والحمل على السيرفر

ما الفرق بين زاحف المساعد وزاحف محرك البحث من ناحية الأثر على الموقع؟

الفرق يظهر في ثلاثة أماكن: الحمل على السيرفر، وقيمة الزيارة، وقابلية القياس. زاحف محرك البحث يزحف بوتيرة منظمة ويحترم إشارات مثل sitemap وrobots.txt. زاحف المساعد قد يطلب صفحات كثيرة في وقت قصير، خصوصاً إذا كان محتواك غنياً بالنصوص الطويلة.

المعيارزاحف محرك البحثزاحف المساعد
الهدفبناء فهرس يعرض روابط ومقتطفاتتدريب نموذج أو توليد إجابة مباشرة
الأثر على الزياراتيجلب زيارات قابلة للقياسقد لا يجلب أي زائر
احترام robots.txtمرتفع عادةمتغيّر، وبعضه يتجاهله
الحمل على السيرفرمنظم ومتوقعقد يكون كثيفاً على المحتوى الطويل
طريقة التحققتحقق عكسي عبر DNSتحقق عكسي عبر DNS لكل زاحف

الجدول يوضح أن السؤال ليس «هل أسمح للزواحف؟» بل «أي زواحف أسمح لها، وبأي شروط؟». هذا السؤال يصبح مهماً أكثر عندما تلاحظ ارتفاعاً في استهلاك موارد الاستضافة دون زيادة مقابلة في الزيارات.

كيف تحجب كراولرات المساعدين عبر robots.txt؟

الحجب عبر robots.txt يتم بإضافة قاعدة User-agent مخصصة لكل زاحف تريد منعه، ثم سطر Disallow يمنعه من الموقع كامل. الملف يوضع على جذر النطاق مباشرة، ويجب أن يعيده السيرفر بحالة 200 لا 404.

مثال على البنية، وليس ملفاً جاهزاً للنسخ بلا مراجعة:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: PerplexityBot
Disallow: /

نقطة مهمة: Google-Extended ليس زاحفاً منفصلاً يزور موقعك، بل إشارة تتحكم في استخدام محتواك لأغراض تدريب نماذج Gemini. أما GPTBot وCCBot وClaudeBot وPerplexityBot فهي زواحف فعلية تظهر في سجلات الخادم بأسمائها.

قبل أن تعتمد على هذا الملف، تأكد من نقطتين: أن الملف في المسار الصحيح وأنه يُقرأ فعلاً، وأنك لا تحجب بالخطأ زاحف محرك البحث الذي يجلب لك زيارات. الخطأ الشائع هو كتابة قاعدة عامة تمنع كل الزواحف، ثم الاستغراب من تراجع الظهور في نتائج البحث.

إذا كنت تكتب ملفاً موجهاً لنماذج الذكاء الاصطناعي أصلاً، فاطّلع على ملف llms.txt: ما يحتاجه موقعك وما تكتبه فيه لأنه يعالج الجانب المعاكس: ما تريد أن تقرأه النماذج عنك، لا ما تريد منعه.

لماذا يستمر بعض الزواحف في الزيارة بعد حجبها في robots.txt؟

لأن robots.txt بروتوكول طوعي وليس جدار حماية. بعض الزواحف تتجاهله، وبعضها يعيد المحاولة من عناوين IP متغيرة، وبعضها يتبع نسخة قديمة من الملف محفوظة في ذاكرته المؤقتة. الحجب في robots.txt يعلن نيتك، لكنه لا ينفذها.

الحل الفعلي يقع في طبقة أخرى:

  1. الحجب على مستوى السيرفر أو الشبكة عبر Cloudflare أو جدار حماية تطبيقات الويب (WAF).
  2. إرجاع رمز 403 لعناوين IP المعروفة التي تنتمي إلى زواحف مرفوضة.
  3. ضبط حدود المعدل (rate limiting) لكل عنوان IP لتقليل الضغط حتى قبل قرار الحجب.
  4. مراجعة السجلات أسبوعياً، لأن عناوين الزواحف تتغير ولا تبقى ثابتة.

الترتيب هنا مقصود. ابدأ بالإعلان في robots.txt، ثم انتقل إلى التنفيذ على الشبكة، ثم راقب. إذا عكست الترتيب وبدأت بالحجب الصلب، فقد تحجب زاحفاً كنت تريده دون أن تلاحظ.

من الأخطاء التي تتكرر: الاعتماد على قائمة IP ثابتة وحدها. القوائم تتقادم، والزاحف الذي كان يعمل من نطاق معروف قد ينتقل إلى نطاق آخر. لذلك المراقبة الدورية ليست خطوة اختيارية، بل جزء من السياسة.

كم مرة تزور كراولرات المساعدين الموقع في اليوم؟

لا يوجد رقم ثابت ينطبق على كل موقع. المواقع الصغيرة تسجل عادة بين 50 و500 طلب يومياً من زواحف الذكاء الاصطناعي، وقد يقفز الرقم إلى آلاف إذا كان المحتوى غنياً بالنصوص الطويلة أو الصفحات الكثيرة. الرقم يعتمد على حجم المحتوى، وعدد الصفحات القابلة للزحف، ووتيرة تحديثها، وشهرة النطاق.

لتعرف حجم الاستهلاك الحقيقي، افتح سجلات الخادم ورتّب الطلبات حسب عمود User-Agent، ثم اجمعها حسب النطاق. هذه الطريقة أدق من الاعتماد على أي تقدير عام، لأنها تقيس ما يحدث على موقعك أنت.

إذا تجاوزت الزيارات حدود خطتك الاستضافية، يصبح الحجب على مستوى السيرفر ضرورة لا خياراً. وإذا كانت الزيارات معتدلة، فقد يكون الأجدى أن تتركها وتستفيد من ظهور محتواك في إجابات المساعدين. القرار يعتمد على نموذج عملك، لا على قاعدة عامة.

كيف تبني سياسة وصول واضحة لكراولرات المساعدين؟

السياسة الواضحة تبدأ من قرار تجاري ثم تُترجم إلى قواعد تقنية. اسأل أولاً: هل استهلاك محتواي من قبل النماذج يخدم مصلحتي أم يضرها؟ الإجابة تختلف بين موقع يعتمد على الإعلانات وموقع يبيع خدمة مباشرة.

بعد القرار، اتبع هذا الترتيب:

  1. حصر الزواحف التي تزور موقعك فعلاً من سجلات الخادم، لا من قوائم جاهزة.
  2. تصنيفها إلى مسموح ومرفوض بناءً على قرارك التجاري.
  3. كتابة قواعد robots.txt لكل فئة.
  4. التحقق العكسي عبر DNS للزواحف التي تشك فيها.
  5. ضبط الحجب على الشبكة للزواحف المرفوضة التي تتجاهل robots.txt.
  6. مراجعة دورية للسياسة، لأن أسماء الزواحف وسلوكها تتغير.

الخطوة الأولى هي الأكثر إهمالاً والأكثر أهمية. لا تبنِ سياستك على قائمة قرأتها في مقال، بل على ما يظهر في سجلاتك. القائمة تختلف من موقع لآخر، وقد تزورك زواحف لم تسمع بها.

إذا كنت تدير حملات مدفوعة وتحتاج أن تفهم كيف يقرأ الذكاء الاصطناعي ظهورك، فإن المبادئ نفسها تنطبق: القياس أولاً، ثم القرار. الأدوات تختلف، لكن المنطق واحد. ولمن يريد أن يربط بين الظهور في المساعدين وقياس الحملات، مُنشئ UTM: أنشئ رابط حملة صحيحًا خطوة بخطوة يشرح كيف تفرّق بين مصدر زيارة وآخر بدقة.

الخطوة التالية

افتح سجلات الخادم اليوم، واكتب استعلاماً واحداً يرتّب الطلبات حسب User-Agent. ستحصل على قائمة حقيقية بالزواحف التي تزور موقعك، وهذه القائمة هي أساس أي قرار. بعدها قرّر من تسمح له ومن تحجب.

للمتابعة العملية على مستوى ظهورك داخل المساعدين، ابدأ من كراولرات المساعدين حيث تجد كيف تتحكم في ما تراه النماذج عن موقعك.

الأسئلة الشائعة

كيف أتحقق من أن الزاحف الذي يزور موقعي هو فعلاً من Googlebot؟

اعمل تحققاً عكسياً عبر DNS. حوّل عنوان IP الزائر إلى اسم نطاق، واختبر أن النطاق ينتهي بـ googlebot.com أو google.com، ثم حوّل النطاق مرة أخرى إلى IP وتأكد أنه يطابق الأصل. لا تعتمد على سلسلة User-Agent وحدها لأنها قابلة للتزوير. راجع أيضاً النطاقات الرسمية المنشورة من Google مثل crawl-66-249-66-1.googlebot.com.

ما الفرق بين زاحف المساعد وزاحف محرك البحث التقليدي؟

زاحف محرك البحث يزحف لبناء فهرس يعرض روابط ومقتطفات، بينما زاحف المساعد مثل GPTBot أو ClaudeBot أو Google-Extended يجمع المحتوى لتدريب نماذج أو لتوليد إجابات مباشرة داخل المحادثة. الفرق العملي أن الأول يجلب زيارات قابلة للقياس، أما الثاني فقد يستهلك محتواك دون أن يعيد إليك زائراً، لذلك تحتاج سياسة وصول مختلفة لكل نوع.

كيف أمنع زواحف المساعدين من الوصول إلى موقعي عبر robots.txt؟

أضف قواعد User-agent مخصصة لكل زاحف تريد حجبه، مثل GPTBot وCCBot وClaudeBot وGoogle-Extended وPerplexityBot، واكتب بعدها Disallow: /. ضع القواعد في ملف robots.txt على الجذر مباشرة، وتأكد أن السيرفر يعيد الملف بحالة 200 لا 404. الحجب عبر robots.txt طوعي، لذا راجع سجلات الخادم دورياً للتأكد من الالتزام.

لماذا يستمر بعض الزواحف في زيارة موقعي بعد حجبها في robots.txt؟

لأن robots.txt بروتوكول طوعي وليس جدار حماية، وبعض الزواحف تتجاهله أو تعيد المحاولة من عناوين IP متغيرة. الحل الفعلي هو الحجب على مستوى السيرفر أو الشبكة مثل Cloudflare أو WAF، أو بإرجاع رمز 403 لعناوين IP المعروفة. راقب السجلات أسبوعياً لأن عناوين الزواحف تتغير ولا تبقى ثابتة.

كم مرة تزور زواحف المساعدين الموقع في اليوم؟

لا يوجد رقم ثابت، لكن المواقع الصغيرة تسجل عادة بين 50 و500 طلب يومياً من زواحف الذكاء الاصطناعي، وقد يقفز الرقم إلى آلاف إذا كان محتواك غنياً بالنصوص الطويلة. راقب عمود User-Agent في سجلات الخادم ورتب الزيارات حسب النطاق لتعرف حجم الاستهلاك الحقيقي. إذا تجاوزت الزيارات حدود خطتك الاستضافية، فالحجب على مستوى السيرفر يصبح ضرورة لا خياراً.