درّب وكيلك الذكي على Web Crawler
زاحف Open يفهرس أي موقع عام توجّهه له — موقع التوثيق، مركز المساعدة، المدونة، قاعدة المعرفة، الصفحات التسويقية — ويغذّي المحتوى في معرفة الوكيل الذكي. ويعيد الزحف وفق جدول أنت اللي تحدده، عشان يظل الوكيل مواكباً لأي تغيير.
اربط مرة وحدة، وOpen يتولى الباقي. حدّث المحتوى في Web Crawler وقت ما تريد، والتغيير يصل الوكيل الذكي من نفسه — بلا إعادة تدريب يدوية.
وش يتزامن
الصفحات — كل الصفحات القابلة للاكتشاف مع استخراج كامل للـ HTML.
Sitemaps — يكتشف الصفحات اعتماداً على ملف sitemap.xml.
Selectors — يستخرج المحتوى بالاعتماد على CSS selectors.
المميزات
- •وعي بالـ sitemap — يقرأ ملف sitemap.xml لو كان موجوداً، ويتتبّع الروابط اللي يكتشفها، ثم الروابط اللي داخلها.
- •إعادة زحف ذكية — يعيد الزحف وفق جدول (يومي أو أسبوعي أو شهري)، ويحدّث بس الصفحات اللي تغيّرت.
- •استخراج عبر Selectors — اضبط CSS selectors لتجاوز شريط التنقل والتذييل والإعلانات — فما يبقى إلا المحتوى اللي يحتاجه الوكيل.
- •معالجة JavaScript — يعالج تطبيقات SPA المعتمدة على JavaScript، عشان يفهرس أيضاً المحتوى المعروض من جهة العميل.
المتطلبات
- •موقع عام أو محمي بمصادقة basic auth
كيف تربطه
- 1.من داخل Open، انتقل لـ AI Training → Sources → Add Web Crawler
- 2.أدخل الـ seed URL، ورابط الـ sitemap اختيارياً
- 3.اضبط الـ selectors المراد تضمينها أو استثناؤها (شريط التنقل، التذييل، الإعلانات)
- 4.حدد جدول إعادة الزحف
- 5.شغّل عملية الزحف الأولى وراجع المحتوى المفهرس
ما تحتاج معرفته
- يلتزم بملف robots.txt افتراضياً، وتقدر تتجاوزه للمواقع اللي تملكها
- تطبيقات SPA المعتمدة على JavaScript مدعومة عبر المعالجة بمتصفح headless
- حدود المعدل لكل نطاق تُبقي عمليات الزحف منضبطة
الأمان: Open يطلب صلاحية قراءة فقط على Web Crawler. لا نكتب ولا نعدّل ولا نحذف أي شيء من محتواك. جميع البيانات مشفّرة أثناء النقل وفي التخزين. متوافق مع SOC 2 Type II وGDPR.
جاهز تربط Web Crawler؟
تدريب الذكاء الاصطناعي ← المصادر ← Web Crawler
مصادر تدريب أخرى