Web Crawler logo

درّب وكيلك الذكي على Web Crawler

المصادقة: Public crawling (no auth)مزامنة تزايديةتحديث كامل

زاحف Open يفهرس أي موقع عام توجّهه له — موقع التوثيق، مركز المساعدة، المدونة، قاعدة المعرفة، الصفحات التسويقية — ويغذّي المحتوى في معرفة الوكيل الذكي. ويعيد الزحف وفق جدول أنت اللي تحدده، عشان يظل الوكيل مواكباً لأي تغيير.

اربط مرة وحدة، و Open يتولى الباقي. حدّث المحتوى في Web Crawler وقت ما تريد، والتغيير يصل الوكيل الذكي من نفسه — بلا إعادة تدريب يدوية.

Web Crawler logoيتزامن معالوكيل الذكي

وش يتزامن

الصفحاتكل الصفحات القابلة للاكتشاف مع استخراج كامل للـ HTML.

Sitemapsيكتشف الصفحات اعتماداً على ملف sitemap.xml.

Selectorsيستخرج المحتوى بالاعتماد على CSS selectors.

المميزات

  • وعي بالـ sitemapيقرأ ملف sitemap.xml لو كان موجوداً، ويتتبّع الروابط اللي يكتشفها، ثم الروابط اللي داخلها.
  • إعادة زحف ذكيةيعيد الزحف وفق جدول (يومي أو أسبوعي أو شهري)، ويحدّث بس الصفحات اللي تغيّرت.
  • استخراج عبر Selectorsاضبط CSS selectors لتجاوز شريط التنقل والتذييل والإعلانات — فما يبقى إلا المحتوى اللي يحتاجه الوكيل.
  • معالجة JavaScriptيعالج تطبيقات SPA المعتمدة على JavaScript، عشان يفهرس أيضاً المحتوى المعروض من جهة العميل.

المتطلبات

  • موقع عام أو محمي بمصادقة basic auth

كيف تربطه

  1. 1.من داخل Open، انتقل لـ AI Training → Sources → Add Web Crawler
  2. 2.أدخل الـ seed URL، ورابط الـ sitemap اختيارياً
  3. 3.اضبط الـ selectors المراد تضمينها أو استثناؤها (شريط التنقل، التذييل، الإعلانات)
  4. 4.حدد جدول إعادة الزحف
  5. 5.شغّل عملية الزحف الأولى وراجع المحتوى المفهرس

ما تحتاج معرفته

  • يلتزم بملف robots.txt افتراضياً، وتقدر تتجاوزه للمواقع اللي تملكها
  • تطبيقات SPA المعتمدة على JavaScript مدعومة عبر المعالجة بمتصفح headless
  • حدود المعدل لكل نطاق تُبقي عمليات الزحف منضبطة

الأمان: Open يطلب صلاحية قراءة فقط على Web Crawler. لا نكتب ولا نعدّل ولا نحذف أي شيء من محتواك. جميع البيانات مشفّرة أثناء النقل وفي التخزين. متوافق مع SOC 2 Type II و GDPR.

جاهز تربط Web Crawler؟

تدريب الذكاء الاصطناعي ← المصادر ← Web Crawler