درّب وكيلك الذكي على Web Crawler
زاحف Open يفهرس أي موقع عام توجّهه له — موقع التوثيق، مركز المساعدة، المدونة، قاعدة المعرفة، الصفحات التسويقية — ويغذّي المحتوى في معرفة الوكيل الذكي. ويعيد الزحف وفق جدول أنت اللي تحدده، عشان يظل الوكيل مواكباً لأي تغيير.
اربط مرة وحدة، و Open يتولى الباقي. حدّث المحتوى في Web Crawler وقت ما تريد، والتغيير يصل الوكيل الذكي من نفسه — بلا إعادة تدريب يدوية.
وش يتزامن
الصفحات — كل الصفحات القابلة للاكتشاف مع استخراج كامل للـ HTML.
Sitemaps — يكتشف الصفحات اعتماداً على ملف sitemap.xml.
Selectors — يستخرج المحتوى بالاعتماد على CSS selectors.
المميزات
- •وعي بالـ sitemap — يقرأ ملف sitemap.xml لو كان موجوداً، ويتتبّع الروابط اللي يكتشفها، ثم الروابط اللي داخلها.
- •إعادة زحف ذكية — يعيد الزحف وفق جدول (يومي أو أسبوعي أو شهري)، ويحدّث بس الصفحات اللي تغيّرت.
- •استخراج عبر Selectors — اضبط CSS selectors لتجاوز شريط التنقل والتذييل والإعلانات — فما يبقى إلا المحتوى اللي يحتاجه الوكيل.
- •معالجة JavaScript — يعالج تطبيقات SPA المعتمدة على JavaScript، عشان يفهرس أيضاً المحتوى المعروض من جهة العميل.
المتطلبات
- •موقع عام أو محمي بمصادقة basic auth
كيف تربطه
- 1.من داخل Open، انتقل لـ AI Training → Sources → Add Web Crawler
- 2.أدخل الـ seed URL، ورابط الـ sitemap اختيارياً
- 3.اضبط الـ selectors المراد تضمينها أو استثناؤها (شريط التنقل، التذييل، الإعلانات)
- 4.حدد جدول إعادة الزحف
- 5.شغّل عملية الزحف الأولى وراجع المحتوى المفهرس
ما تحتاج معرفته
- يلتزم بملف robots.txt افتراضياً، وتقدر تتجاوزه للمواقع اللي تملكها
- تطبيقات SPA المعتمدة على JavaScript مدعومة عبر المعالجة بمتصفح headless
- حدود المعدل لكل نطاق تُبقي عمليات الزحف منضبطة
الأمان: Open يطلب صلاحية قراءة فقط على Web Crawler. لا نكتب ولا نعدّل ولا نحذف أي شيء من محتواك. جميع البيانات مشفّرة أثناء النقل وفي التخزين. متوافق مع SOC 2 Type II و GDPR.
جاهز تربط Web Crawler؟
تدريب الذكاء الاصطناعي ← المصادر ← Web Crawler
مصادر تدريب أخرى