SEO
كيف تشخّص مشكلات خريطة الموقع XML، خطوة بخطوة
ينبغي أن تكون خريطة الموقع قائمة نظيفة بالصفحات التي تريد فهرستها. كيف تتحقق من أن خريطتك تُحمَّل وتُحلَّل ولا تسرد إلا عناوين URL فعّالة وقابلة للفهرسة، وكيف تصلحها إن لم تكن كذلك.
في هذه الصفحة
خريطة الموقع XML قائمة بعناوين URL التي تودّ أن تزحف إليها محركات البحث وتفهرسها. وهي لا تضمن الفهرسة، لكن الخريطة النظيفة تعين محركات البحث على اكتشاف الصفحات الجديدة والمحدَّثة، والخريطة الفوضوية تبدّد انتباهها على عمليات إعادة التوجيه والأخطاء والصفحات التي طلبت منها ألّا تفهرسها. وإن كان الملف نفسه جديدًا عليك فابدأ بمقال شرح robots.txt و sitemap.xml.
مشكلات خريطة الموقع قسمان: الملف نفسه (هل يمكن العثور عليه وقراءته؟) ومحتواه (هل العناوين التي فيه جديرة بالإدراج؟). افحصهما بهذا الترتيب.
الجزء 1: هل يمكن العثور على خريطة الموقع وقراءتها؟
هل هي حيث تبحث محركات البحث؟
لا يوجد موضع إلزامي واحد، فاجعلها قابلة للاكتشاف. أضف إلى ملف robots.txt سطرًا بعنوان مطلق Sitemap: https://example.com/sitemap.xml، وأرسل خريطة الموقع في Google Search Console و Bing Webmaster Tools. وكثير من المنصات يولّد خريطة عند /sitemap.xml أو /sitemap_index.xml أو /wp-sitemap.xml.
هل تعيد 200 مع XML؟
افتح عنوان خريطة الموقع في المتصفح وتحقق من الحالة في أدوات المطوّرين. من الإخفاقات الشائعة: 404 بعد تغيير في إضافة، أو إعادة توجيه إلى الصفحة الرئيسية، أو صفحة تسجيل دخول، أو خطأ «ناعم»، أي استجابة 200 هي في الحقيقة صفحة خطأ HTML. ينبغي أن تكون الاستجابة XML (application/xml أو text/xml)، أو XML مضغوطًا بـ gzip لملفات .xml.gz.
هل تُحلَّل بلا أخطاء؟
يجب أن يكون العنصر الجذر <urlset> (قائمة صفحات) أو <sitemapindex> (قائمة بخرائط موقع أخرى). والمتهمون المعتادون: مسافات زائدة أو تحذيرات PHP قبل تصريح <?xml، ومحارف & غير مهرَّبة في العناوين (يجب أن تُكتب &)، ومُخرَجات مبتورة بسبب انتهاء المهلة. والمتصفح الذي يعرض «XML parsing error» يدلّك على موضع النظر بالضبط.
هل هي ضمن الحدود المسموح بها؟
يتسع ملف خريطة الموقع الواحد لـ 50,000 عنوان URL و 50 ميغابايت دون ضغط على الأكثر. والمواقع الأكبر توزّع عناوينها على عدة ملفات وتسردها في فهرس خرائط الموقع. وتأكد من أن كل خريطة فرعية يسمّيها الفهرس تُحمَّل هي أيضًا.
الجزء 2: هل العناوين المدرجة هي الصحيحة؟
كل عنوان URL في خريطة موقعك ينبغي أن يكون العنوان النهائي الأساسي القابل للفهرسة لصفحة تعيد 200. وكل ما عدا ذلك يبعث رسالة متضاربة. ابحث عن:
- عناوين URL تعيد 404 أو 410 أو 5xx. صفحات محذوفة بقيت في خريطة موقع ثابتة، أو منتجات نفد مخزونها فأُزيلت.
- عناوين URL تعيد التوجيه. وهي في الغالب الصيغة القديمة للعنوان بعد ترحيل، أو نسخة
http://أو النسخة بدونwww. أدرج الوجهة بدلًا منها. - صفحات noindex. إدراج صفحة مع أمر محركات البحث بألّا تفهرسها تناقض. راجع ما معنى noindex.
- عناوين URL غير أساسية. نسخ بمعاملات، أو صفحات مكرَّرة يشير وسم canonical فيها إلى مكان آخر. المزيد في كيف تصلح مشكلات canonical.
- مضيفون آخرون. لا يجوز لخريطة الموقع أن تسرد إلا عناوين على مضيفها هي، ما لم تكن قد وثّقت الإرسال بين المواقع؛ وأسماء مضيفي البيئة التجريبية أو CDN تسرّب معهود.
- تكرارات. العنوان نفسه مدرج مرتين، وفي الغالب مرة بشرطة مائلة في آخره ومرة بدونها.
- عناوين URL محظورة في robots.txt. محركات البحث لا تستطيع الزحف إلى ما منعته، فإدراجه لا طائل منه.
تواريخ lastmod
ينبغي أن يستخدم <lastmod> صيغة W3C Datetime، مثل 2026-09-24 أو 2026-09-24T10:30:00+00:00، وأن يعكس آخر تغيير ذي شأن في الصفحة. تقول Google إنها تستخدم lastmod حين يكون دقيقًا على الدوام، وإنها تتجاهل priority و changefreq. والخريطة التي تختم كل عنوان بتاريخ اليوم عند كل عملية بناء تعلّم محركات البحث تجاهل هذا الحقل.
افحص ملف robots.txt وخريطة الموقع
يجلب فاحص SEO المجاني من Rudra ملف robots.txt وخرائط الموقع المصرَّح بها، ويبلّغك هل تُحمَّل وتُحلَّل، وهل تسرد الصفحة التي اختبرتها، وهل تحمل تواريخ lastmod صالحة.
كيف تفحصها باستخدام Rudra
فاحص SEO للصفحة الواحدة
يقرأ فاحص SEO المجاني من Rudra ملف robots.txt وخرائط الموقع التي يصرّح بها (حتى ثلاث خرائط، متتبّعًا فهرس خرائط الموقع إلى أولى خرائطه الفرعية)، ويلجأ إلى المواضع الشائعة حين لا يُصرَّح بأي خريطة. ويبلّغ عن الخرائط التي يتعذّر الوصول إليها، أو لا تُحلَّل، أو لا تسرد الصفحة التي اختبرتها، أو تخلو من تواريخ lastmod، مع ملاحظات إعلامية عن العناوين المكرَّرة، والعناوين على مضيفين آخرين، وقيم lastmod التي ليست تواريخ صالحة. وينبّه كذلك إلى مشكلات الصياغة في robots.txt وإلى القاعدة التي تحظر الموقع كله.
فحص الموقع
لا سبيل إلى معرفة هل تعمل العناوين المدرجة فعلًا إلا بزيارتها. فحص الموقع من Rudra (بحساب مجاني، ويبدأ من لوحة التحكم) يسجّل العناوين الواردة في خريطة موقعك ويقارنها بما وجده الزحف عند كل عنوان: عناوين الخريطة التي أعادت 4xx أو 5xx، والعناوين الموسومة بـ noindex، والعناوين التي أعادت التوجيه، والعناوين على مضيفين آخرين. أما العناوين التي لم يبلغها الزحف، بسبب حدّ الصفحات في خطتك أو قواعد robots، فتُحسب «لم يُزحف إليها» ولا يُبلَّغ عنها على أنها معطّلة؛ ولذلك سيُظهر زحف صغير لخريطة كبيرة كثيرًا منها، وهذا متوقَّع.
Search Console
يبيّن تقرير «ملفات Sitemap» هل استطاعت Google قراءة كل ملف وكم عنوان URL اكتشفت. وتقرير «فهرسة الصفحات»، بعد تصفيته بحسب خريطة موقع، يخبرك أيّ العناوين المدرجة غير مفهرس ولماذا.
إصلاح الأسباب الشائعة
- ولِّد خريطة الموقع من نظام إدارة المحتوى أو إطار العمل لديك، لا يدويًا، لتسقط منها الصفحات المحذوفة وغير المنشورة تلقائيًا.
- استبعد صفحات noindex والصفحات المُعاد توجيهها والصفحات التي يشير وسم canonical فيها إلى غيرها من إعدادات إضافة SEO أو مولِّد خريطة الموقع.
- استخدم صيغة عنوان URL المفضّلة لديك في كل مكان، من حيث البروتوكول والمضيف والشرطة المائلة الأخيرة، لتتفق خريطة الموقع ووسوم canonical والروابط الداخلية.
- لا تحدّث lastmod إلا عند تغيّر المحتوى.
- أعد الإرسال بعد التغييرات الكبيرة مثل الترحيل، وراقب تقرير «ملفات Sitemap» بحثًا عن أخطاء القراءة.
الأسئلة الشائعة
هل أحتاج إلى خريطة موقع؟
المواقع الصغيرة الجيدة الترابط يمكن الزحف إليها بلا مشكلة من دونها. وخريطة الموقع أنفع ما تكون في المواقع الكبيرة، والمواقع الجديدة التي تشير إليها روابط قليلة، والمواقع التي تضيف صفحات أو تحدّثها كثيرًا.
هل إدراج صفحة في خريطة موقعي يجعلها تُفهرس؟
لا. خريطة الموقع تعين محركات البحث على اكتشاف العناوين؛ أما فهرسة الصفحة فتتوقف على جودتها، وتكرارها، وإشارات مثل noindex أو وسوم canonical.
هل ينبغي إدراج الصور أو ملفات PDF في خريطة موقعي؟
يمكنك إدراجها، وثمة امتدادات لخرائط مواقع الصور، لكن الأولوية أن تكون كل صفحة HTML مهمة مدرجة بعنوانها الأساسي.
لماذا يقول فحص الموقع إن كثيرًا من عناوين خريطة الموقع لم يُزحف إليها؟
يتوقف الزحف عند حدّ الصفحات في خطتك ويلتزم بملف robots.txt، فقد لا يبلغ كل عنوان تسرده خريطة موقعك. وهذه العناوين لا تُعدّ معطّلة؛ كل ما في الأمر أنه لم يُتحقَّق منها في ذلك الزحف.