2026/09/21
robots.txt چیست؟ به زبان ساده، robots.txt یک فایل متنی است که در ریشه دامنه سایت (برای نمونه در آدرسی مانند example.com/robots.txt) قرار میگیرد و اولین سندی است که خزندههای موتورهای جستجو پیش از هر صفحه دیگری از سایت درخواست میکنند. این فایل به رباتهایی مانند Googlebot و Bingbot اعلام میکند کدام بخشهای سایت را اجازه دارند بخزند و کدام مسیرها را باید نادیده بگیرند.
با وجود سادگی ظاهریاش، robots.txt یکی از پرریسکترین فایلهای یک وبسایت از منظر سئو محسوب میشود. یک قاعده نوشتهشده با غفلت، یک اسلش در جای اشتباه، یا باقی ماندن تنظیمات محیط آزمایشی در نسخه نهایی سایت، میتواند در عرض چند دقیقه کل سایت را از چشم گوگل پنهان کند؛ آنهم بدون آنکه هیچ خطای قابلمشاهدهای در ظاهر سایت دیده شود. بخش قابل توجهی از افتهای ناگهانی ترافیک ارگانیک که مدیران سایت آن را به تغییرات الگوریتم گوگل نسبت میدهند، در واقع ریشه در همین چند خط تنظیمات دارد.
در ادامه این مطلب بررسی میکنیم که robots.txt دقیقاً چه کاری انجام میدهد، چرا برای سئوی سایت اهمیت دارد، کدام اشتباهات بیشترین آسیب را وارد میکنند، چه صفحاتی معمولاً باید از خزش مستثنی شوند، این فایل چه تفاوتی با تگ noindex دارد و چگونه باید آن را با sitemap.xml هماهنگ و بهدرستی تست کرد.
robots.txt پیادهسازی استانداردی به نام Robots Exclusion Protocol است؛ توافقی غیررسمی اما بهشدت پذیرفتهشده میان موتورهای جستجو که به آنها میگوید پیش از خزیدن در سایت، ابتدا این فایل را بخوانند و قوانین آن را رعایت کنند. فایل از چند دستور ساده تشکیل شده است: خطی با عنوان User-agent که مشخص میکند قوانین بعدی برای کدام ربات معتبر است (مقدار ستاره یعنی همه رباتها)، خطوطی با عنوان Disallow که مسیرهایی را که نباید خزیده شوند معرفی میکنند، خطوطی با عنوان Allow که در دل یک مسیر مسدود، استثنا ایجاد میکنند، و در نهایت دستور Sitemap که آدرس نقشه سایت را به ربات معرفی میکند.
نکتهای که کمتر جدی گرفته میشود این است که robots.txt یک دستور اجرایی قطعی نیست، بلکه بیشتر شبیه یک تابلوی راهنما عمل میکند. رباتهای معتبر مانند Googlebot این قوانین را رعایت میکنند، اما رباتهای مخرب یا اسکرپرهای ناشناس میتوانند آن را نادیده بگیرند. از سوی دیگر، چون این فایل بهصورت عمومی و بدون هیچ محدودیتی برای هر بازدیدکننده قابل مشاهده است، هرگز نباید از آن برای پنهانسازی مسیرهای حساس امنیتی استفاده کرد؛ چنین کاری در عمل به معنی اعلام آدرس همان مسیرها به هر کسی است که فایل را باز کند.
هر موتور جستجو برای هر سایت، مقدار مشخصی از منابع خزش را در نظر میگیرد که معمولاً از آن با عنوان بودجه خزش یاد میشود. اگر ربات گوگل زمان و منابع خود را صرف خزیدن در صفحات کمارزش، تکراری یا فنی سایت کند، ممکن است زمان کافی برای کشف و بهروزرسانی صفحات مهم و درآمدساز باقی نماند. این موضوع بهخصوص در سایتهای بزرگ با هزاران محصول، دستهبندی و پارامتر URL بسیار محسوس است.
robots.txt با هدایت هوشمندانه رباتها به سمت محتوای ارزشمند و دور نگهداشتن آنها از بخشهای بیاهمیت، به بهبود کارایی خزش، کاهش مشکلات محتوای تکراری و در نهایت ایندکس شدن سریعتر صفحات کلیدی کمک میکند. برای سایتهای کوچک شاید این موضوع تأثیر محدودی داشته باشد، اما برای فروشگاههای اینترنتی، سایتهای خبری یا پلتفرمهای با محتوای پویا، تنظیم درست این فایل بخشی جداییناپذیر از سئوی فنی است. اگر ساختار خزش و ایندکس سایت شما پیچیده شده و نیاز به بررسی دقیقتری دارد، بررسی این موارد در قالب یک خدمات سئو حرفهای میتواند مشکلات پنهان را پیش از آسیبرسانی شناسایی کند.
بیشتر خرابیهای بزرگ ناشی از robots.txt نتیجه چند اشتباه تکراری هستند که در نگاه اول بیضرر به نظر میرسند:
هدف اصلی robots.txt این نیست که هر چیز غیرعمومی را مسدود کنیم، بلکه باید ربات را از مسیرهایی دور نگه داریم که ارزش سئویی ندارند یا خزیدن در آنها بودجه خزش را بیدلیل هدر میدهد. نمونههای رایج این مسیرها عبارتند از:
طراحی درست این فهرست معمولاً بخشی از یک استراتژی سئوی فنی گستردهتر است که ساختار URL، ناوبری داخلی و اولویت خزش را همزمان در نظر میگیرد؛ موضوعی که در چارچوب یک پروژه سئو منسجم بررسی و اجرا میشود.
این دو ابزار اغلب با هم اشتباه گرفته میشوند، در حالی که کارکردشان کاملاً متفاوت است. دستور Disallow در robots.txt به ربات میگوید اصلاً به این آدرس سر نزند؛ یعنی ربات هیچگاه محتوای صفحه را نمیبیند. اما همین موضوع یک ایراد جدی به همراه دارد: اگر صفحهای از جای دیگری لینک گرفته باشد، گوگل میتواند وجود آن آدرس را تشخیص دهد و آن را در نتایج جستجو نشان دهد، حتی بدون آنکه محتوایش را دیده باشد؛ در چنین حالتی معمولاً عبارتی مانند «اطلاعاتی برای این صفحه در دسترس نیست» زیر لینک نمایش داده میشود.
در مقابل، تگ noindex به ربات اجازه میدهد صفحه را بخزد و ببیند، اما صریحاً از او میخواهد که این صفحه را در نتایج جستجو قرار ندهد. برای صفحاتی که واقعاً باید بهطور کامل از ایندکس خارج شوند، noindex ابزار قابلاعتمادتری است. قاعده عملی مهم این است که هرگز یک صفحه را همزمان هم در robots.txt مسدود و هم با noindex علامتگذاری نکنید؛ چون اگر ربات اجازه خزش نداشته باشد، اصلاً به تگ noindex نمیرسد و ممکن است آن صفحه همچنان بهصورت ناقص در نتایج باقی بماند. بهطور کلی، برای مسیرهایی که فقط میخواهید بودجه خزش را روی آنها هدر ندهید (مانند نتایج جستجوی داخلی)، robots.txt مناسب است؛ اما برای صفحاتی که باید بهطور قطعی از ایندکس گوگل حذف شوند، noindex انتخاب درستتری است.
اگر robots.txt نقش نگهبان ورودی سایت را دارد، sitemap.xml نقش نقشه راه را ایفا میکند. نقشه سایت فهرستی از آدرسهایی است که مالک سایت آنها را برای ایندکس شدن معرفی میکند، همراه با اطلاعاتی مانند زمان آخرین بهروزرسانی. این دو فایل معمولاً از طریق دستور Sitemap در robots.txt به یکدیگر متصل میشوند؛ یعنی در همان فایل robots.txt میتوان آدرس کامل sitemap.xml را معرفی کرد تا رباتها سریعتر آن را پیدا کنند.
نکته مهم، هماهنگی میان این دو فایل است. هیچگاه نباید آدرسی که در robots.txt مسدود شده، همزمان در sitemap.xml هم فهرست شود؛ این تناقض سیگنال گیجکنندهای به موتور جستجو میفرستد و اعتماد آن به کیفیت نقشه سایت شما را کاهش میدهد. همچنین باید مطمئن شوید خود فایل sitemap.xml هرگز در robots.txt مسدود نشده باشد، وگرنه ربات حتی به فهرست صفحات مهم سایت هم دسترسی نخواهد داشت.
بررسی robots.txt کاری چند دقیقهای است اما باید به یک عادت دورهای تبدیل شود، بهخصوص بعد از هر انتشار نسخه جدید سایت. سادهترین روش، باز کردن مستقیم آدرس دامنه به همراه robots.txt در مرورگر و خواندن دقیق خط به خط محتوای آن است. برای بررسی حرفهایتر، ابزار Search Console گوگل امکان بازرسی آدرسها (URL Inspection) را فراهم میکند که نشان میدهد آیا یک صفحه مشخص توسط robots.txt مسدود شده است یا نه.
در گزارش پوشش ایندکس همین ابزار، وضعیت «Blocked by robots.txt» بهصورت جداگانه فهرست میشود و میتوانید فوراً متوجه شوید کدام آدرسها بهاشتباه از دسترس ربات خارج شدهاند. بخش گزارش آمار خزش نیز اطلاعات مفیدی درباره الگوی رفتار Googlebot در سایت شما ارائه میدهد. توصیه عملی این است که پس از هر تغییر ساختاری، مهاجرت دامنه یا انتقال از محیط آزمایشی، حتماً محتوای فایل را دوباره بخوانید و در Search Console نتیجه واقعی خزش را رصد کنید؛ چون یک اشتباه کوچک در این فایل ممکن است هفتهها بدون علامت هشدار مشخص، ترافیک ارگانیک سایت را کاهش دهد.
robots.txt چیست؟ فایلی کوچک با تأثیری بزرگ بر سرنوشت سئوی سایت. این فایل بهتنهایی رتبه سایت را بالا نمیبرد، اما تنظیم نادرست آن میتواند بهسادگی همه زحمات تیم محتوا و توسعه را بیاثر کند. شناخت دقیق کارکرد Disallow و Allow، تمایز روشن میان مسدودسازی خزش و تگ noindex، هماهنگی این فایل با sitemap.xml و بازبینی منظم آن پس از هر تغییر، مجموعهای از عادتهای ساده اما ضروری برای هر مدیر سایت است. اگر میخواهید ساختار فنی سایت شما از این زاویه و دهها معیار دیگر سئوی فنی بررسی و اصلاح شود، تیم ما در حامد رضایی آماده است این ارزیابی را در قالب خدمات سئو برای شما انجام دهد.