免費工具 · META ROBOTS 標籤產生器

meta robots 標籤產生器

一次做出 robots meta 標籤、對應的 X-Robots-Tag 標頭,以及給 AI 爬蟲的 robots.txt 區塊 —— 並且看到每個爬蟲最後真正吃到的「有效規則」。那通常不是多數產生器答應你的那一條。

免費即時免註冊不上傳任何東西

其他語言English繁體中文日本語한국어EspañolFrançaisDeutschPortuguês (Brasil)

robots meta · X-Robots-Tag · robots.txt
索引與連結

index 根本不是 Google 的規則 —— 沒有 robots 標籤的頁面本來就可以被索引。只有 noindex 會改變什麼。

摘要、預覽與到期

0 代表不給摘要;-1 讓 Google 自己決定。AI 總覽與 AI 模式同樣適用。

0 只允許靜態圖片;-1 代表不設上限。

過了這個日期,頁面會從結果中消失,Googlebot 也會大幅降低檢索頻率。

逐個爬蟲的規則

agent: rule, rule。這些只會「加」到上面的規則上,取消不了任何一條。

這些是 robots.txt 的 token,不是 meta 指令 —— 所以這一欄寫出來的是 robots.txt 區塊,不是標籤。

錯誤與警告
    meta 標籤 —— 貼進 head
    
                
    X-Robots-Tag —— 給 PDF、圖片,以及所有不是 HTML 的東西
    
                
    robots.txt —— AI 爬蟲
    
                

    一切都在這一頁裡跑。你輸入的內容不會被送到任何地方。

    怎麼做出一個真的照你意思運作的 robots meta 標籤

    挑好限制、需要的話補上逐個爬蟲的例外,然後讀「有效規則」。其中三項檢查之所以存在,是因為在這個關鍵字上排前面的工具把語意講錯了,不是語法。

    1. 先決定要限制什麼。 只有限制才算數。Google 的清單裡沒有「index」這條規則,而「all」被明寫出來時也沒有作用,所以一個你希望被索引的頁面,根本不需要標籤。
    2. 告訴它 robots.txt 有沒有擋住這個網址。 如果擋了、你又要 noindex,產生器會停下來。被擋住的頁面不會被抓取,noindex 也就永遠不會被讀到 —— 這是頁面遲遲離不開索引最常見的原因。
    3. 逐個爬蟲那幾行,只拿來「加嚴」。 規則是以負向規則的聯集合成的。爬蟲專用標籤可以對那個爬蟲更嚴格,但放寬不了任何東西。
    4. 不是 HTML 的東西,改用標頭版本。 PDF、圖片、CSV、動態產生的下載檔沒有 head 可以放標籤。X-Robots-Tag 用回應標頭載同一組規則,並附上 Apache 與 nginx 的設定片段。
    5. AI 爬蟲在 robots.txt 處理,不在這裡。 Google、OpenAI、Anthropic、Perplexity、Apple、Meta 與 Common Crawl 公布的每一個退出機制,都是 robots.txt 的 user-agent token。第三份輸出就是那個區塊。

    noindex 和 Disallow 會互相抵消

    meta robots 標籤產生器會幫你組出 <meta name="robots"> 標籤,告訴搜尋引擎這一頁要不要被索引、要不要跟著頁面上的連結走,以及可以把這一頁顯示到什麼程度。它可能幫你犯下的最貴的錯,不是打錯字,而是把這個標籤跟一行 Disallow 一起用。

    Google 自己的說法:noindex 規則要生效,頁面就不能被 robots.txt 擋住,而且必須是檢索器進得去的。被擋住的話,檢索器永遠看不到那條規則,而那個網址仍然可能因為別人指過來的連結出現在搜尋結果裡 —— 沒有摘要,也沒有你選的標題。

    很多人就卡在這個迴圈上。頁面離不開索引,於是再用 robots.txt 擋一次,結果保證它永遠離不開。連那條看起來最快的捷徑也是堵死的:在 robots.txt 裡寫 noindex,Google 並不支援。正確順序永遠是這三步:

    1. 拿掉 Disallow 那一行,讓頁面可以被檢索。
    2. 送出 noindex —— HTML 用 meta 標籤,其他東西用 X-Robots-Tag
    3. 等重新檢索。等頁面真的離開索引之後,擋掉檢索才有意義,而那時通常已經不需要了。

    表單裡那個勾選框存在的理由,就是讓產生器可以拒絕。在這個關鍵字上排第 1 與第 6 的工具,整頁連 Disallow 這個字都沒出現過。

    noarchive 在 Google 已經死了,在百度還活著

    「這條指令已經沒用了」這句話,對繁中讀者只對一半,因為多數繁中網站同時要面對兩件事:台灣這邊 Google 幾乎是唯一要算的引擎,而中文內容常常也會被百度收錄。這兩邊對同一條指令的態度是相反的。

    指令Google 搜尋百度
    noarchive已列入「歷史遺留、已不使用」—— 它控制的頁庫快取連結本身已不存在仍然是關掉快照的做法,寫成 <meta name="Baiduspider" content="noarchive">
    noindex有效,而且必須讓頁面可被檢索才讀得到同樣要先能被抓取,Baiduspider 才看得到這一行
    max-snippet / max-image-preview有效,並且明確適用於 AI 總覽與 AI 模式不是百度文件裡的指令

    所以這個產生器在 noarchive 上採取的做法是:你要它就照樣輸出,同時明講 Google 不會理它。這不是模稜兩可,而是這一條真的分兩邊 —— 只對 Google 判「已失效」,會讓需要關掉百度快照的人做錯事;只照百度講,又會讓人以為 Google 那邊還有個開關可以按。

    逐個爬蟲那一欄可以直接寫 baiduspider: noarchive,產生器會把它算進有效規則裡,並且提醒你:爬蟲專用的那一行只會「加嚴」,不會替你把通用標籤上的限制解開。

    逐個爬蟲的規則是相加,不是覆蓋

    你可以指名道姓地對某個爬蟲說話:<meta name="googlebot"><meta name="googlebot-news"><meta name="bingbot">。多數說明寫反的地方,是它跟通用標籤怎麼合成。

    Google 的文件:當你為多個檢索器指定不同規則時,搜尋引擎會使用這些負向規則的聯集。文件舉的例子是通用 nofollow 加上 Googlebot 的 noindex,而 Googlebot 得到的結果是 noindex, nofollow —— 兩條都吃,不是比較具體的那條勝出。標頭那邊寫的是同一個原則:規則衝突時,較嚴格的那條適用。

    也就是說,這一組並不會做它看起來在做的事:

    <meta name="robots" content="noindex">
          <meta name="googlebot" content="index">      <!-- 不會把頁面放回索引 -->

    沒有任何一條正向規則可以取消負向規則。想要「只讓 Google 索引」,你要做的是限制其他爬蟲,而不是放行 Google。這個產生器會替你指名的每一個爬蟲算出有效規則,只要有哪一行是在放寬而不是收緊,就會警告。

    順帶一個很省事的推論:nosnippetmax-snippet:50 寫在同一頁,結果是完全沒有摘要,因為較嚴格的那條勝出。

    已經不做任何事的指令

    Google 有公布一份「它不使用的規則」清單,而產生器們照樣把它們端出來,不加註記。2026-09-15 對照 robots meta 標籤規格核過:

    規則狀態
    noarchiveGoogle 搜尋已不使用 —— 它控制的頁庫快取連結已經不存在(百度那邊另計,見上一節)。
    nocacheGoogle 搜尋不使用。
    nositelinkssearchbox已不使用 —— 它抑制的那個網站連結搜尋框已經不存在。
    indexfollow根本不在 Google 的有效規則清單裡。「不設限制」有文件記載的值是 all,而 all 被明寫出來時沒有作用。

    在這個關鍵字上排第一的工具,把 noarchivenositelinkssearchbox 當成會生效的指令提供,而且沒有任何但書。這個產生器你要它就會輸出 noarchive —— 因為確實還有引擎會讀 —— 但會同時告訴你 Google 不會理。至於 index, follow,它會標成它真正的樣子:一個什麼都不改的標籤,掛在一個本來就可被索引的頁面上。

    由此得到一條好用的判準:只有在你要限制什麼的時候才送出 robots 標籤。沒有東西要限制,最好的標籤就是不要標籤。

    AI 爬蟲:開關在 robots.txt,不在 meta 標籤

    網路上不少建議叫你寫 <meta name="noai">,或把 Google-Extended 放進 meta 標籤。我們逐一讀了各家自己的文件。兩種都不成立,真正的形狀是這樣:

    • Google-Extended 根本沒有自己的 user-agent 字串。Google 的檢索器文件寫得很清楚:抓取是由現有的 Google user-agent 完成,這個 token 只在 robots.txt 裡作為控制用途。沒有任何東西可以讓 meta 標籤去指。它管的是 Gemini 的訓練與 grounding,不影響 Google 搜尋,也不影響排名。
    • OpenAI、Anthropic、Perplexity 全都只文件化 robots.txt 的 token —— GPTBotOAI-SearchBotChatGPT-User;ClaudeBotClaude-SearchBotClaude-User;PerplexityBotPerplexity-User。三家都沒有文件化任何 meta 標籤。
    • noainoimageai 不在上述任何一份文件裡。那是出版方提出的提案,不是任何一家大引擎聲明會遵守的東西。
    • 由使用者觸發的抓取是另一個範疇。Perplexity 自己寫明 Perplexity-User 通常不遵守 robots.txt,因為是真人要求的抓取;Meta 對 Meta-ExternalFetcher 也是同樣說法。對這一類,robots.txt 那一行不是牆。

    meta 這一側真正碰得到 AI 回答的只有兩條,而且都是普通的 Google 指令:nosnippetmax-snippet,Google 明講它們同樣適用於 AI 總覽與 AI 模式,並限制這一頁有多少內容可以被直接當成輸入。誠實的清單就這麼長。

    第三份輸出會按你選的政策、依廠商分組寫出 robots.txt 區塊。擋掉回答側的爬蟲是一個有真實代價的選擇 —— 你會從那些引擎引用的結果裡消失。如果目標剛好相反、是希望被引用,材料在 依實際功能分類的 GEO 工具那一頁。

    常見問題

    meta robots 標籤產生器是什麼?

    meta robots 標籤產生器會幫你組出 meta name="robots" 標籤,告訴搜尋引擎這一頁要不要被索引、要不要跟著頁面上的連結走,以及可以把這一頁顯示到什麼程度。這一個還會同時輸出對應的 X-Robots-Tag 回應標頭,以及給 AI 爬蟲的 robots.txt 區塊,並替你指名的每個爬蟲算出有效規則。

    noindex 可以跟 robots.txt 的 Disallow 一起用嗎?

    不行,它們會互相抵消。Google 寫明 noindex 要生效,頁面就不能被 robots.txt 擋住;被擋住的頁面不會被抓取,規則也就不會被讀到,而網址仍可能因為外部連結留在結果裡。正確做法是允許檢索、送出 noindex,然後等重新檢索。

    noarchive 還有用嗎?

    要看是哪一邊。Google 搜尋已經把它列入歷史遺留、不再使用的規則,因為它控制的頁庫快取連結已經不存在。百度那邊不同:<meta name="Baiduspider" content="noarchive"> 仍然是關掉百度快照的做法。所以這個產生器你要它就照樣輸出,同時標明 Google 不會理它。

    googlebot 專用的標籤會覆蓋通用的 robots 標籤嗎?

    不會朝你期待的方向作用。Google 會把通用標籤與爬蟲專用標籤的負向規則取聯集,規則衝突時較嚴格的那條適用。爬蟲專用標籤可以對那個爬蟲更嚴格,但沒辦法把通用標籤禁止的東西重新放行。

    我需要寫 index, follow 的 meta 標籤嗎?

    不需要。index 和 follow 都不在 Google 的有效規則清單裡,而「不設限制」有文件記載的值 all,被明寫出來時也明確沒有作用。一個完全沒有 robots meta 標籤的頁面本來就可以被完整索引,所以只有在要限制什麼的時候,標籤才值得送出。

    可以用 meta 標籤擋掉 AI 爬蟲嗎?

    基本上不行。Google、OpenAI、Anthropic、Perplexity、Apple、Meta 與 Common Crawl 公布的每一個退出機制都是 robots.txt 的 user-agent token,Google-Extended 甚至沒有自己的 user-agent 字串。meta 這一側的例外是 nosnippet 與 max-snippet,Google 說它們同樣適用於 AI 總覽與 AI 模式。

    PDF、圖片這類不是 HTML 的檔案怎麼辦?

    用 X-Robots-Tag 回應標頭。PDF、圖片、影片檔、CSV、動態產生的下載檔都沒有 head 可以放標籤。凡是在 robots meta 標籤裡有效的規則,在標頭裡一樣有效;標頭可以在規則前面指名 user-agent,而多個標頭會相加。

    clize seo check —— 查自己的網域免費

    noindex 到底送到了,還是那一頁還在裡面?

    查自己的網域不用錢,而且讀的是 Google 自己的判定:每一頁的即時 HTTP 狀態與索引狀態、和上一個區間相比的曝光與平均排名,以及把 AI 引擎單獨計算的流量來源。

    $ npm i -g @clize/clize && clize install
    $ clize seo check --domain yourdomain.tw
    [ Clize 的 GEO 工具 → ]