本文要解决的问题:在微软必应(Bing)搜索引擎中,使用 site:domain 语法查询站点收录情况时,返回结果与目标站点毫不相干,或经过多次跳转后出现类似明显错误。
拓展阅读:文末附常用搜索引擎指令速查表。

必应是我目前最常使用的搜索引擎。作为微软旗下的产品,界面简洁、无广告干扰、收录效率高、覆盖范围广,使我一直将它作为首选。然而,它也有不少让人头大的地方:反垃圾策略不够高效,导致下拉框推荐等流量入口被恶意滥用;疑似“后门”的仿站收录,排名甚至优于正版站点;中文客服渠道基本不通;各种难以理解的限制策略。

如果你了解过 SEO 优化,想必会知道 site:domain 这个指令,它能够快速筛选出某个域名在搜索引擎中的收录条目。不过从去年开始,我发现必应和百度两家都对这个指令做了限制(已在 GitHub 等社区确认并非个例)。具体表现为:返回结果不准确、完全无结果、需要特殊网络环境才能返回正确内容。

拿我昨天的经历作为例子,我在必应搜索框中键入 site:zooyoo.top 后发起搜索,返回的所有条目却都不约而同地指向了豆包 AI 的各个入口,与我的站点只能说是毫不相干。起初我以为无解了,摸索中却意外发现了另一个必应独有指令domain:domain。看着文章介绍它的用途类似,我就先入为主地认为它会受到同样的防护策略,但实测效果却出奇地好:67 条本站搜索结果整齐地列出,翻页后依然正常。

我不禁疑惑,这种神秘的限制到底是配置错误,还是有意为之?意义何在?不过转念想想,这倒也符合必应有点“抠门”的风范。我曾统计过一段时间内本站日志中各大搜索引擎爬虫的访问频率,必应位列第二,仅次于谷歌。但在必应上搜索资料时,常常会落入它的“翻页陷阱”:第一页结果正常,从第二页起内容就完全不相关了,数据库满满当当,不给用户看。初步分析,这可能与 IP 黑洞中版权信息隐藏机制有关,但连我这种原生家庭宽带用户都被波及,只能说过滤规则过于严苛。

更令我大开眼界的,是一次在必应搜索“百度”这个关键词时,页面居然做了特殊样式:屏幕上半部分约 85% 的区域被“用必应搜索,赢哔哩哔哩大会员”的标语和高级渐变粉色填充,中间是搜索框,下方小字写着“由 Microsoft 推广”,整个布局宛如一个全新的标签页;而“百度一下,你就知道”的字样,只能在页面底部狭窄的区域内露出半截。今天好奇之下又搜了一次,可能是推广期过了,亦或是其它因素,推广样式收敛不少,不过输入框的堆叠弄得我有些强迫,立马加了一条广告拦截规则。有兴趣的朋友可以点此查看效果


附:搜索引擎常用指令速查

指令是否必应独有功能简介使用示例
site:将结果限制在指定网站或域名(包含子域名)气候 site:example.com
domain:仅限制在主域名,不深入子域名数据 domain:example.org
intitle:查找页面标题包含指定关键词的网页intitle:"年度报告"
inbody:查找页面正文包含指定关键词的网页inbody:可再生能源
inanchor:查找被其他网页的链接锚文本包含指定关键词的页面inanchor:"更多信息"
url:查询特定精确 URL 是否被收录url:example.com/page
ip:查找托管在特定 IP 地址上的所有网站ip:192.0.1.1
filetype:搜索特定文件格式的文件标书 filetype:pdf
contains:查找包含指向特定文件类型链接的网页数据 contains:xlsx
feed:查找关于特定主题的 RSS 或 Atom 订阅源feed:科技
hasfeed:查找页面本身包含 RSS 或 Atom 订阅源的网页hasfeed:博客
" " (双引号)精确短语匹配,按顺序查找完整词组"人工智能大语言模型"
-NOT排除包含特定关键词的结果(NOT 必须大写)苹果 -水果
OR管道符查找包含任一关键词的页面(OR 必须大写)可再生能源 OR 清洁能源
( ) (括号)组合关键词和运算符,明确搜索逻辑优先级(气候 OR 天气) 模型
+ (加号)强制包含某个可能被忽略的常用词+如何 +编程
* (星号)通配符,代表短语中的一个或多个未知词"最 * 的语言"
define:快速获取某个词或短语的定义define:算法
language:将结果限制为特定语言的页面"HTML" language:zh
location:将结果限制在特定地理位置气温 location:贵阳
imagesize:在图片搜索中按指定尺寸(小、中、大)筛选城市 imagesize:large
near:指定关键词之间在文本中的距离(以词数计)"机器学习" near:3 "应用"

由 AI 进行病句修复和错句调整,部分表格内容来自 Bing 搜索 AI 摘要,经人工重构和校对,欢迎留言增改建议。