博查搜索
定义
博查搜索是一类面向AI应用的搜索引擎,也被称为「给AI用的搜索引擎」或「AGI的世界知识搜索引擎」,服务对象主要是大模型、AI智能体与各类AI应用,而非直接面向人类用户检索[2]。其运营主体为杭州博查搜索科技有限公司,公司成立于2025年1月,总部位于浙江省杭州市临平区,法定代表人为刘勋[3][4]。
产品主要以应用程序接口形式交付,包括网页搜索接口与AI搜索接口,开发者与企业在获取密钥后即可把搜索能力接入自有应用[5]。博查公开表示其索引库覆盖全网近百亿个网页,并接入短视频、新闻、百科、天气、医疗、火车票、酒店、学术等垂直领域的内容源[1]。
原理
博查搜索在架构上由索引库、检索与排序三层组成。系统先抓取网页并完成正文提取、合规识别、内容清洗和结构化处理,再写入索引库,这一流程约需半小时,构成信息更新的技术延迟上限[2]。公司说明其索引库起步即需百亿级数据规模,服务器用量在1万至2万台之间,支持毫秒级实时检索与约2000QPS的并发[2][6]。
在检索环节,博查采用多模态混合搜索加语义排序的方案。查询以自然语言提交,排序模型基于Transformer架构计算候选网页与用户问题之间的语义相关性,大模型同样基于该架构判断上下文,因此更易采信这类结果[1]。系统对候选内容的打分通常采用1至10分的四级区间,分数越高表示网页越能完整回答提问[2]。
AI搜索接口在网页结果之外还会返回结构化模态卡。系统识别天气、日历、百科、股票、医疗等垂直意图,直接输出数据卡片与网页结果并列的内容,并可选开启大模型生成总结答案与追问建议,支持流式返回[7][8]。接口参数支持指定时间范围、包含或排除的站点范围,以及每次返回的结果条数,单次最多返回50条[5]。
在内容质量控制上,博查在索引入库前用对抗性模型判断信息可信度,对难以判定的内容辅以人工核查,并用识别模型拦截由AI生成的低质量内容[2]。结果排序阶段参照经验、专业、权威、可信的维度对候选网页重新打分排序[2]。
发展历程
博查AI搜索项目于2022年末立项。2023年,刘勋与翁柔莹决定在国内开展AI搜索引擎研发,切入当时近乎空白的市场。2024年6月,博查发布6.6版本,推出多模态搜索与智能体搜索功能,并发布联网搜索接口;同年7月,博查AI搜索引擎接口正式上线。
2025年1月,公司总部从北京迁至杭州临平新城,杭州博查搜索科技有限公司同期成立[3]。2025年春节期间,随着DeepSeek等平台访问量上升,其调用量大幅增长,团队在两小时内完成近100倍的资源扩容,峰值并发达到2000QPS[9]。
到2025年2月,博查累计企业客户超过2000家[9]。截至2025年3月,其搜索接口日均调用量达到3000万次,约为微软必应的三分之一[2]。2025年5月28日,博查搜索接口产品上架阿里云云市场。同年10月,公司已服务超过2万家泛企业客户及数万名开发者[4]。
应用
博查搜索的主要应用场景是为AI平台提供联网检索能力,使模型在回答提问时能够引用训练数据之外的实时信息[2]。公开信息显示,其服务对象包括DeepSeek,并被腾讯、字节跳动、阿里巴巴等厂商列为推荐的搜索接口[10]。在智能体开发平台上,博查以插件或工具形式供开发者集成[11]。
从技术形态看,这类搜索服务同时适用于AI智能体、AI对话机器人、AI搜索、深度研究以及各类检索增强生成应用,既可用于线上业务,也可用于数据冷启动[6]。开发者可通过官方接口、模型工具调用或平台插件等方式接入[11]。博查还提供语义排序接口,用于对检索增强生成流程中的候选结果进行重排[12]。
在并发与成本上,博查采用高并发不加价的计费模式,并对企业用户提供弹性扩容能力[9][6]。公开披露的接口响应时延约为0.15秒,价格约为微软必应接口的三分之一[4][6]。
局限
搜索结果的真实性与时效性存在客观边界。博查方面表示,联网搜索与用户自行使用传统搜索引擎一样会接触到不准确信息,内容真实性并非搜索环节能够完全控制,AI幻觉只能尽量减少,难以彻底消除[2]。网页从抓取到进入索引库需经过多道处理工序,目前最快的数据处理时长约为半小时,因此极新的信息可能出现检索不到的情况[2]。
作为搜索能力供应方,博查并不掌握最终输出。AI产品通常从多个内容池同时召回结果,再自行决定排序与采信,因此即使接入同一搜索接口,不同应用给出的回答准确度也会有差异[2]。
下游的内容优化行为同样带来影响。生成引擎优化促使部分内容生产者为迎合AI引用而调整写法,这类低质量内容若大量涌入,可能加剧AI幻觉问题[2]。此外,搜索引擎的索引规模与算力投入门槛较高,索引库起步即需百亿级数据,基础设施成本构成扩张的现实约束[2]。
参见
-
搜索引擎 —— 博查搜索属于搜索引擎的一个分支,但服务对象是AI应用而非人类用户。
-
检索增强生成 —— 博查搜索的检索结果可用于为生成式模型补充外部知识。
-
Transformer —— 博查搜索的语义排序模型建立在该架构之上。
-
DeepSeek —— 博查搜索是其联网搜索功能的搜索服务提供方。
-
AI幻觉 —— 联网检索是减少模型输出与事实不符的常见手段之一。
参考资料
- BochaAI/bocha-search-mcp: Bocha Search MCP Server. · GitHub . github.com [引用日期2026-10-08]
- 国内60%AI应用背后的搜索公司,怎么看AI幻觉问题?|AI幻觉捕手 . 21jingji.com [引用日期2026-10-08]
- 杭州博查搜索科技有限公司 . tianyancha.com [引用日期2026-10-08]
- 日均30000000+!临平这里藏着个“AI大脑”工厂!-临平新闻网 . hi-lp.cn [引用日期2026-10-08]
- 博查AI | 中文 | API References . zenlayer.com [引用日期2026-10-08]
- 博查搜索API【最新版】_数据API_人工智能_API-云市场-阿里云 . aliyun.com [引用日期2026-10-08]
- 博查搜索API、排序API . feishu.cn [引用日期2026-10-08]
- bocha-search-mcp - MCP Server 产品名称: 博查 . pypi.org [引用日期2026-10-08]
- 押注AI搜索赛道,博查会成为下一个谷歌吗? . bmronline.com.cn [引用日期2026-10-08]
- 杭州博查搜索科技有限公司 . aliyun.com [引用日期2026-10-08]
- DeepSeek 的联网搜索功能,竟出自这家初创公司! . aitntnews.com [引用日期2026-10-08]
- 1c7/bocha-search: 博查 Skill,用途是搜索,类似谷歌搜索 · GitHub . github.com [引用日期2026-10-08]
浏览次数:9 次
阅读量:6 次 · 阅读完成量:0 次
最近更新:2026-10-08T12:23:26Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。