快速结论
MTEB Leaderboard 是托管在 Hugging Face Spaces 上的公开结果浏览器,用于比较文本、多语言及多模态嵌入与检索系统。它和 MTEB evaluator 必须分开理解:排行榜是读取已提交结果的托管界面,mteb 则是可通过 Python 安装、在自己的算力与数据环境中运行的 Apache-2.0 评测项目。截至 2026-07-21,MTEB 仓库仍在高频发布,2.18.5 于 7 月 19 日发布。它很适合把数百个候选缩小到几个,但整体均分不是采购答案。真正选型要按语言、领域、任务、延迟、向量维度和许可证过滤,再用自己的数据复测。
核心功能
网页榜单支持按 benchmark、任务、语言和模型属性查看公开结果;MTEB 库可通过 pip install mteb 或 uv add mteb 安装,选择 classification、clustering、retrieval、reranking、STS、bitext mining 等任务,调用模型后保存结果。项目还提供 CLI、模型定义、任务与 benchmark 扩展及结果提交流程。需要注意,榜单不会自动证明每条结果没有训练集污染,也不会替用户审查每个数据集、模型权重和自定义加载代码的许可证与安全性。
适合人群
- 为 RAG、语义搜索、聚类或跨语言检索筛选嵌入模型的工程团队。
- 需要可重复评测协议,而不是只引用厂商宣传分数的研究人员。
- 在 Hugging Face 上比较开放模型元数据和结果的开发者。
- 使用 LangChain 或其他检索框架,准备在业务语料上做二次验证的团队。
使用场景
先在榜单按目标语言和 Retrieval 等任务生成短名单,再比较参数量、嵌入维度、最大长度与模型许可。随后在隔离环境中安装 MTEB,选少量相关任务跑基线,并增加企业自己的查询、文档和负样本。若项目包含中文、法律或医疗语料,不应让英语综合分覆盖领域偏差。提交新模型时,要保存依赖、硬件、模型 revision、任务版本和输出文件,避免未来无法解释分数变化。
价格与版本
Leaderboard 可免费浏览,MTEB 代码采用 Apache-2.0;运行评测产生的 GPU、CPU、存储和下载费用由使用者承担。MTEB 的软件许可不覆盖所有 benchmark 数据、模型权重或其训练数据,每个制品需要独立核查。由于项目活跃且任务定义持续演进,建议固定 mteb 版本、模型 commit、数据集 revision 与评测配置,而不是只记录一个会变化的榜单名次。
国内访问与使用体验
托管榜单依赖 Hugging Face Spaces,可达性、冷启动和加载速度会随时段变化;本地 evaluator 则可在依赖与数据准备完成后独立运行。下载大模型和多个数据集会消耗明显带宽、磁盘与计算时间,先用小模型和单任务验证管线更稳妥。对于需要 trust_remote_code=True 的模型,不要在开发机或含凭据的训练节点直接执行:先审阅仓库代码与 revision,在无秘密、限制网络和最小权限的容器中运行。
优点
- 榜单与可安装 evaluator 形成“发现候选 + 本地复现”的完整路径。
- 活跃维护、Apache-2.0,任务和模型覆盖广。
- 可按任务与语言分析,优于只看单一厂商分数。
- Python API 与 CLI 便于保存结果和接入实验流水线。
- 社区提交与公开定义便于发现评测差异。
不足
- 综合排名会掩盖特定语言、领域和成本约束。
- 公开 benchmark 可能进入训练语料,存在污染和过拟合风险。
- 数据集与模型各有许可,不能由 MTEB 的 Apache 许可一并推导。
- 某些模型加载涉及远程自定义代码,带来供应链执行风险。
- 完整矩阵需要大量计算,复现结果还受硬件、依赖和 revision 影响。
替代品对比
| 替代方案 | 更适合什么情况 | 与 MTEB 的区别 |
|---|---|---|
| BEIR | 专注零样本信息检索 | 范围更窄,经典检索基准更集中 |
| C-MTEB | 中文嵌入分析 | 对中文任务更聚焦,仍需检查具体版本与数据 |
| MIRACL | 多语言检索 | 强调多语言 retrieval,而非通用嵌入任务矩阵 |
| 自建黄金集 | 生产选型 | 最贴近业务,但标注成本高且难公开比较 |
| Jina AI | 使用托管嵌入与检索能力 | 是产品服务,不是中立 benchmark |
| Hugging Face Model Hub | 发现模型与模型卡 | 提供制品托管,不等同统一评测协议 |
最佳实践不是在这些方案中只选一个,而是用 MTEB 做广筛,用领域 benchmark 和自建集做最终验证。
常见问题 FAQ
Leaderboard 和 MTEB Python 包是同一个东西吗?
不是。前者是托管结果界面,后者是可安装并本地运行的评测工具箱。
排名第一的模型一定最适合 RAG 吗?
不一定。还要看目标语言、语料领域、查询长度、延迟、维度、内存与许可证,并在真实检索集上测试。
运行 MTEB 是否完全免费?
软件免费,但计算、存储、模型下载和人员复现实验都有成本。
Apache-2.0 是否意味着所有任务数据都可商用?
不意味着。MTEB 代码、各数据集、模型权重和训练数据是不同许可对象。
怎样降低 benchmark contamination 的影响?
检查模型卡与训练披露,使用时间更新或私有数据集,并把公开分数与盲测结果分开报告。
可以直接开启 trust_remote_code 吗?
不建议。只有在固定 revision、审阅代码并置于隔离环境后才考虑开启。
总结
MTEB 的价值不是给出一个永恒冠军,而是提供可公开讨论、可本地执行的比较框架。先用 Hosted Leaderboard 找候选,再固定 evaluator、模型和数据版本进行复测;把污染、数据许可、远程代码与算力账单写进实验记录,得到的结论才足以支撑生产选型。