开源项目精选 60GitHub
bridge-mind/bridgebench· 桥接基准:通过真实工程任务比较 AI 模型性能
The world's #1 vibe coding benchmark — models go head-to-head on real engineering tasks, judged blind, ranked by Elo.
AI 解读代码
AI编码模型在真实工程任务中的表现对比排行榜
- 项目简介
- BridgeBench是一个评估AI编码模型在软件工程任务中表现的平台,通过盲评和Elo评分机制生成排行榜。
- 与 AI 的关系
- 项目旨在评测不同AI模型在实际软件开发场景中的能力,帮助开发者和研究者选择最适合的模型。
- 适合谁读
- 开发者AI研究者工程项目经理
- 适用场景
- 评估和选择最优的AI编码模型模型性能审计研究AI模型在不同任务中的表现
- 技术栈
- Node.js 20.19+npm 10+Elo评分机制盲评算法
- 核心亮点
- 头对头竞赛盲评系统多种评测领域
⭐ 112 stars语言 TypeScript
📎 发布于 07-06 18:08🔗 阅读原文(github.com)