推荐智能手记
原创教程
专题
AI 日报
工具库
我的阅读
搜索
更多
关于本站
作者与内容原则
订阅更新
RSS、公众号与本机提醒
更新日志
查看最近的产品变化
主要页面
01
原创教程
02
专题
03
AI 日报
04
工具库
05
我的阅读
搜索全站
关于本站
订阅更新
更新日志
首页
›
AI 工具导航
› Stanford HELM
🎓
Stanford HELM
斯坦福 CRFM 的基础模型整体评测框架与排行榜,强调透明、可复现及多场景多指标,适合研究评测方法和查看标准化结果。
大模型评测与分析
大模型选型
评测方法研究
免费查看
网络可用性可能因地区变化
访问官网 →
适合用来做什么
大模型选型
评测方法研究
主要优点
评测方法透明
覆盖多类能力和风险指标
适合研究与基准设计
使用前需要注意
更新节奏与商业模型发布不同步
标准基准不等于实际业务效果
Stanford HELM 的替代工具
Arena 大模型排行榜
通过匿名模型对战和用户偏好投票生成排行榜,可按文本、代码、视觉等维度观察不同模型的相对表现。榜单反映参与者偏好,选型仍需结合业务测试。
Artificial Analysis
独立的大模型能力、输出速度、延迟与价格分析平台,可在统一视图中比较闭源和开源模型,并公开部分评测方法与版本记录。
OpenRouter Rankings
基于 OpenRouter 平台真实调用与支出份额展示模型趋势,可按时间和任务观察模型使用热度,适合了解市场采用情况而非单纯能力分数。