Arena 大模型排行榜
通过匿名模型对战和用户偏好投票生成排行榜,可按文本、代码、视觉等维度观察不同模型的相对表现。榜单反映参与者偏好,选型仍需结合业务测试。
大模型评测与分析按实际任务场景整理,帮助开发者快速比较适合大模型选型的工具。
通过匿名模型对战和用户偏好投票生成排行榜,可按文本、代码、视觉等维度观察不同模型的相对表现。榜单反映参与者偏好,选型仍需结合业务测试。
大模型评测与分析独立的大模型能力、输出速度、延迟与价格分析平台,可在统一视图中比较闭源和开源模型,并公开部分评测方法与版本记录。
大模型评测与分析斯坦福 CRFM 的基础模型整体评测框架与排行榜,强调透明、可复现及多场景多指标,适合研究评测方法和查看标准化结果。
大模型评测与分析基于 OpenRouter 平台真实调用与支出份额展示模型趋势,可按时间和任务观察模型使用热度,适合了解市场采用情况而非单纯能力分数。
大模型评测与分析