#基准评测
共 12 条 · 7 天 2 条 · 30 天 6 条
信息流里打上「基准评测」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月5日
10月1日
9月25日
SWE-Prometheus:用 60 个代码仓库评测工程治理能力的新基准
给做代码智能体的朋友:这个新基准不测修 bug,测的是治理仓库,10 个模型里 Kimi-K3 在完整对比里表现最好,评分方法也挺有意思。
9月22日
9月10日
8月10日
8月7日
模型23:44
Frontend Code Arena 完整排行榜页面现已可查看想挑个会写前端的模型?去 Frontend Code Arena 榜单看排名就行,入口在 arena.ai/leaderboard。
7月18日
模型05:15
Runway Agent 在 Physion-Arc 1.0 评测中获全维度第一Runway Agent 2.0 在视频生成评测里全面碾压了 Luma、MiniMax 这些对手,叙事和电影感都拿第一,做视频的可以看看。
7月14日
5月17日
Atomic Bot 用 Qwen 35B 实测对比 OpenClaw 和 Hermes Agent,引发大佬激辩
AI Agent 开发者或评测爱好者会看到一场关于基准科学性的硬核辩论——单次跑分 vs 真实用户数据,哪个更可信?值得点开围观双方论据。
5月12日
论文19:11
V4FinBench:用于企业破产预测的表格基础模型评测基准对于金融风控从业者,该基准提供了百万级真实财务数据及多时间范围评测框架,可有效检验表格型基础模型和LLM在不平衡场景下的预测能力。