#模型评估
共 94 条 · 7 天 3 条 · 30 天 13 条
信息流里打上「模型评估」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月7日
10月6日
10月3日
10月1日
9月30日
9月25日
9月24日
9月20日
OpenRouter 推出 Ori Eval 工具,量化评估模型适用性
OpenRouter 新出的 Ori Eval 工具,能帮你量化评估不同模型,直接运行命令就能知道哪个模型最适合你的项目,比凭感觉选模型更靠谱。
9月17日
9月10日
9月9日
9月8日
9月7日
9月4日
9月1日
8月27日
8月26日
Liquid AI开源Pipette:可复现基准测试套件,综合评估设备模型、量化、运行时和硬件
Liquid AI发布了Pipette,这是一个开源的基准测试套件,可以综合评估设备模型、量化、运行时和硬件,对于想要了解模型在边缘设备上表现的人来说是个好工具。
8月25日
Agent Playground发布,比较Claude Code、Codex等模型成本
AgentSky.dev发布,提供统一API接入多个云上智能体,并支持在浏览器中比较不同模型的表现,成本仅为2美元,值得尝试。
8月24日
8月19日
8月14日
8月13日
8月11日
论文10:36
Open Evaluation Agent:高效可提示的视觉生成模型评估框架评估视觉生成模型不用再烧算力了,这个框架能把时间砍到十分之一,还支持自然语言定制评估,值得搞生成模型的人看看。
8月5日
8月4日
产品00:26
OpenRouter 推出 Ori Eval,简化首个模型评估编写OpenRouter 出了个 Ori Eval,用它的 API 就能针对你的代码任务跑模型对比,一条 curl 命令就上手,适合想挑模型的人。
8月2日