#基准测试
Liquid AI发布了Pipette,这是一个开源的基准测试套件,可以综合评估设备模型、量化、运行时和硬件,对于想要了解模型在边缘设备上表现的人来说是个好工具。
EarthVerse基准测试为评估科学智能体提供了全面的方法,揭示了当前智能体在跨证据和尺度上的不足,值得专业人士关注。
开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!
这篇论文介绍了InsufficiencyBench,这是第一个评估LLM在用户查询不足方面的法律建议的基准。它对法律AI系统提出了新的挑战,并提供了评估模型性能的新方法。
Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。
G-CARL模型在医疗报告解释方面表现优异,为患者提供更准确、更符合需求的解释,值得一试。
Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。
想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。
骁龙X2 Elite Extreme跑分超AMD、Intel同代,AI差距更大。买Win本可关注。
Ollama官方说deepseek v4 flash跑得最好,本地想试的话有qwen3.8优化版,但注意qwen慢30倍贵4.5倍,小样本测试。
想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。
LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
DeepSeek把V4 Pro的智能体能力一口气拉高了,DeepSWE涨了快50分,写代码和操作终端都更顶了,现在就能在OpenRouter上直接用。