拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。
全部动态
AI 相关资讯全量信息流 · 5478 条
9月23日
研究测试 6 个开源 LLM 给科研基金申请书打分的准确性
分形决策引擎 answerr:零权重实现 7ms 延迟的语言分类
这篇论文挺反常识的:不用任何权重、靠 Mandelbrot 分形坐标做语言决策,延迟只有 7ms 还能跑在单片机上,可以看看它怎么绕开 LLM 的。
RULER:用实例化评分细则奖励提升 SVG 生成
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。
Trains but Doesn't Learn:面向 LLM 智能体交付能力的 Post-Training 基准
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
9月22日
论文12:55
NGRC 从单一观测推断混沌系统未知分量,验证扩展至 ENSO 气候数据NGRC 用更少数据就能从 Lorenz 系统一个变量推出另外两个,比传统 RC 省时省算力,还在真实 ENSO 气候数据上跑通了
onPanda:token 级纠正标注对齐数据,中位标注时间省 52%
标注对齐数据不用整段重写,定位到第一个错 token 改掉让模型接着生成,实验里中位时间省 52%,还附了 Panda-CVL 数据集。
Google Research提出RRSI:给智能体harness递归自我改进加正则化
Google开源了RRSI:给自动进化智能体harness的方法加正则化,分布外基准还能涨4.7分,还省30%的token。
论文12:30
SE(3) 神经势场:无需 3D 重建,直接从图像规划 6-DoF 抓取轨迹机械臂规划的新论文:跳过 3D 重建,直接从 RGB 图像学势场做 6-DoF 轨迹规划,UR10 上全起点零碰撞。
论文12:26
研究者用 QLoRA 微调 Ministral 3 自动生成蛋白质功能注释把蛋白质注释当文本生成任务来解,用 QLoRA 微调 3B 的 Ministral 3,还让 GPT 当策展人打分,思路挺新鲜。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档