全部动态
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
NeuronSoup用遗传算法进化共享神经元图,不依赖反向传播,在MNIST上达到85.9%准确率,模型只有115KB,适合探索非梯度训练的新路子。
NVIDIA发布了RoboTTT,能把机器人策略的上下文窗口做到8000步,看懂人类演示后直接模仿,长任务完成率比单步模型高87%。想了解机器人怎么学更长历史可以看这个。
这篇论文提出了一个聪明的点子:让注意力机制像人一样,在关键地方用更多计算资源,其他地方粗略处理。复杂度降低但精度不降,做推理优化的同学可以关注。
NeuralActuator 让几百块的机器人也能感知外力,不用额外传感器。它缩小了仿真和现实的差距,还能提升模仿学习效果。
这篇论文把Bandit PCA的遗憾上界从O(d√(rT log T))降到O(r√(dT)),下界也提到Ω(r√(dT)),彻底解决了这个优化问题的理论最优性。
金融欺诈检测的老大难问题有了解法:Semantic Pareto-DQN 不用重采样,直接多目标优化,既能抓到欺诈又少误拦正常交易。
Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
他们搞了个带记忆的 8B 多模态智能体,20 轮对话检索准确率 91.4%,比 32B 模型还快一半。代码和 demo 都开源了,值得看。
VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。
FreqDepthKV在长上下文推理中将KV缓存压缩3.9倍,同时保持任务精度,比此前压缩方法更稳定,适合内存受限场景。