全部动态
AI 相关资讯全量信息流 · 355 条
8月10日
8月7日
8月6日
模型11:47
MultiPathFormer:以多径传播为预训练目标的无线基础模型想做无线信道估计或波束预测的可以看看,它用路径预测代替传统掩码重建,环境RAG让延迟估计直接涨59%,效果比现有模型好。
8月5日
模型10:20
轻量化潜在推理世界动作模型LiLa-WAM用于机器人操作LiLa-WAM用一张24GB显卡就能训练,在RoboTwin 2.0上50个任务做到90%以上成功率,还不用语言标注任务,做机器人操控的值得看看。
8月4日
8月3日
7月31日
7月30日
SciFigQual-Bench:面向科学图像质量评估的全文本基准
评估论文图表质量?SciFigQual-Bench这个新基准让GPT-5.6-Sol驱动的SFQ-Agent打分,误差比直问模型低43%,更靠谱。
APEX-Accounting基准:评估九个前端模型会计能力
想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。
模型10:38
Setoka:评估个性化智能体层次化用户理解的新基准如果你想了解现有AI智能体到底能多深地理解用户,这个新基准Setoka用心理学理论和方法测出了它们的短板——不只是翻聊天记录,还要推断行为和性格。
7月29日
模型11:50
PRISM-AH:面向视频级矛盾与犹豫识别的知识引导多模态推理PRISM-AH在视频级矛盾识别上把macro F1从0.28翻到0.61,比直接看零样本强多了,适合研究多模态情感分析的人看看。
7月28日
模型12:30
ClinFusion: 面向整体医学理解的视觉中心多模态LLM系统ClinFusion用新架构统一2D/3D医学图像,在20/24基准上碾压Hulu-Med、Lingshu,甚至超GPT-5.2。医生盲评说它报告最好,值得关注。
模型12:19
APS-RAG:面向科学设施的纠正性代理混合RAG与运行评估APS团队搞了个能检索几十年知识库的RAG系统,把BM25的63.8%准确率提到了70.3%。交叉编码器是关键,去掉掉32.8%得分。科学设施运维AI神助攻,代码和基准都开源了。