这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。
全部动态
这篇论文把LLM里高效扩展的思路用到了扩散Transformer上,MMOE在单机8卡H100就跑出了更低的FID,比加参数更实用。
Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。
用验证器帮语言模型修量子场论对偶声明,效果不错,deepseek-chat提升8个百分点,qwen-plus提升7个百分点,值得关注。
这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
做分子性质预测的朋友看过来:新模型EnsembleEGNN把多个构象编码成一个嵌入,在环肽任务上比纯序列模型效果好,R²提升到0.538。
GS-Agent把多个AI智能体和物理引擎连起来,你只要说句话就能生成带物理模拟的4D场景,液体、物体碰撞都能搞定,做内容创作或模拟都省力。
PG-KINN用Petrov-Galerkin方法结合KAN,在多个力学难题上精度超过PIKAN和MLP,值得做计算力学的人试试。
这篇论文提出了iPANN和fPANN,用区间和模糊集处理本构建模中的不确定性,能包围噪声观测,还能把不确定性传到有限元仿真里。
这篇论文用专家聚合让贝叶斯在线学习自适应,无需事先设定学习率或先验,实验还证明能自动跟踪最强专家。
想用 AI 辅助康复评分又怕黑盒?PhaseAware 精度高(RMSE 降 88.9%),还能给出运动阶段和身体部位的敏感线索,方便医生审查边界案例。
Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。
想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
VirtualSet让LLM不用冒SQL幻觉的风险,改天用类型安全的set表达式,BIRD上准确率反超4个百分点,写操作还能拦截瞎编的数据输入。
研究者发布了两个轻量级病理AI模型,GigaPath-Flash在切片分析上几乎不输十亿参数大模型,速度快50倍;GigaTIME-Flash还能直接预测肿瘤微环境,速度更快又省显存。开源可用,做病理和免疫研究很实用。
IBM 发的新框架 ClouDens,用图神经网络做云系统异常检测,在真实数据集上比 GRU 模型更准更早,适合做运维监控的朋友看看。
这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。