全部动态
Nvidia 搞了个 SoL-Pi,不改模型只优化 harness,编程智能体 token 省了 49%,跑 3000 多次实验试出来的。
医疗 AI 输出质量很难逐条人工评审,这篇 npj Digital Medicine 论文讨论用大模型当裁判自动打分,做医疗评估的可以看看思路。
宫颈癌筛查里双染片人工判读很费病理医生,这篇验证了 AI 自动判读靠不靠谱,做医疗 AI 的可以看看外部验证怎么做。
做了 50 多个临床 AI 算法、铺到 2000 家医院的团队,把落地比研发更难的坑都写出来了,做医疗 AI 的朋友别错过。
《npj Digital Medicine》这篇新文讲怎么用隐私增强技术让健康 AI 更公平,做医疗 AI 的人可以看看。
Apple 发了一篇联邦学习论文,讲怎么用伪标签在无标注数据上训 ASR 模型,还给了稳定训练的实操配方,做语音方向的可以看看。
Anthropic 让 950 个 Claude 智能体只花 21 小时就找到类似 CRISPR 的基因剪辑新系统 ART,看看 AI 怎么做科研的。
一项发表在 npj Digital Medicine 的多中心研究,测了医生审查生成式 AI 临床建议时能抓出多少错误,做医疗 AI 的人可以看看。
DeepSeek 发论文讲了训练智能体的沙箱系统 DSec,一天能跑 300 万个沙箱,并发 38 万,做 RL 训练的可以看看。
小米 LLM-Core 团队搞了个 HySparse2 稀疏注意力,1M token 预填充计算量降约 5 倍,做长上下文的可以看看。
Apple 发的新方法 probe guidance,不用多跑一次 forward pass 就能给 flow matching 模型加引导,搞生成模型的可以看看。
偏头痛患者可以看看,Nerivio 应用用 5.3 万人的数据训练模型,提前一天预测头痛,准确率 91%。
OpenAI 做了个心理健康对话评测集,专门测模型遇到自伤、焦虑这类敏感问题时答得稳不稳,各家模型能拿它来横向对比。
DeepSeek 把训 Agent 最难的环境基建摊开讲了:每秒造 5000 个沙盒怎么做到,容器、虚拟机、镜像加载的全套工程细节都在论文里。
一篇发表在 npj Digital Medicine 上的方法论文,用 MoE 加层级一致性来做脑连接组合成,还能一次预测多种大脑特质,做医学影像方向可以看看。
移植患者用药剂量很难拿捏,这篇 npj Digital Medicine 论文用可解释 AI 帮医生定他克莫司剂量,还告诉你为什么这么算。
想知道现在那些健康类 AI 到底能不能帮患者走完就医流程?这篇 npj Digital Medicine 的论文用了患者旅程这套评估框架,做医疗方向的人可以看看。
npj Digital Medicine 的新论文,讲医院上了编排平台之后怎么靠结构化变更管理让 AI 真正用起来,做医疗信息化的可以看看。
Multiverse Computing 把“LLM 该删哪些层”写成 Ising 模型用物理方法解,比逐层打分剪枝的思路新鲜。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…