7月9日
18:45
18:45官方账号OpenAI@OpenAI
91°
OpenAI 发布 GPT-5.6 系列有限预览,包括三个模型:GPT-5.6 Sol 为前沿模型,GPT-5.6 Terra 为面向日常任务的平衡模型,GPT-5.6 Luna 为高吞吐量场景的快速低价模型。用户可通过链接申请有限预览权限。
事件专题

推荐理由:OpenAI 推出了 GPT-5.6 三个版本,Sol 最强、Terra 均衡、Luna 便宜快。按需求选吧。
18:44
18:36
18:36orange.ai@oran_ge
BytePlus 宣布 Seedream 5.0 Pro API 正式可用。该模型专注于设计场景,支持精确编辑、复杂信息可视化、逼真渲染和跨语言图像生成。其画质对标 GPT image 2 级别,可生成企业级视觉素材。同时 ListenHub 和 Cola 正在接入中。
推荐理由:BytePlus 上线了 Seedream 5.0 Pro API,画质和 GPT image 2 看齐,设计场景功能超实用,做图搞创意可以试试。
18:13
18:13官方账号Decoder@Maximilian Schreiner
88°
在AtCoder World Tour Finals 2026的表演赛中,OpenAI的AI系统解决了算法部门的全部5道题目,其中2道被观测者评为特别困难。该系统击败了所有人类参赛者,展示了在顶级竞争性编程中超越人类的能力。
事件专题

推荐理由:OpenAI的AI刚刚在AtCoder的世界决赛上碾压了所有人类选手,5道题全解,2道超难。想看看AI编程到底多强?
17:30
17:30Hunyuan@TXhunyuan
腾讯混元推出 Hy3,一个 295B 参数的 MoE 模型,支持 256K 上下文窗口。该模型针对编码、推理、智能体和可靠工具使用进行优化。即日起至 7 月 21 日,可通过 OpenRouter 免费使用,并可在 OpenClaw 中调用。
事件专题

推荐理由:腾讯新出的 Hy3 模型 295B 参数,256K 上下文,现在 OpenRouter 上免费到月底,编码和推理都很强,赶紧去试试。
16:00
16:00Genspark@genspark_ai
73°
SpaceXAI 发布 Grok 4.5,这是其首个专门针对编码和智能体任务训练的模型。该模型使用 Cursor 进行训练,在保持前沿智能水平的同时,实现了领先的速度和成本效率。目前 Grok 4.5 已在 Genspark AI Chat 中上线。
事件专题

推荐理由:SpaceXAI 出了个专门做编码和智能体的 Grok 4.5,用 Cursor 练的,速度又快又省钱,现在 Genspark 里就能用。
15:00
14:28
13:28
12:31
12:31Ethan Mollick@emollick
OpenAI 为新模型 GPT-5.6 开发了高质量自主任务基准 GDPval,但未公开该基准的测试结果。该基准旨在评估模型在困难任务上的自主能力,开发成本高昂。外部评论者指出 OpenAI 在指标讨论中回避关键数据,引发透明性质疑。
事件专题

推荐理由:OpenAI 自己搞了个硬核自主任务基准 GDPval,花了大钱,结果 GPT-5.6 的成绩藏起来了。背后有啥故事?不点进来看看?
12:28
12:02
11:59
11:59Sualeh Asif@sualehasif996
71°
SpaceXAI 发布了 Grok 4.5,在 GDPval-AA v2 基准上以 Elo 1543 排名第四,仅次于 Anthropic 的最新 Claude 版本。每个任务的成本为 0.49 美元,低于 GLM-5.2 和 Kimi K2.6,且比排名更高的模型便宜近 90%。该模型在性能与成本的帕累托前沿上表现突出。
事件专题

推荐理由:Grok 4.5 在代理知识工作基准上排第四,每个任务只要 49 美分,比前面的模型便宜 90%,性价比很能打。
11:53
11:53量子位@量子位的朋友们
量化派基于餐饮后厨场景的多模态数据,训练了物理世界基础模型Q-Phys-v1。该模型在Meta Habitat 2.0基准的物体抓取任务上达到88%成功率,在自主导航任务中路径规划效率提升40%。模型通过API和SDK向企业开放,支持场景定制。
推荐理由:量化派把餐饮后厨数据用到物理模型上,思路很落地,Q-Phys在机器人任务上表现不错,适合做机器人和自动驾驶的公司看看。
11:46
11:46AI Will@FinanceYF5
93°
OpenAI 推出 GPT-Live,一款专为语音交互优化的新模型。该模型从今天起在 ChatGPT 中分阶段上线,旨在提升对话的流畅度与自然度。用户可通过声音与模型直接对话,体验更接近真人交流的交互方式。
事件专题

推荐理由:OpenAI 出了个专门的语音模型 GPT-Live,今天开始在 ChatGPT 里逐步推送,聊天能更自然了,试试开声音。
11:30
11:30官方账号Sam Altman@sama
Sam Altman 转发 dax 的推文,称 GPT-5.6 对团队产生了巨大影响,团队 Token 使用量达到以前的 5 倍。dax 表示 GPT-5.6 虽然不如 Fable 聪明,但极其可靠且使用体验愉快。这是 Altman 罕见地主动 hype 一个模型发布。
事件专题

推荐理由:Sam Altman 亲自夸 GPT-5.6 可靠又好用,团队用量翻了 5 倍,看看他为什么破例。
11:22
11:22IT之家博客/媒体
精选
蓝戟测试英特尔 Arc Pro B70 GPU 在 DeepSeek R1-Distill Qwen 32B FP16 模型推理性能。并发 128 时 Arc Pro B70 吞吐比 RTX 5090D 高 8.6%,比 RTX 4090D 高 34.2%。并发 256 时分别高 7.5% 和 48.7%。最高吞吐达 2320.76 token/s。并发低于 32 时 RTX 5090D 仍领先。

推荐理由:蓝戟实测发现 Intel Arc Pro B70 跑 DeepSeek R1 推理比 RTX 5090D 还快,高并发场景优势明显,适合做推理部署参考。
11:11
11:08
11:08小互@imxiaohu
87°
OpenAI 今起面向全球 ChatGPT 用户上线 GPT-Live-1 和 GPT-Live-1 mini 两个版本。Go、Plus、Pro 订阅用户默认使用 GPT-Live-1,Free 用户默认使用 GPT-Live-1 mini。两个版本均面向对话场景优化,具体性能参数未在公告中披露。
事件专题

推荐理由:OpenAI 今天直接上线了 GPT-Live-1 系列,付费用户和免费用户分成两个版本,想试试新模型的快去更新 ChatGPT。
10:18
10:18官方账号arXiv cs.LG@Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai
精选
SciReasoner是一个多模态科学基础模型,通过统一的结构感知词汇表对蛋白质、小分子和无机晶体进行推理。在Gene Ontology预测中,对低同源性和孤儿样蛋白的Cellular Component注释Fmax从0.42提升至0.55。化学单步逆合成准确率从0.63升至0.72,并能生成片段级断键与前体验证轨迹。在86个基准中,SciReasoner在67个任务上达到SOTA,双盲专家评估认为其推理痕迹在98%案例中优于或可比于前沿大语言模型。
推荐理由:这篇论文发布了SciReasoner,一个能同时处理蛋白质、小分子和晶体的推理模型,在67项基准上成绩最好,专家评价也很高。
10:17
10:17官方账号arXiv cs.LG@Yair Feldman, Linxi Zhao, Nathan Godey, Dongyoung Go, Yilun Hua, Kilian Q. Weinberger, Jennifer J. Sun, Yoav Artzi
CO-LMLM将知识库中的连续键与文本知识值配对,摆脱了传统关系型知识库的查询限制。在Wikipedia和FineWeb-Edu上预训练,360M参数模型困惑度低于使用40倍数据训练的LLM。SimpleQA验证显示其性能与gpt-4o-mini相当,且高于Claude Sonnet 4.5。该架构在多个规模下均优于先前LMLM和普通LLM。
推荐理由:CO-LMLM用360M参数打平gpt-4o-mini,事实准确度比Claude还高,这是用更小模型做更好知识检索的路线。
09:53
09:53官方账号arXiv cs.LG@Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
精选
MedPMC从610万篇PMC文章中自动筛选出1100万医学图像-文本对。人工评估中,95.3%的图像具有医学相关性,而此前数据集仅19.7%。在26项基准测试中,基于MedPMC训练的CLIP-style模型零样本AUC平均提升7.1个百分点。作为MLLM的视觉编码器,其医学VQA准确率提升1.9和16.9个百分点。在1万张真实临床照片中,形态到图像检索Recall@5提升11.7个百分点。
推荐理由:想训练医学多模态模型但缺高质量数据?MedPMC从610万篇论文里筛出1100万对数据,效果比现有数据集好5倍。
09:44
09:44Cognition@cognition_labs
Cognition 推出 SWE-1.7 模型,基于 Kimi K2.7 基座并改进强化学习流程。其自研 FrontierCode 基准测试关注代码合并意愿,SWE-1.7 在该基准 Main 集上取得 42.3% 的分数,每个任务成本降至 1.97 美元,优化了成本-性能帕累托曲线。
事件专题

推荐理由:Cognition 新模型 SWE-1.7 基于 Kimi K2.7 用强化学习改进,FrontierCode 基准上 42.3% 分且每任务仅 1.97 美元,性价比突出。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。