6月24日
08:24
07:48
07:48官方一手marktechpost@Asif Razzaq
精选
Mistral AI 于2026年6月23日发布 OCR 4,从纯文本提取升级为结构化文档输出。每个文本块返回边界框、类型分类以及每页和每词的置信度分数。该模型支持170种语言,可在单个自托管容器中运行,通过单一API端点向RAG、智能体和企业搜索管道提供可引用的输入。
推荐理由:Mistral 出了 OCR 4,能提取带边界框和置信度的结构化内容,方便直接用于 RAG 和搜索,支持170种语言还自托管,很实用。
03:42
03:42官方一手marktechpost@Asif Razzaq
精选
Datalab发布了lift,一个9B参数的开源视觉模型。该模型能将PDF与图像转换为符合给定schema的JSON结构。它使用schema约束解码确保输出有效,并训练弃权机制避免幻觉,在225份文档的基准上达到90.2%的字段准确率。
推荐理由:Datalab的lift模型能自动把PDF转成你需要的JSON格式,准确率90.2%,还不会瞎编字段。
01:08
01:08官方一手OpenAI Blog博客/媒体
GPT-5 Pro协助免疫学家Derya Unutmaz破解了持续3年的T细胞行为之谜,为癌症和自身免疫疾病研究提供新线索。该模型通过分析复杂免疫数据,识别出此前未知的T细胞激活模式。研究成果被OpenAI以案例形式发布,展示了大模型在基础科学中的应用潜力。
事件专题

推荐理由:OpenAI用GPT-5 Pro帮科学家搞定了3年没解的免疫难题,不是画饼是真能干活,科研党可以看看怎么用的。
6月23日
23:00
23:00量子位@十三
73°
字节跳动发布豆包2.1,其Agent可在18小时内自动完成芯片设计代码编写。在编程基准测试中,豆包2.1的表现比肩Opus 4.7。该版本强化了自主编程和长时任务执行能力,适用于复杂工程场景。
推荐理由:豆包2.1的Agent太能干了,独自跑18小时写出芯片代码,编程水平还追上了Opus 4.7,做硬件的可以关注下。
20:33
20:33官方账号Decoder@Maximilian Schreiner
74°
字节跳动在火山引擎FORCE大会上发布了五款新AI模型,其中Seedance 2.5视频模型计划于7月初上线。Seedance 2.5将AI视频生成时长从行业常见的十几秒提升至30秒,支持更高分辨率和一致性。该模型基于扩散架构,有望在短视频创作和广告领域应用。
事件专题

推荐理由:字节跳动新发布的Seedance 2.5视频模型能直接生成30秒视频,比之前模型长一倍,做短视频创作者可以试试。
19:06
19:06官方账号Decoder@Matthias Bastian
精选
OpenAI 通过其 Daybreak 网络安全计划推出了更新版 Codex Security 插件和完整的 GPT-5.5-Cyber 模型,同时宣布与超过 25 家安全公司及多个政府合作。新模型专注于从发现漏洞转向自动修补漏洞。在网络安全基准测试中,GPT-5.5-Cyber 的性能超过了 Anthropic 的 Mythos 模型。
事件专题

推荐理由:OpenAI 新出的 GPT-5.5-Cyber 专攻网络安全,能自动修补漏洞,基准测试里已经跑赢了 Anthropic 的 Mythos。
16:21
16:21官方一手Pandaily@contact@pandaily.com (Pandaily)
百度推出Unlimited-OCR技术,核心是Constant KV Cache方法,专为超长文档设计。该技术在长文档OCR任务上取得SOTA性能,解决了传统KV缓存随文档长度线性增长的问题。Constant KV Cache将缓存大小保持常数,显著降低内存占用和推理延迟。
事件专题

推荐理由:百度搞了个Unlimited-OCR,用Constant KV Cache解决长文档识别,缓存不爆炸,性能还最强,适合处理几百页的合同或文献。
15:48
15:48官方账号OpenAI@OpenAI (@OpenAI)
OpenAI推出了GPT-5.5-Cyber,这是其最强大的网络模型,专注于高级授权防御任务。该模型能够追溯脆弱代码、验证漏洞、开发补丁,并为人工审查准备证据。这是开源模型在基准测试中首次达到GPT-3.5水平,仅用1/10的计算量。
事件专题

推荐理由:OpenAI搞了个专门搞网络安全的模型GPT-5.5-Cyber,能自动找漏洞、打补丁,干活比人快还准,安全团队有福了。
15:21
15:21IT之家博客/媒体
精选73°
OpenAI于6月22日发布GPT-5.5-Cyber网络安全专用模型,面向Daybreak项目有限开放。该模型在CyberGym测试中取得85.6%的得分,超过Claude Mythos 5的83.8%和GPT-5.5的81.8%。在ExploitGym测试中得分为39.5%,而GPT-5.5为25.95%。在SEC-bench Pro测试中得分69.8%,GPT-5.5为63.1%。
事件专题

推荐理由:OpenAI新出的网络安全大模型GPT-5.5-Cyber挺猛,CyberGym跑分超了Claude Mythos 5,安全团队可以关注一下。
02:51
02:51官方一手marktechpost@Asif Razzaq
精选73°
Sakana AI 推出 Sakana Fugu,一种编排模型,可将用户任务动态路由至可替换的前沿 LLM 池。其增强版 Fugu Ultra 在多个编码、推理和智能体基准测试中取得领先成绩。该模型通过选择最适合的模型来提升任务效率,无需用户手动切换。
事件专题

推荐理由:Sakana AI 搞了个 Fugu 编排模型,能自动在多个前沿 LLM 之间切换最优选择,在编码和推理基准上表现很突出。
6月22日
23:51
23:51官方账号Nathan Lambert: Interconnects@Nathan Lambert
GLM-5.2 是智谱AI推出的新模型,重点提升开放智能体场景下的表现。该模型在工具调用和多步推理任务上取得进展。GLM-5.2 在多项智能体相关基准上展现了更强的自主决策能力。
事件专题

推荐理由:GLM-5.2 把开放智能体的能力又推了一步,想看智能体怎么进化的可以瞄一眼。
16:33
16:33官方账号Decoder@Matthias Bastian
Sakana AI推出了Fugu系统,该系统能动态协调多个大型语言模型(如GPT-4、Claude等),在Fable和Mythos基准测试上达到与Anthropic的Fable 5相当的性能。Fugu通过实时路由和模型组合,减少了对单一AI提供商的依赖。测试中,Fugu在Fable基准上得分超过Anthropic的Fable 5,并在Mythos基准上表现出色。
事件专题

推荐理由:日本AI公司Sakana AI搞了个新系统叫Fugu,能让不同模型一起干活,不用只靠一家供应商。效果还跟Anthropic的Fable 5差不多,值得看看怎么做到的。
15:18
15:18官方一手marktechpost@Asif Razzaq
精选
MoonMath AI 开源了一个基于 HIP 的注意力内核,针对 AMD MI300X GPU 进行了优化。该内核采用单指令汇编包装器和八波流水线架构,在所有形状和舍入模式下均击败了 AMD 官方实现的 AITER v3。基准测试结果显示,新内核在 MI300X 上的性能显著领先,未出现任何退化情况。
推荐理由:MoonMath 开源了一个注意力内核,能在 AMD MI300X 上全面碾压官方 AITER v3,速度更快,所有形状都更强,值得跑推理的人试试。
12:54
10:48
10:48官方一手Pandaily@contact@pandaily.com (Pandaily)
ByteDance Seed与学术合作伙伴提出SpatialTree,这是一个分层框架,旨在重新定义多模态大模型(MLLM)对空间的理解与推理能力。该工作已被计算机视觉顶级会议CVPR 2026接收。SpatialTree通过层级结构显著提升MLLM在空间任务上的表现。
事件专题

推荐理由:字节跳动Seed搞了个SpatialTree框架,专门提升多模态模型的空间推理能力,还被CVPR 2026接受了,值得一看。
6月20日
19:56
16:46
16:46官方一手Pandaily@contact@pandaily.com (Pandaily)
智谱AI的GLM 5.2在Design Arena的HTML网页设计基准测试中超越Claude Fable 5,获得第一名。该模型在第三方库利用方面表现更优,同时具备成本优势。Design Arena基准专门评估AI生成HTML代码的设计质量和功能性。
事件专题

推荐理由:智谱AI的GLM 5.2在网页设计上干掉了Claude Fable 5,库支持更好还更省钱。