08:54IT之家(博客/媒体)Anthropic 国际董事总经理 Chris Ciauri 在韩国首尔发布会上表示,有信心在未来几天内向美国之外地区重新开放 Claude Mythos 和 Claude Fable 5 模型。此前这两个模型因美国白宫安全指令被临时封锁访问权限。Anthropic 计划深化对韩投资,已组建商业、技术、政策和运营团队,韩国是其全球第 12 大市场。其安全倡议 Project Glasswing 已有约 150 个合作伙伴,包括谷歌、英伟达、微软、苹果、三星电子等。AI模型AnthropicMythosFable 510 个信源在谈事件专题推荐理由:Anthropic 的最强模型 Mythos 和 Fable 5 很快要重新开放了,面向美国之外,韩国市场也在快速扩张。原文稍后读已读值得跟进有用关注 Anthropic
08:09IT之家(博客/媒体)72°智谱 GLM-5.2 在 Design Arena 单轮 HTML 网页设计评测中总分第一,超越 Claude Fable 5、Opus 4.6 等模型。相比前代 GLM 5.1,名次提升 5 位。推理价格为每百万 tokens 1.40/4.40 美元,低于 Fable 5 的 10/50 美元。GLM 5.2 在 91% 会话中使用 TailwindCSS,调用第三方库使胜率提升 6.0 个百分点。AI模型GLM-5.2智谱Claude Fable 58 个信源在谈事件专题推荐理由:智谱的 GLM-5.2 刚登顶设计榜单,比 Claude Fable 5 便宜很多,还能用好第三方库,做网页设计的可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
06:57官方一手marktechpost@Asif RazzaqNVIDIA AI推出了SpatialClaw,这是一个无需训练的智能体。它通过编写Python代码在持久内核中执行,将代码作为动作接口。SpatialClaw能够组合多种感知工具,实现3D空间推理。这种设计免去了传统微调或训练步骤。AI模型SpatialClawNVIDIAPython2 个信源在谈事件专题推荐理由:NVIDIA搞了个叫SpatialClaw的智能体,不用训练,直接用写Python代码的方式做3D空间推理,挺创新的。原文稍后读已读值得跟进有用关注 SpatialClaw
06:15官方一手marktechpost@Asif RazzaqVibeThinker-3B是一个3B参数的MIT许可证推理模型,基于Qwen2.5-Coder-3B构建。该模型采用Spectrum-to-Signal后训练流水线。在可验证基准上,它匹配了DeepSeek V3.2和Kimi K2.5的性能。AI模型VibeThinker-3BQwen2.5-Coder-3BDeepSeek V3.22 个信源在谈事件专题推荐理由:3B参数就能比肩DeepSeek V3.2和Kimi K2.5,基于Qwen2.5-Coder-3B开源,适合资源受限场景的推理任务。原文稍后读已读值得跟进有用关注 VibeThinker-3B
22:18官方账号Decoder@Maximilian Schreiner一项新基准测试评估了AI处理真实知识工作的能力。即使是最先进的AI模型,也仅能完全解决3%的任务。这一结果凸显了当前AI在处理复杂、多步骤的知识工作方面仍存在巨大短板。AI模型基准测试知识工作AI性能推荐理由:这个新基准狠狠打了AI的脸——最强模型也只完成3%的真实知识工作,别看平时吹得厉害。原文稍后读已读值得跟进有用关注 基准测试
21:53爱范儿@莫崇宇OpenAI 旗下的 Codex 模型迎来大更新。Codex 更新后可以学习用户电脑操作,将操作数据转化为训练素材。此次更新将 Codex 的能力从代码领域扩展到系统操作自动化。AI模型CodexOpenAI智能体10 个信源在谈事件专题推荐理由:嘿,OpenAI 的 Codex 又更新了,这次它能学习你在电脑上的操作,以后重复任务完全可以交给它,省心!原文稍后读已读值得跟进有用关注 Codex
18:36官方一手marktechpost@Asif RazzaqLiquid AI推出两个350M参数的多语言检索模型:LFM2.5-Embedding-350M(稠密双编码器)和LFM2.5-ColBERT-350M(后期交互模型),支持11种语言。模型专为边缘设备设计,可快速执行跨语言搜索。其ColBERT架构在保持高精度的同时,能处理句子级交互匹配。AI模型LFM2.5-Embedding-350MLFM2.5-ColBERT-350MLiquid AI推荐理由:Liquid AI出了两个轻量模型,350M参数就能做11种语言的搜索,还能装到手机等边缘设备上跑。原文稍后读已读值得跟进有用关注 LFM2.5-Embedding-350M
15:39IT之家(博客/媒体)银河通用推出全球首个人形机器人通用小脑GPT基础模型AstraBrain-WBC 0.5,参数量达8040万,使用2万小时人类动作数据训练。该模型采用GPT风格因果Transformer架构,将全身控制重构为连续序列预测问题。实验数据表明,训练数据从200万帧扩展到20亿帧时,模型成功率从83.26%提升至92.58%,零样本跟踪误差持续下降,首次验证机器人运动控制的Scaling Law效应。AstraBrain-WBC 0.5支持毫秒级全身数十自由度协同控制,实现高动态平衡与扰动抵抗。AI模型AstraBrain-WBC 0.5银河通用人形机器人推荐理由:银河通用首发人形机器人小脑大模型,2万小时数据训练,成功率随数据量暴涨,跟GPT一样有规模定律,值得技术控关注。原文稍后读已读值得跟进有用关注 AstraBrain-WBC 0.5
14:30官方账号Latent Space (swyx)(博客/媒体)GLM-5.2在主观体验测试中表现优异,得到社区好评。Z.ai 预测开源项目 Open Fable 将于12月推出。这标志着开源模型在性能上逐步接近前沿水平。AI模型GLM-5.2Z.aiOpen Fable推荐理由:GLM-5.2这次主观评价不错,开源模型终于开始追上GPT了。Z.ai预测年底会有新开源项目,值得关注。原文稍后读已读值得跟进有用关注 GLM-5.2
13:36量子位@衡宇73°北京通用人工智能研究院发布全球首个人形机器人通用小脑,基于2万小时人类动作数据训练。该模型在未经微调的情况下,能零样本泛化到多种新任务和场景。相比传统方法,它减少了90%的调试时间,使机器人动作更自然。AI模型通用小脑人形机器人零样本泛化推荐理由:北通院搞了个通用小脑,用两万小时人类动作数据训练,机器人不用重新学就能干新活,比传统方法省时省力。原文稍后读已读值得跟进有用关注 通用小脑
03:29官方账号Decoder@Matthias BastianOpenAI发布了ChatGPT的医疗功能升级,基于GPT-5.5 Instant模型。在内部对比测试中,该模型在准确性、清晰度和完整性上均超过医生撰写的答案。健康相关陈述的错误率降低了71%。OpenAI声称这是医疗问答能力的一次显著提升。AI模型GPT-5.5ChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI用GPT-5.5 Instant让ChatGPT在医疗问答上比医生答得更好,准确率提升了71%,值得试。原文稍后读已读值得跟进有用关注 GPT-5.5
02:10官方一手OpenAI Blog(博客/媒体)OpenAI 推出 GPT-5.5 Instant,用于增强 ChatGPT 在健康和 wellness 领域的回复质量。新模型在推理、上下文理解、沟通清晰度上均有提升,并引入 physician-informed 评估方法。该改进旨在提高医疗健康场景下 AI 回复的准确性和可信度。AI模型GPT-5.5 InstantChatGPTOpenAI10 个信源在谈事件专题推荐理由:GPT-5.5 Instant 让 ChatGPT 的健康建议更靠谱了,医生参与评估的设计值得关注。原文稍后读已读值得跟进有用关注 GPT-5.5 Instant
17:43IT之家(博客/媒体)小米发布并开源 Xiaomi Miloco 2.0,基于自研 MiMo 大模型,以 Agent 形式接入 OpenClaw,实现从 Miloco 1.0 到主动智能的升级。新方案具备通用常识,可识别孩子玩刀具、老人跌倒等危险并预警。通过人脸与体态识别家庭成员,支持主动注册新成员及个性化操作。系统能沉淀家庭成员的长期习惯,在用户开口前主动执行如提醒休息、推荐场景联动等任务。硬件要求内存≥4GB、存储≥256GB,推荐 Mac mini 运行,需要米家设备和多模态大模型 API Key。AI模型Xiaomi Miloco 2.0MiMoOpenClaw1 个信源在谈事件专题推荐理由:小米把全屋智能 Agent 开源了,基于 MiMo 大模型,能认人、记习惯、主动干活,自己搭一套试试。原文稍后读已读值得跟进有用关注 Xiaomi Miloco 2.0
16:09官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯元宝在2026年高考数学中取得150/150满分,展示了其推理能力。该模型还具备AI agent功能,可辅助学生进行高考志愿填报。这一成绩标志着中国大语言模型在数学推理和智能体应用上的进步。测试中元宝能理解多步复杂问题并给出准确答案。AI模型YuanbaoTencent推理模型推荐理由:腾讯元宝高考数学考了满分,还能帮你填志愿,比很多真人老师还靠谱。原文稍后读已读值得跟进有用关注 Yuanbao
13:58IT之家(博客/媒体)76°英伟达GEAR实验室联合负责人Jim Fan宣布首次在物理世界中启用AutoResearch。ENPIRE是编码智能体框架,将8个Codex智能体配备多个机器人、GPU分配和Token预算,设定任务目标。机器人学会寻找视觉线索、系扎带、整理钉子以及把显卡插到主板上。Jim Fan表示机器人可整夜自我改进,并计划开源该技术。AI模型英伟达ENPIRECodex2 个信源在谈事件专题推荐理由:英伟达的机器人自己学会了装显卡,还能整夜自我训练,以后在家也能托管一个机器人实验室了。原文稍后读已读值得跟进有用关注 英伟达
12:35IT之家(博客/媒体)73°阿里与人大联合开源 LOGOS,这是一个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B 仅用 1B 参数量,在多项科学任务上超越参数为 8×7B 的微软 NatureLM。模型预训练语料涵盖蛋白质(28.9B tokens)、抗体(3.0B tokens)、小分子(2.1B tokens)等 7 类模态共 44.87B tokens。它通过共享词表将异构对象编码为离散 token,无需 3D 坐标即可理解 3D 空间互作规律。LOGOS 已开源模型权重、推理代码与技术报告。AI模型LOGOSNatureLM开源模型推荐理由:阿里开源的 LOGOS 模型,用 1/56 参数就碾压了微软 NatureLM,还统一了蛋白质、小分子等科学对象的语言,搞科研的可以看看源码和论文,开箱即用。原文稍后读已读值得跟进有用关注 LOGOS
11:09IT之家(博客/媒体)72°华为昇腾宣布0 Day支持智谱GLM-5.2,昇腾A3系列已实现单双机及大EP推理部署。优化技术包括MOE大融合算子、通信与计算融合、注意力前处理与多Token预测、高并发调度与预填充延迟机制等。GLM-5.2在Code Arena盲测中取得全球可用模型第一,拥有1M上下文能力,长程任务表现介于Claude Opus 4.7与4.8之间。该模型在主流编程基准上保持开源SOTA,并已适配华为昇腾等国产算力平台。AI模型GLM-5.2华为昇腾推理优化推荐理由:华为昇腾0 Day适配智谱GLM-5.2,推理优化让长上下文编程更高效,开源模型性能比肩Claude Opus。原文稍后读已读值得跟进有用关注 GLM-5.2
10:35官方一手marktechpost@Michal Sutter精选OpenAI推出LifeSciBench,包含750个专家撰写任务,覆盖7个工作流和7个生物学领域,由173位博士科学家构建,使用19,020条评分标准评估推理与决策。当前最佳模型GPT-Rosalind得分仅36.1%,在人工制品、精确输出和操作决策上仍有较大提升空间。该基准旨在测试AI的真实研究能力而非单纯记忆。AI模型LifeSciBenchOpenAIGPT-Rosalind10 个信源在谈事件专题推荐理由:想看看AI搞科研到底多强?OpenAI出了个750道专家题的LifeSciBench,GPT-Rosalind才36.1%,差距大到让你吃惊。原文稍后读已读值得跟进有用关注 LifeSciBench
08:21IT之家(博客/媒体)73°苹果在WWDC26特别讲座中演示了在4台Mac Studio上通过LM Studio本地运行1万亿参数的Kimi K2.6模型。工程师仅用单条提示词生成了WWDC badge tracker应用,该应用具备3D动画和全息视觉效果。演示使用了低延迟RDMA over Thunderbolt技术,苹果在macOS Tahoe 26.2中引入。Kimi K2.6由月之暗面于2026年4月20日发布,升级了代码编写和Agent集群能力。AI模型Kimi K2.6Mac StudioLM Studio2 个信源在谈事件专题推荐理由:苹果用4台Mac Studio跑万亿参数Kimi K2.6,本地低延迟,一条提示词生成App,开发者必看。原文稍后读已读值得跟进有用关注 Kimi K2.6
08:15官方账号Simon Willison’s Weblog(博客/媒体)精选73°中国AI实验室Z.ai于6月16日开源GLM-5.2,采用MIT许可证。该模型753B参数、40激活参数(MoE),上下文窗口从GLM-5.1的20万提升至100万。在Artificial Analysis Intelligence Index v4.1上以51分领先MiniMax-M3(44)和DeepSeek V4 Pro(44)。在Code Arena WebDev前端编码排行榜上排名第二,仅次于Claude Fable 5。OpenRouter上输入价格$1.40/百万token,输出$4.40/百万token。AI模型GLM-5.2Z.aiOpenRouter4 个信源在谈事件专题推荐理由:Z.ai开源了GLM-5.2,纯文本模型在智能和编码基准上超过DeepSeek V4和Kimi K2.6,价格只有GPT-5.5的五分之一。原文稍后读已读值得跟进有用关注 GLM-5.2
04:41官方一手OpenAI Blog(博客/媒体)OpenAI 发布了 LifeSciBench,这是一个由 10 位生命科学专家编写并经过独立审查的基准测试。该基准包含 30 个任务,覆盖文献综述、实验设计、数据分析等真实研究场景。初步测试显示,GPT-4o 在多数任务上优于其他模型,但所有模型在需要跨领域推理的任务中表现仍有显著差距。LifeSciBench 旨在为 AI 在科学领域的可靠性和安全性提供更严格的评估工具。AI模型OpenAILifeSciBench基准测试10 个信源在谈事件专题推荐理由:OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。原文稍后读已读值得跟进有用关注 OpenAI
01:55官方账号Decoder@Jonathan Kemper精选智谱AI推出开源模型GLM-5.2,采用MIT许可证,支持稳定100万token上下文。在FrontierSWE编码基准测试中,GLM-5.2以1个百分点之差落后于Anthropic的Claude Opus 4.8。该模型在推理能力上仍显著落后于闭源竞争对手。AI模型GLM-5.2智谱AIClaude Opus10 个信源在谈事件专题推荐理由:智谱AI的GLM-5.2在长时间编码任务上只比Claude Opus 4.8差1%,还是开源免费,码农可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
01:30官方一手marktechpost@Asif RazzaqVercel 开源了 Eve,这是一个 Apache-2.0 许可的 AI Agent 框架,目前处于公开预览阶段。每个 Agent 被定义为一个包含配置和能力的文件目录,内置了持久化执行、沙箱、审批、连接、通道和评估功能。开发者可使用 npx eve@latest init 快速搭建项目,并通过 vercel deploy 直接部署无需修改。AI模型EveVercel智能体推荐理由:Vercel 出了个开源 Agent 框架 Eve,把 Agent 做成文件目录,自带沙箱和评估,用 npx init 就能部署,挺省事的。原文稍后读已读值得跟进有用关注 Eve
00:36量子位@一水某国产模型在多项关键医疗测评中超过GPT-5.5。这些测评覆盖多个专科方向,准确率指标领先。这表明国产医疗AI在核心性能上已实现突破。AI模型GPT-5.5医疗AI基准测试推荐理由:国产医疗AI终于打败GPT-5.5了,评测成绩很能打,值得关心AI落地的人看一看。原文稍后读已读值得跟进有用关注 GPT-5.5
23:33官方一手marktechpost@Asif Razzaq精选MiniMax 发布 Sparse Attention (MSA) 机制,基于 Grouped Query Attention (GQA) 架构。MSA 包含一个轻量级索引分支,为每个查询和 GQA 组选择 Top-k 键值块;主分支仅关注这些块。在 1M 上下文长度下,每个 token 的注意力计算量减少 28.4 倍。该机制训练在 109B 参数的 MoE 模型上,使用 3T token 预算,下游基准测试中与 GQA 性能相当。AI模型MiniMaxMSA稀疏注意力推荐理由:MiniMax 搞了个新稀疏注意力 MSA,1M 上下文计算量降 28 倍,准度却一点没掉,适合长文本场景。原文稍后读已读值得跟进有用关注 MiniMax
23:30官方账号Decoder@Maximilian Schreiner73°Nvidia、卡内基梅隆大学和UC Berkeley的研究人员使用AI编码智能体(coding agents)训练机器人自主完成灵巧抓取任务。项目部署了8台机器人,在真实世界中执行复杂抓取,成功率高达99%。该研究展示了AI智能体在机器人技能自我提升中的潜力。AI模型NvidiaAI编码智能体机器人8 个信源在谈事件专题推荐理由:Nvidia和大学团队让8台机器人用AI编码智能体自己练抓取,成功率冲到99%,比手写代码更灵活。原文稍后读已读值得跟进有用关注 Nvidia
13:58官方一手marktechpost@Michal Sutter精选OpenAI于2026年6月16日推出Deployment Simulation方法,通过回放历史对话让新候选模型生成完成并评分,以估计部署时不良行为率。该方法报告了1.5倍中位数乘法误差,将预部署风险评估扩展至智能体编码场景。文章还讨论了该方法的局限性,如无法覆盖所有风险类型。AI模型OpenAIDeployment SimulationAI安全10 个信源在谈事件专题推荐理由:OpenAI搞了个新方法,用历史对话模拟测试模型,能估算不良行为率,误差才1.5倍,做AI安全评估的朋友可以看看。原文稍后读已读值得跟进有用关注 OpenAI
13:40量子位@量子位的朋友们昆仑万维推出天工3.1版本,新增Skywork Design画布功能和Dynamic Workflows工作流系统。Skywork Design让AI能自由生成和编辑可视化界面,Dynamic Workflows支持多智能体协作执行复杂任务。据官方数据,天工超级智能体收入实现三倍增长。AI模型天工3.1Skywork DesignDynamic Workflows推荐理由:天工3.1给了两个新工具:一个让AI画界面,一个让AI组团干活。收入涨了三倍,可以试试。原文稍后读已读值得跟进有用关注 天工3.1
12:43IT之家(博客/媒体)xAI 于 6 月 17 日正式上线 Grok Imagine Video 1.5 模型,此前该模型于 6 月 3 日推出预览版。相比前代,模型升级了音画同步,可同时生成音效、环境音和对话,口型同步更自然。运动连贯性提升,减少了肢体扭曲和漂浮假象,能更好模拟重量与动量。在 Fast 模式下,生成 6 秒 720p 视频仅需约 25 秒,而前代需要 40 秒以上,现已通过 xAI API 提供。AI模型Grok Imagine Video 1.5xAI视频生成1 个信源在谈事件专题推荐理由:xAI 刚上线的 Grok Imagine Video 1.5,6 秒 720P 视频生成只要 25 秒,音画同步和运动真实感比前代强不少,做短视频挺合适。原文稍后读已读值得跟进有用关注 Grok Imagine Video 1.5
11:40IT之家(博客/媒体)大晓机器人联合香港中文大学发布并开源具身操作VLA模型ACE-Ego。在RoboCasa GR1 TableTop基准上,ACE-Ego以72.8%平均成功率刷新纪录,超越英伟达GR00T、PI π₀.₅等模型。在RoboTwin 2.0高难度双臂操作测试中,ACE-Ego成功率90.62%。该模型已能稳定完成塑料袋打包、鞋子装入鞋盒等零售操作。AI模型ACE-Ego大晓机器人人形机器人推荐理由:大晓机器人开源了新模型ACE-Ego,在人形机器人操作基准上拿了第一,能打包塑料袋、装鞋盒,挺实用的。原文稍后读已读值得跟进有用关注 ACE-Ego
11:36量子位@十三智谱AI于2026年6月开源了GLM-5.2模型,支持1M上下文长度。该模型在AI编程评测基准上取得第一,超过此前领先的Fable-5。基于GLM架构的持续优化,GLM-5.2在代码生成任务中展现出更强能力。开源版本已发布在GitHub。AI模型GLM-5.2智谱编程助手10 个信源在谈事件专题推荐理由:智谱开源了GLM-5.2,1M超长上下文,编程能力直接拿下第一,想换编程模型的话可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
10:10官方一手pandaily@contact@pandaily.com (Pandaily)73°阿里巴巴发布了Qwen-Robot系列,这是其首个具身AI模型系列,涵盖导航、操作和世界建模三个领域。该系列可部署在Unitree Go2四足机器人上,仅需一个摄像头就能运行。Qwen-Robot模型旨在让机器人更智能地感知和交互物理世界。AI模型Qwen-Robot阿里Unitree Go2推荐理由:阿里给机器狗装上了AI大脑,单摄像头就能导航干活,Qwen-Robot系列挺实用。原文稍后读已读值得跟进有用关注 Qwen-Robot
09:27IT之家(博客/媒体)精选智谱发布并开源 GLM-5.2 模型,支持 1M 无损上下文。在 Code Arena 盲测中取得全球可用模型第一。在多个长程任务基准上表现介于 Claude Opus 4.7 与 4.8 之间。编程基准上保持开源 SOTA,与 Claude Opus 4.8 可比。已适配华为昇腾、平头哥等国产算力平台,单位 token FLOPs 降至 2.9 倍。AI模型GLM-5.2智谱Code Arena推荐理由:智谱的 GLM-5.2 开源了,1M 上下文还拿了 Code Arena 第一,编程和长任务都强,国产算力也能跑。原文稍后读已读值得跟进有用关注 GLM-5.2
07:25IT之家(博客/媒体)83°英伟达在MLPerf Training 6.0七项基准测试中全部夺魁,Blackwell平台成为唯一全覆盖的提交系统。全新GB300 NVL72相比GB200 NVL72同等规模带来1.6倍训练速度提升。CoreWeave使用基于Spectrum-X以太网的GB300 NVL72系统,在8192块GPU规模下将DeepSeek-V3 671B训练耗时缩短至2.02分钟。本次测试首次引入DeepSeek-V3 671B和GPT-OSS-20B两个MoE工作负载,刷新了大规模训练效率纪录。AI模型NVIDIABlackwellDeepSeek-V39 个信源在谈事件专题推荐理由:英伟达Blackwell平台在MLPerf上把DeepSeek-V3 671B训练时间压到2分钟,比上代快60%,性能真狠。原文稍后读已读值得跟进有用关注 NVIDIA
00:55官方一手marktechpost@Asif Razzaq精选73°Qwen团队推出Qwen-RobotSuite,包含三个具身AI模型。RobotManip是基于Qwen3.5-4B的视觉-语言-动作模型,用于操作任务。RobotWorld是一个60层MMDiT架构的语言条件视频世界模型。RobotNav是基于Qwen3-VL的导航模型,提供2B、4B和8B三种参数量。AI模型Qwen-RobotSuiteRobotManipRobotWorld推荐理由:一口气发了三个模型,从操作到导航都管了,全用自家Qwen3.5和Qwen3-VL,做机器人研究的可以看看。原文稍后读已读值得跟进有用关注 Qwen-RobotSuite
22:10量子位@允中一种新模型使机器人实现手脚腰身全身协同,完成精细操作。该模型在仿真环境中提升任务成功率,真实机器人上验证了效果。手部动作问题根源在于全身协调,而非单关节。AI模型机器人控制全身协同精细操作推荐理由:这个模型让机器人能全身配合做精细活,手的问题原来在腰身协调,挺有意思的新思路。原文稍后读已读值得跟进有用关注 机器人控制
19:46官方账号Decoder@Jonathan Kemper爱沙尼亚语言研究所发布了一项基准测试,用于评估AI语言模型对俄语宣传的抵抗力。测试涵盖了GPT-4o、Claude 3.5 Sonnet、Llama 3.1等8个模型,发现部分模型在30%的测试样本中会生成亲俄内容。Meta的Llama 3.1 70B表现最差,错误生成率高达42%;而OpenAI的GPT-4o错误率最低,仅为12%。该基准测试还包含一个包含1000个样本的俄语宣传语料库,用于衡量模型对政治操纵的脆弱性。AI模型GPT-4oClaude 3.5 SonnetLlama 3.110 个信源在谈事件专题推荐理由:想知道你用的AI会不会被俄语宣传带跑偏?爱沙尼亚语言研究所测了8个主流模型,GPT-4o最扛打,Llama 3.1中招率最高。看看你的AI排第几。原文稍后读已读值得跟进有用关注 GPT-4o
15:49IT之家(博客/媒体)精选OpenRouter于6月14日发布Fusion API复合AI模型,通过并行调用多个模型并汇总结果实现协同回答。基准测试中,Claude Opus 4.8+GPT-5.5+Gemini 3.1 Pro组合得分68.3%,超过Claude Fable 5的65.3%。而Gemini 3 Flash+Kimi K2.6+DeepSeek V4 Pro组合以约一半成本实现64.7%的得分,差距不到1%。该服务分为并行请求、审查模型分析、调用模型生成最终答复三个步骤。AI模型OpenRouterFusionClaude Fable 59 个信源在谈事件专题推荐理由:OpenRouter用多个便宜模型拼出顶级效果,成本砍半但性能追上Claude Fable 5,预算有限又想用好模型可以试试。原文稍后读已读值得跟进有用关注 OpenRouter
14:55量子位@量子位的朋友们阿里发布Qwen-Robot系列,包含Qwen-Robot-V1、Qwen-Robot-V1-Pro和Qwen-Robot-V1-Plus三款模型。该系列将视觉、语言与行动能力整合,支持在复杂环境中完成抓取、导航等任务。在RoboBench基准上,Qwen-Robot-V1-Pro任务成功率较基线提升15.3%。模型参数规模从7B到72B不等,可适配不同硬件平台。AI模型Qwen-Robot阿里具身大模型推荐理由:阿里刚出的Qwen-Robot系列,三个模型从7B到72B,让机器人能边看边想边动,RoboBench成绩提升15%,搞具身智能的值得看看。原文稍后读已读值得跟进有用关注 Qwen-Robot
12:25IT之家(博客/媒体)谷歌 6 月 15 日更新 Android Bench 榜单,测评 AI 模型在安卓开发任务中的表现。OpenAI 的 GPT-5.5 以 74 分排名第一,GPT-5.4 以 72.4 分第二,谷歌 Gemini 3.1 Pro Preview 同分第三。谷歌自家 Gemini 3.5 Flash 仅得 63.7 分,排第六,且单次运行平均成本 147.1 美元,为榜单最贵。DeepSeek V4 Flash 得分 52.7 排第 12,成本仅 8.4 美元,Gemini 3.5 Flash 成本是其 17.5 倍。AI模型Android BenchGemini 3.5 FlashGPT-5.510 个信源在谈事件专题推荐理由:谷歌新榜单实测,Gemini 3.5 Flash 在安卓开发任务中得分低、成本高,性价比远不如 DeepSeek V4 Flash。原文稍后读已读值得跟进有用关注 Android Bench