14:54官方账号Epoch AI@EpochAIResearchClaude Fable 5 在 Epoch Capabilities Index (ECI) 上取得 161 分的新高,比 GPT-5.5 Pro 高出 1 分。这是 Anthropic 一年多来首次在 ECI 上领先。该指数衡量模型综合能力,Claude Fable 5 的表现重新夺回了榜首位置。AI模型Claude Fable 5GPT-5.5 ProAnthropic10 个信源在谈事件专题推荐理由:Claude Fable 5 在 ECI 上拿 161 分,超 GPT-5.5 Pro 一分,Anthropic 终于又领先了。原文稍后读已读值得跟进有用关注 Claude Fable 5
14:42官方账号Simon Willison@simonw精选Jeremy Howard 称 GLM 5.2 是开放权重模型中的奇迹,性能至少与 Opus 4.8 和 GPT 5.5 持平。它速度快、成本低、输出简洁,且擅长长上下文处理。该模型由 Zai_org 发布,目前尚未在 Groq 或 Cerebras 等超快推理提供商上运行,但社区期待其部署。AI模型GLM-5.2Zai_org开放权重推荐理由:GLM 5.2 开放权重、性能比肩闭源顶尖模型,还便宜又快,写代码或处理长文档会很顺手。原文稍后读已读值得跟进有用关注 GLM-5.2
14:36小互@imxiaohu豆包实时语音模型3.0 API 正式上线,支持全双工模式,可同时听和说并随时插话。采用端到端语音进语音出,无需转录,响应更快更自然。模型能精准遵循指令,例如在多人聊天中设定规则后静待话题出现再参与。支持自定义工具调用,可在实时对话中完成预定日历、发邮件、总结文档等任务,向语音 Agent 迈进。AI模型豆包实时语音模型3.0全双工推荐理由:豆包出了3.0语音模型,能同时听说、随时插话,还能在对话里调工具办事情,比传统语音助手强一大截。原文稍后读已读值得跟进有用关注 豆包
12:51官方账号Cohere@cohere精选Cohere宣布其首个开源智能体编码模型的4-bit量化版本已可用。该量化版模型体积显著缩小,可在Mac上本地运行。用户可通过链接获取模型权重。此次发布使得开发者能够更便捷地在个人设备上运行智能体编码模型。AI模型Cohere4-bit量化智能体推荐理由:Cohere把自己最新的编程智能体模型压缩到4-bit,Mac上就能跑,本地开发效率直接拉满!原文稍后读已读值得跟进有用关注 Cohere
12:42Fireworks AI@FireworksAI_HQJeremy Howard在X平台上称赞Zai_org的GLM 5.2模型,称其至少与Opus 4.8和GPT 5.5一样优秀。他指出该模型速度极快、成本低廉且回答不冗长,在处理长上下文时表现非常出色。Howard表示从未见过如此优秀的开源权重模型。AI模型GLM 5.2Zai_orgOpus 4.83 个信源在谈事件专题推荐理由:想试试媲美顶级闭源模型的开源模型吗?GLM 5.2又快又便宜,长上下文超强,看看Jeremy Howard怎么夸的。原文稍后读已读值得跟进有用关注 GLM 5.2
09:25官方账号Clement Delangue@ClementDelangueAA-Briefcase基准测试评估模型在长期知识工作项目中的表现,任务成本差异达800倍。Claude Fable 5以1587 Elo领先,但平均任务成本31美元;Claude Opus 4.8得分1356,成本10.40美元。DeepSeek V4 Flash仅需约0.04美元,性价比最高。GLM-5.2得分1266,成本2.40美元,得分仅低Claude Opus 4.8不到90 Elo,成本不到其25%。AI模型Claude Fable 5DeepSeek V4 FlashGLM-5.210 个信源在谈事件专题推荐理由:新基准AA-Briefcase测长期项目,Claude Fable 5最强但贵,DeepSeek V4 Flash极便宜,GLM-5.2性价比超赞。原文稍后读已读值得跟进有用关注 Claude Fable 5
07:10官方账号OpenAI@OpenAIOpenAI在真实对话中训练模型,通过强化学习强化诚实、谦逊、开放纠正、公平和关怀人类福祉等特质。该训练覆盖健康、科学、教育等12个领域,旨在提升模型的对齐与安全性。方法基于RLHF改进,专注对话场景中的具体行为。AI模型OpenAI强化学习AI安全10 个信源在谈事件专题推荐理由:OpenAI训练模型时不止看能力,还用强化学习专门教它诚实、谦逊、愿意接受批评,覆盖12个领域,对AI安全性很有意义。原文稍后读已读值得跟进有用关注 OpenAI
07:06官方账号Greg Brockman@gdbOpenAI o1推理模型公布后,其他实验室研究者认为这是战略失误,应保密以拉开差距。Noam Brown引用研究表示,公开o1有助于推动医学推理领域的进展。这验证了OpenAI开放模型的正确性,加速了推理范式的应用。AI模型OpenAIo1推理模型10 个信源在谈事件专题推荐理由:Noam Brown聊了OpenAI开放o1背后的争论,告诉你为什么公开反而能让医学推理进步更快。原文稍后读已读值得跟进有用关注 OpenAI
06:39官方账号OpenAI@OpenAI精选OpenAI发布测试结果,评估模型对齐在压力下的表现。在对抗性提示下,模型更难被引导至有害行为,同时依然能响应有益指令。初步证据表明,模型对有害微调也表现出更强的抵抗力。这项测试关注模型的安全鲁棒性,未提及具体模型版本或基准分数。AI模型OpenAI对齐对抗性提示10 个信源在谈事件专题推荐理由:OpenAI发现他们的模型在对抗压力下挺得住,不容易被带坏,安全对齐效果不错。原文稍后读已读值得跟进有用关注 OpenAI
06:38官方账号Greg Brockman@gdb精选72°OpenAI 与波士顿儿童医院及哈佛大学合作,在 NEJM AI 发表研究。研究使用 o3 Deep Research 模型重新分析 376 个先前未解决的罕见儿科病例。模型帮助临床医生找到了 18 个新诊断。其中包括 Kyra 的病例,她从 9 岁起持续肌肉无力,在 28 岁生日前夕被确诊为罕见的肌原纤维肌病。AI模型OpenAIo3 Deep Research罕见病10 个信源在谈事件专题推荐理由:OpenAI 的 o3 Deep Research 模型帮医生翻出了 376 个陈年疑难病例,找出了 18 种之前漏诊的病。有个女孩从 9 岁查到 28 岁,终于有了答案。这 AI 真的能救命。原文稍后读已读值得跟进有用关注 OpenAI
06:37官方账号OpenAI@OpenAIOpenAI 发布声明称,这是朝向更鲁棒有益和对齐模型的早期步骤。他们正在训练模型将有益特质带入新情境,使AI在能力增强的同时变得更可靠、透明和有用。该工作属于对齐研究的一部分,尚未披露具体模型或基准测试结果。AI模型OpenAIAI安全对齐10 个信源在谈事件专题推荐理由:OpenAI 开始教模型把好习惯带到新场景,让AI更靠谱。这个对齐实验挺关键,关注未来进展。原文稍后读已读值得跟进有用关注 OpenAI
05:07GitHub@github精选MicrosoftAI 的 MAI-Code-1-Flash 模型现已扩展至 GitHub Copilot CLI 和 GitHub Copilot 应用。该模型专为 Copilot 设计调优,在其尺寸下提供最佳质量。早期测试中,它超越其他小模型。AI模型MAI-Code-1-FlashMicrosoftGitHub Copilot推荐理由:微软把专为 Copilot 调的小模型放到命令行了,代码质量比别的小模型好,试试吧。原文稍后读已读值得跟进有用关注 MAI-Code-1-Flash
04:25官方账号Clement Delangue@ClementDelangue精选Poolside 发布了其最新模型 Laguna M.1,拥有 256K 上下文长度。该模型采用 Apache 2.0 许可,权重已开放至 Hugging Face。包括基础版和微调版检查点可供下载。AI模型PoolsideLaguna M.1Hugging Face2 个信源在谈事件专题推荐理由:Poolside 把最强的 Laguna M.1 模型完全开放了,256K 上下文,Apache 2.0 许可,直接去 Hugging Face 下载权重用。原文稍后读已读值得跟进有用关注 Poolside
04:02lmarena.ai@lmarena_ai82°Agent Arena推出了因果追踪方法论,通过分析人类与AI代理协作的追踪数据来量化协作的真实价值,并能观测到广泛的模型行为。基于该方法的新排行榜显示,GLM-5.2 (Max)进入前十,成为最强开源模型,确认成功率比基线高+9.4%,表扬-抱怨比高+14.9%。Claude Fable 5在几乎所有指标上曾排名第一,但因美国政府指令暂停访问。排行榜基于数百万个真实世界长期代理任务,使用因果追踪评估模型相对于平均模型的表现。AI模型Agent ArenaGLM-5.2Claude Fable 510 个信源在谈事件专题推荐理由:想看看人机协作到底有没有用?Agent Arena拿数据说话,GLM-5.2开源最强,Claude Fable 5刚登顶就被叫停,这瓜值得吃。原文稍后读已读值得跟进有用关注 Agent Arena
03:09官方账号Sebastian Raschka@rasbt73°GLM-5.2是智谱发布的最新开放权重模型,基于GLM-5和GLM-5.1架构,复用了DeepSeek V3.2的Multi-head Latent Attention(MLA)和DeepSeek Sparse Attention(DSA)机制。新增的IndexShare机制在每四层运行一次完整索引器,后续三层复用选中的token索引,使100万token推理成本大幅降低。目前GLM-5.2在开放权重模型中表现最佳。AI模型GLM-5.2DeepSeek V3.2IndexShare2 个信源在谈事件专题推荐理由:智谱的GLM-5.2开放权重模型,用DeepSeek V3.2的注意力机制加上自己的IndexShare,把1M长上下文推理搞便宜了,值得看看。原文稍后读已读值得跟进有用关注 GLM-5.2
03:08官方账号vLLM@vllm_project精选72°Anyscale 与 Google Cloud GKE 合作推出 Ray Serve LLM 新版本,在 vLLM 基础上实现显著性能飞跃。预填密集型负载吞吐量提升 4.4 倍,解码密集型负载提升 24 倍。三个关键优化包括:控制平面端点选择器的直接流式传输、新的 vLLM Ray V2 执行器后端、以及基于 HAProxy 的 C 语言级路由。Ray 的容错、可观察性和跨 K8s/VM 可移植性为复杂推理部署奠定基础。AI模型Ray Serve LLMvLLMAnyscale推荐理由:Anyscale 和 Google Cloud 联手让 vLLM 推理快了好几倍,预填负载快 4.4 倍,解码负载快 24 倍,用 Ray V2 执行器就能体验。原文稍后读已读值得跟进有用关注 Ray Serve LLM
03:04官方账号vLLM@vllm_project精选Poolside 发布开源智能体编程模型 Laguna M.1,采用 70 层稀疏 MoE 架构,总参数量 225B,每 token 激活 23B,支持 256K 上下文。模型使用 256 个专家,top-k=16 路由,专为长程智能体编程设计。支持工具调用间交错推理,可每请求切换,采用 Apache 2.0 许可。vLLM v0.21.0 已提供 Day-0 支持。AI模型Laguna M.1Poolside开源模型2 个信源在谈事件专题推荐理由:Poolside 刚开源了 Laguna M.1,225B 参数的智能体编程模型,256K 上下文,vLLM 已原生支持,想玩 agentic coding 的可以试试。原文稍后读已读值得跟进有用关注 Laguna M.1
03:03官方账号Greg Brockman@gdb76°OpenAI 发布 GPT-5.5 Instant,其健康相关问题的回答水平已与前沿思考模型持平。该模型联合 60 个国家、49 种语言、26 个专科的数百名医生共同开发。每周有超过 2.3 亿用户向 ChatGPT 咨询健康问题。GPT-5.5 Instant 在识别紧急情况、询问上下文、解释不确定性及简化复杂信息方面表现更优。该模型已面向所有免费用户开放。AI模型GPT-5.5OpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI 出了 GPT-5.5 Instant,免费版就能用,健康问答能力大幅提升,和医生合作训练的,靠谱。原文稍后读已读值得跟进有用关注 GPT-5.5
02:39官方账号OpenAI@OpenAIOpenAI 发布 GPT-5.5 Instant,该模型在健康相关问题上的表现与前端推理模型(如 o1)持平。每周超过 2.3 亿人通过 ChatGPT 咨询健康问题,新模型能更准确识别需要紧急护理的情况,主动询问相关背景,明确解释不确定性,并简化复杂医学术语。所有免费用户均可使用 GPT-5.5 Instant,无需订阅。此次改进基于医生主导的评估,确保了医疗场景下的可靠性。AI模型GPT-5.5 InstantOpenAI健康10 个信源在谈事件专题推荐理由:OpenAI 把 GPT-5.5 Instant 的医疗问答能力做到了和自家顶级推理模型一样好,而且免费用户都能用,生病问AI更放心了。原文稍后读已读值得跟进有用关注 GPT-5.5 Instant
02:17@koltregaskes@koltregaskes79°据消息,OpenAI GPT-5.6和GPT-5.6 Pro预计下周四(next Thursday)正式登陆。部分用户可能已在ChatGPT网页端体验GPT-5.6 Pro模型。同时,Anthropic的Claude Fable 5也可能在未来几天内回归。AI模型GPT-5.6GPT-5.6 ProOpenAI10 个信源在谈事件专题推荐理由:GPT-5.6和Pro版下周就来,Claude Fable 5也快回来了,想尝鲜的可以留意。原文稍后读已读值得跟进有用关注 GPT-5.6
01:54官方账号LMSYS Org (SGLang)@lmsysorgpoolside发布的Laguna M.1是一个225B参数的MoE模型,专为智能体编码和长期任务设计。该模型采用70层结构:3个密集SwiGLU层加67个稀疏MoE层,共有256个专家,top-k=16且使用无辅助损失负载均衡。它在所有层使用全局注意力:64个Q头、8个KV头,以及softplus输出门控。Laguna M.1支持原生交错推理:在工具调用之间进行思考,并可每个请求切换。在SWE-bench Verified、SWE-bench Multilingual、SWE-Bench Pro和Terminal-Bench 2.0上表现强劲。现在可通过SGLang运行。AI模型Laguna M.1poolsideSGLang2 个信源在谈事件专题推荐理由:poolside刚发的225B MoE模型Laguna M.1,专为智能体编码设计,SGLang直接跑起来了,在SWE-bench上很强。原文稍后读已读值得跟进有用关注 Laguna M.1
01:44官方账号Anthropic@AnthropicAIAnthropic发布Project Fetch实验,让两个零机器人经验的团队编程机器狗。其中一个团队使用Claude辅助,另一个团队仅靠传统方法。实验对比了两组的表现,展示了Claude在机器人编程中的实际效果。结果视频已在Anthropic官方推文中公开。AI模型AnthropicClaudeProject Fetch10 个信源在谈事件专题推荐理由:Anthropic让没碰过机器人的团队用Claude写机器狗代码,看看AI到底能帮多少忙,结果挺有意思。原文稍后读已读值得跟进有用关注 Anthropic
01:43官方账号Anthropic@AnthropicAI精选Anthropic 发布 Frontier Red Team 博客,介绍 Project Fetch 第二阶段:测试 Claude 编程机器人狗的能力。Opus 4.7 自主完成编程任务,速度比去年最佳人类团队(使用 Opus 4.1)快约 20 倍。尽管速度提升显著,机器人狗仍未成功取回沙滩球。该研究旨在评估前沿模型在物理世界中的自主能力与安全风险。AI模型ClaudeOpus 4.7Anthropic10 个信源在谈事件专题推荐理由:Anthropic 让 Claude 自己写代码控制机器狗,速度比人快20倍,虽然最后没抓到球,但过程特别有意思原文稍后读已读值得跟进有用关注 Claude
01:33官方账号SiliconFlowAI@siliconflowai精选Z.ai 的 GLM 5.2 在编码基准 CodeArena 上排名第一。每百万 token 输入缓存/输入/输出价格为 0.26/1.40/4.40 美元,支持 1M 上下文长度。其编码性能与 Opus 4.8 相当,并提供 max 和 high 两种推理模式。该模型已完全开源,可通过 SiliconFlow 的 T+0 合作获取。AI模型GLM 5.2Z.aiCodeArena推荐理由:Z.ai 的 GLM 5.2 在编码竞技场拿了第一,价格比 Opus 便宜,还有 1M 上下文,编程党可以白嫖开源版。原文稍后读已读值得跟进有用关注 GLM 5.2
01:32官方账号SiliconFlowAI@siliconflowai精选MoonshotAI 基于 K2.6 推出了 Kimi K2.7 Code,参数量为 32B 激活/1T 总参数,支持交错思考与多步工具调用。相比 K2.6,推理 token 使用量降低 30%,在编码与指令遵循上表现提升,接近 GPT-5.5 和 Opus 4.8。定价为缓存输入/输入/输出每百万 token 0.19/0.94/4.00 美元。该模型可在 SiliconFlow 上使用。AI模型Kimi K2.7 CodeMoonshotAI编码模型5 个信源在谈事件专题推荐理由:想少想多做?K2.7 Code 编码专用,推理开销比 K2.6 低三成,还能对标 GPT-5.5,适合写代码时不用纠结。原文稍后读已读值得跟进有用关注 Kimi K2.7 Code
01:31官方一手歸藏(guizang.ai)@op741881°OpenAI 正在准备 GPT-5.6 模型家族的发布,GPT-5.6-Pro 版本已在测试中被发现。该消息来自 TestingCatalog 的监测数据,暗示发布可能临近。目前尚未公布具体参数、性能基准或发布日期。AI模型GPT-5.6GPT-5.6-ProOpenAI10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 快来了,Pro 版本已经在测试,想尝鲜新模型的朋友可以关注起来。原文稍后读已读值得跟进有用关注 GPT-5.6
01:29官方账号xAI@xai精选Vapi 的 Humanness Index 盲测显示,xAI 的 Grok TTS 模型以 96 分(满分 100)位居榜首,仅比人类真实语音低 4 分。该测试将同一段语音用不同模型克隆后,让听众盲评打分。Grok TTS 在多家主要语音模型中表现最接近真人。AI模型Grok TTSxAI语音合成推荐理由:xAI 的 Grok TTS 在语音盲测中拿了 96 分,离真人只差 4 分,想听最像人说话的 AI 可以试试。原文稍后读已读值得跟进有用关注 Grok TTS
01:28官方账号xAI@xai精选xAI 宣布 Grok 模型集成到 Databricks Agent Bricks 平台。企业用户可在 Databricks 环境中直接使用 Grok 模型处理数据,构建 AI 智能体。该集成支持企业将自有数据与 Grok 模型结合,提升智能体能力。AI模型GrokDatabricksxAI推荐理由:xAI 把 Grok 搬上 Databricks,企业可以直接在自己的数据上跑 Grok 做智能体,不用再折腾部署了。原文稍后读已读值得跟进有用关注 Grok
00:32Replicate@replicateP-Image-Try-On 是 PrunaAI 发布的虚拟试穿模型,现已上线 Replicate 平台。每次试穿第一件衣服仅 $0.015,每增加一件 $0.008,最多可同时试穿 11 件衣物。支持质量模式(每件 <2 秒)和 Turbo 模式(总计 <4 秒)。提供提示引导和姿态引导实现精确控制。适合电商和时装团队无需重拍即可生成试穿效果。AI模型P-Image-Try-OnPrunaAIReplicate推荐理由:PrunaAI 出了个超便宜的虚拟试穿模型,第一件才一分五,快至2秒一件,还能一次穿11件,电商团队看过来。原文稍后读已读值得跟进有用关注 P-Image-Try-On
00:22AK@_akhaliqGLM-5.2 模型在 Hugging Face 的推理提供商上提供免费使用,限时6小时。支持的提供商包括 Zai、Together AI、Novita、Fireworks 和 DeepInfra。用户可通过 Pi、opencode、Codex 或 Claude Code 等编码代理进行配置。该免费服务由 xgo.ing 支持。AI模型GLM-5.2Hugging Face免费模型推荐理由:GLM-5.2 现在能免费调用了,6小时内搭配 Pi、Codex 等编码工具就能用,赶紧去试试。原文稍后读已读值得跟进有用关注 GLM-5.2
00:10elvis@omarsar0精选OpenAI 推出 LifeSciBench,一个针对生命科学研究的基准测试,包含 750 个专家编写的任务,覆盖 7 个生物学研究工作流。该基准由 173 位来自生物技术和制药领域的科学家共同开发,旨在衡量 AI 在真实世界科研场景中的表现。结果显示通用模型在复杂结构处理上仍有不足,而专用模型在科学研究中优势明显。AI模型OpenAILifeSciBench基准10 个信源在谈事件专题推荐理由:OpenAI 联合 173 位科学家搞了个新基准 LifeSciBench,750 个专家任务专测 AI 搞科研的能力,比通用模型靠谱多了。原文稍后读已读值得跟进有用关注 OpenAI
00:02Geek@geekbb精选Unsloth AI 将最强开源模型 GLM-5.2 从 1.51TB 压缩至 238GB(缩小 84%),2-bit 量化版本保留约 82% 准确率。该模型可在 256GB Mac 或同等 RAM/VRAM 配置上本地运行。官方指南和 GGUF 文件已在 Hugging Face 发布。AI模型GLM-5.2Unsloth本地运行推荐理由:Unsloth 把 1.5TB 的 GLM-5.2 压到 238GB,本地就能跑,准确率还能保住 82%。有 256GB 内存的 Mac 就能玩,开源模型天花板。原文稍后读已读值得跟进有用关注 GLM-5.2
00:02Gary Marcus@GaryMarcus精选Gary Marcus引用Matei Zaharia的研究,神经符号系统在机器人领域击败当前最优方法。该方法采用AI驱动的搜索(类似GEPA的方法),让AI生成AI与代码的混合体。Zaharia认为这类系统效率很高,并在其他应用中也观察到类似效果。该成果展示了神经符号系统在控制与规划方面的优势。AI模型Neurosymbolic SystemsGEPARobotics推荐理由:Gary Marcus分享了Matei Zaharia的神经符号系统研究,用AI搜索在机器人上打败了现有最优方案,值得搞机器人或符号推理的人关注。原文稍后读已读值得跟进有用关注 Neurosymbolic Systems
23:34官方账号OpenAI@OpenAI精选OpenAI 的 o3 Deep Research 模型在罕见病诊断中发挥辅助作用,它能够处理测序产生的数百万变异。该模型连接临床特征、遗传模式、变异证据和科学文献,生成假设供专家审核。所有结果都经过人工裁决和临床确认,AI的作用是帮助专家更快、更全面地推理复杂、碎片化的证据。AI模型o3 Deep ResearchOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 的 o3 Deep Research 能帮医生快速分析海量变异数据,连接文献和临床特征,生成诊断假设。原文稍后读已读值得跟进有用关注 o3 Deep Research
20:01Patrick Loeber@patloeber在heyAI第二年活动中,Google DeepMind的Pat Loeber展示了AI智能体的现场演示,演示了AI代理可以完成的多种任务。现场演示成功运行。AI模型Google DeepMindAI智能体heyAI推荐理由:Google DeepMind演示了AI智能体,可以实际运行任务,看他们怎么用现场演示展示能力原文稍后读已读值得跟进有用关注 Google DeepMind
15:10官方账号LMSYS Org (SGLang)@lmsysorg精选71°SGLang-Omni 现已支持 MOSS-TTS-Local Transformer v1.5 模型。该模型基于 Qwen3-4B 骨干,可生成 48kHz 立体声语音。支持零样本语音克隆和原生流式,覆盖 31 种语言,训练数据约 400 万小时。非流式场景下达到 5.976 req/s,RTF 0.644,WER 1.75%(SeedTTS English,2×GPU)。采用三阶段管线:参考编码、AR 引擎、流式声码器。AI模型MOSS-TTSSGLang-OmniQwen3-4B推荐理由:SGLang-Omni 刚上线 MOSS-TTS v1.5,开源、零样本克隆声音,支持31种语言,速度也不错,玩玩看。原文稍后读已读值得跟进有用关注 MOSS-TTS
15:03小互@imxiaohuApodex 1.0 模型已正式发布,官方介绍页面提供了技术细节。在线体验平台 apodex.ai 可供用户直接试用。模型权重已在 Hugging Face 上开源下载。AI模型Apodex开源模型Hugging Face推荐理由:Apodex 发布了 1.0 版本,有在线体验和开源下载,感兴趣可以试试。原文稍后读已读值得跟进有用关注 Apodex
14:43小互@imxiaohu6月,Apodex 向 FutureX 提交了四个基于 Apodex-1.0-mini 35B 的实验预测框架。该模型在6月第一周排名包揽第1至第4名,并在第二周持续霸榜第1名。这一成绩展示了 Apodex-1.0-mini 35B 在预测任务上的竞争力。AI模型ApodexApodex-1.0-miniFutureX推荐理由:Apodex 用 35B 参数模型做的预测框架,在 FutureX 排行榜上直接包揽前四名,太猛了。原文稍后读已读值得跟进有用关注 Apodex
13:07@atomic_chat_hq@atomic_chat_hq精选智谱GLM-5.2与月之暗面Kimi K2.7 Code在三个物理模拟HTML5编程任务中对比。GLM-5.2使用12,640 tokens完成全部任务,包括台球碰撞、弹簧上方方块弹跳和高尔顿板,粒子和动量表现正确。Kimi K2.7 Code仅用7,420 tokens,但三个场景均出现严重错误:方块穿透弹簧、台球碰撞不真实、高尔顿板珠子重叠。评测显示GLM-5.2在物理模拟细节和精度上显著优于Kimi K2.7 Code。AI模型GLM-5.2Kimi K2.7智谱推荐理由:智谱的GLM-5.2写物理模拟代码完胜Kimi K2.7,三个场景全部精准,Kimi翻车在弹簧穿透和球乱撞上。原文稍后读已读值得跟进有用关注 GLM-5.2
13:05@atomic_chat_hq@atomic_chat_hq精选Kimi K2.7 Code在三个物理模拟任务上与GPT-5.5进行对比,使用相同的提示词。弹簧摆和1kg块碰撞100000kg块的任务两者表现持平。但在22球自旋六边形任务中,Kimi生成的球随滚筒旋转,而GPT-5.5的球呈现混沌运动,Kimi表现更优。Kimi推理成本为0.28美元(52.4k tokens),GPT-5.5为0.93美元(23.4k tokens),成本降低约70%。AI模型KimiK2.7 CodeGPT-5.5推荐理由:Kimi新出的K2.7 Code模型,花不到三毛钱就能和GPT-5.5打平手,物理模拟甚至更聪明,性价比直接秒杀。原文稍后读已读值得跟进有用关注 Kimi