10:21AI Will@FinanceYF5用户仅输入一个简单/prompt,Claude Fable 5 就自动生成了包含流畅动画、精准剪辑和自配音效的完整视频。整个过程无需任何人工干预,用户离开后返回即看到成品。这一演示展示了模型在端到端视频创作上的自动化能力。AI模型Claude Fable 5Anthropic视频生成10 个信源在谈事件专题推荐理由:给个提示词就自动做出带动画和音效的整段视频,省掉剪辑烦恼,Claude Fable 5 这波操作太顶了原文稍后读已读值得跟进有用关注 Claude Fable 5
10:12AI Will@FinanceYF5用户让Claude Fable 5一次性生成一个最好的游戏。5小时后,它制作出完整的水墨风Roguelike《墨守》。游戏的美术、音乐、Boss战均为AI自动生成,并自带自我测试功能。该案例展示了Claude Fable 5在独立游戏开发中的强大能力。AI模型Claude Fable 5游戏开发Roguelike10 个信源在谈事件专题推荐理由:有个狠人用Claude Fable 5花了5小时就搞出一个完整的水墨风Roguelike游戏《墨守》。美术音乐Boss全自动,还能自我测试,太顶了。原文稍后读已读值得跟进有用关注 Claude Fable 5
08:57向阳乔木@vista8精选Google 发布了两个新的 Gemini 媒体模型:Nano Banana 2 Lite 和 Gemini Omni Flash。这两个模型均可在 Gemini 应用和 API 中使用。在 API 中,Nano Banana 2 Lite 能在 4 秒内生成图片,价格约为 1 美元 30 张 1K 分辨率图片。Gemini Omni Flash 的定价为 0.10 美元/秒。AI模型GeminiNano Banana 2 LiteGemini Omni Flash1 个信源在谈事件专题推荐理由:Google 发了两个新 Gemini 媒体模型,Nano Banana 2 Lite 生成图片只要 4 秒,1 美元能买 30 张;Omni Flash 按秒收费 0.1 美元,适合实时处理。原文稍后读已读值得跟进有用关注 Gemini
08:36berryxia@berryxiaAnthropic发布的Claude Fable 5(底层为Mythos模型)因安全防护过度,在BridgeBench测试中性能显著下降。调试能力从86.2降至25.9(降幅70%),重构能力从73.6降至38.4(降幅48%)。幻觉控制从75.9降至61.7(降幅19%)。许多正常编程任务被误判为高风险,回退到Opus 4.8。用户支付Fable 5的价格却得到Opus 4.8的能力。AI模型Claude Fable 5AnthropicMythos10 个信源在谈事件专题推荐理由:Anthropic给Fable 5加了安全防护,结果调试能力暴跌70%,编程任务动不动就回退到Opus 4.8,相当于花高价用低配。原文稍后读已读值得跟进有用关注 Claude Fable 5
08:10lmarena.ai@lmarena_aiArena平台启动Claude Fable 5的Battle Mode和Agent Mode测试,覆盖文本、图像等多模态输入。用户可参与投票,直接影响最终排行榜分数。排行榜结果即将在arena.ai公布。该测试用于评估模型的多模态能力和智能体行为。AI模型Claude Fable 5ArenaBattle Mode10 个信源在谈事件专题推荐理由:Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。原文稍后读已读值得跟进有用关注 Claude Fable 5
08:08lmarena.ai@lmarena_aiAnthropic 发布的 Claude Fable 5 模型出现在聊天机器人竞技场 leaderboard 页面上。该排行榜用于对比不同模型在对话任务中的表现。目前尚未公布该模型的详细得分或排名。AI模型Claude Fable 5聊天机器人竞技场排行榜10 个信源在谈事件专题推荐理由:想看看 Claude 新模型和其他比谁强?去排行榜看一眼就知道大概位置了。原文稍后读已读值得跟进有用关注 Claude Fable 5
08:00lmarena.ai@lmarena_ai精选Arena.ai 收集了 Claude Fable 5 重新部署前后在 Text、Vision、Document、Code 和 Agent 五个 Arena 的数千投票,结果显示得分基本一致。Fable 5 在 Text、Document、Vision 和 Code Arena: Frontend 仍处前沿,Frontend 约 20 分下降在置信区间内。Agent Arena 中 Fable 5 曾排名第一,该评测基于数百万真实任务,使用因果追踪衡量模型表现。AI模型Fable 5AnthropicAgent Arena10 个信源在谈事件专题推荐理由:Fable 5 重部署后各维度表现稳定,Agent 依旧最强,前端小幅波动属正常。想看前沿模型对比可以关注。原文稍后读已读值得跟进有用关注 Fable 5
04:51官方账号LMSYS Org (SGLang)@lmsysorg精选SGLang团队发布博客,介绍如何将基准测试、性能分析和内核优化知识转化为可执行的Agent技能。通过allreduce融合,Qwen3-Next吞吐量提升71.4%,TTFT从456ms降至168ms。路由token化去重使长上下文提示的TTFT降低29-49%。Spectral Progressive Diffusion实现2.32倍扩散去噪加速;KDA-Pilot在10个B200内核任务上获得1.13-2.75倍加速,3个PR已合并。LTX-2 VAE解码加速1.41倍,峰值内存节省9.7 GiB,所有改进均通过严格验证。AI模型SGLangQwen3-Next智能体推荐理由:SGLang团队用Agent自动化优化推理管道,实测吞吐涨71%,TTFT砍半,还省了10GB显存,硬核经验值得看。原文稍后读已读值得跟进有用关注 SGLang
04:03Stanford AI Lab@StanfordAILab精选斯坦福AI实验室提出Freeform Preference Learning方法,让标注者用自然语言描述轨迹的偏好轴(如速度、精度、子任务完成度),而非仅做单一整体偏好选择。该方法学习基于这些轴的奖励函数,能提取更优策略。论文arXiv:2606.32027和博客已公开。AI模型Freeform Preference LearningStanford机器人推荐理由:斯坦福团队发了个新方法,让标注者用自然语言描述偏好,比单一打分更精确,机器人策略能学到更多结构信息。原文稍后读已读值得跟进有用关注 Freeform Preference Learning
04:01The Rundown AI@therundownai精选Mira Murati的Thinking Machines Lab与全球最大对冲基金Bridgewater合作,测试AI用于投资新闻筛选。GPT、Claude、Gemini在六项过滤测试中平均准确率约50%。专家投资者编写提示词后准确率升至74-76%,但仍低于80%的信任阈值。通过TML的Tinker API微调开放权重模型,准确率达到84.7%,错误率比最佳前沿模型降低29.8%,且每任务成本仅为前者的1/13.8。AI模型Mira MuratiThinking Machines LabBridgewater2 个信源在谈事件专题推荐理由:Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。原文稍后读已读值得跟进有用关注 Mira Murati
04:00Stanford AI Lab@StanfordAILab精选QuasiMoTTo是一种新的推理计算扩展方法,通过相关采样替代独立采样,避免重复发现相同解。该方法样本覆盖率更高,且保持边缘精确的LLM分布。实验显示,在测试时扩展中,仅需25-47%的样本即可达到相同性能;在强化学习训练中,减少50%的步骤。该研究由斯坦福大学团队完成,探索了相关采样器的设计空间。AI模型QuasiMoTTo斯坦福推理计算推荐理由:发新论文了,斯坦福团队搞的QuasiMoTTo,不用独立采样浪费算力,相关采样省25-47%样本,训练步骤也砍半。做推理扩展的可以看看。原文稍后读已读值得跟进有用关注 QuasiMoTTo
02:52elvis@omarsar0精选斯坦福大学提出AutoMem框架,将智能体记忆管理从固定模块转变为可训练技能。模型自主决定编码、检索与笔记组织,文件系统操作作为一等动作。AutoMem通过两循环自动化:强LLM重写记忆结构,智能体历史记忆决策作为训练信号。仅优化记忆使基础智能体在Crafter、MiniHack、NetHack上提升2-4倍。32B开源模型因此与Claude Opus 4.5、Gemini 3.1 Pro Thinking性能相当。AI模型AutoMemStanfordCrafter1 个信源在谈事件专题推荐理由:斯坦福发了个AutoMem,给智能体装上可训练的记忆模块,让32B模型打平Claude Opus 4.5。省去调任务动作,光改记忆就提升2-4倍,搞长程任务的别错过。原文稍后读已读值得跟进有用关注 AutoMem
01:31Poe@poe_platformPoe 平台已上线 Claude Fable 5 和 Gemini Omni Flash 两个模型。Fable 5 是 Anthropic 目前最强的模型,在短暂下架后重新开放使用。Gemini Omni Flash 支持对话式视频创建和编辑,通过世界理解实现真实运动和一致编辑。用户可通过 poe.com 链接直接体验这两个新模型。AI模型Claude Fable 5Gemini Omni FlashPoe10 个信源在谈事件专题推荐理由:Poe 刚上了两个新模型:Claude Fable 5 回归,Gemini Omni Flash 能对话式编辑视频,很值得试试。原文稍后读已读值得跟进有用关注 Claude Fable 5
01:23官方账号SiliconFlowAI@siliconflowaiGLM-5.2通过SiliconFlow API和OpenCode集成,开发者反馈其性能达到Opus级别但成本显著降低。处理混乱数据表格、分析图表并生成报告的能力被重点展示。SiliconFlow举办排行榜活动,前72小时参与者可进入早鸟奖励池。AI模型GLM-5.2SiliconFlowOpenCode推荐理由:GLM-5.2在SiliconFlow上用OpenCode跑,效果媲美Opus但便宜很多,开发者实测能处理数据表格直接出报告,还能参加排行榜拿奖励。原文稍后读已读值得跟进有用关注 GLM-5.2
01:06官方账号SiliconFlowAI@siliconflowai73°美团LongCat-2.0是1.6T参数的MoE模型,每个token激活约48B参数,原生支持1M上下文。该模型采用LSA稀疏注意力和零计算专家架构,动态激活33B-56B参数。它设计了MOPD机制,包含Agent、Reasoning、Interaction三类专家组,按任务路由。在SWE-bench Pro上获得59.5分,与主流闭源模型相当。定价为输入缓存/输入/输出每百万tokens分别0.015/0.75/2.95美元。AI模型LongCat-2.0美团SWE-bench Pro2 个信源在谈事件专题推荐理由:美团新模型LongCat-2.0真能打,1M上下文还懂agentic coding,SWE-bench 59.5,价格也不贵。原文稍后读已读值得跟进有用关注 LongCat-2.0
00:41GitHub@github71°月之暗面推出的Kimi K2.7 Code开放权重模型已正式在GitHub Copilot中可用。它是Copilot模型选择器中首个可选的开源权重模型。早期测试显示,Kimi K2.7的性能与当前主流前沿模型相当,但成本更低。开发者现在可以在VS Code中直接尝试使用。AI模型Kimi K2.7GitHub Copilot月之暗面推荐理由:月之暗面把Kimi K2.7开放权重模型塞进GitHub Copilot了,性能不输前沿模型还更便宜,写代码可以试试这个新选项。原文稍后读已读值得跟进有用关注 Kimi K2.7
00:25lmarena.ai@lmarena_aiClaude Sonnet 5 (Thinking) 在 Text Arena 中整体文本排名第32位。在专家级提示(Expert-level prompts)上,Sonnet 5 超越了上一代版本4.6。在数学、写作、文学与语言、生命/物理/社会科学类别中表现稳定,但大多数其他类别的排名出现下降。AI模型Claude Sonnet 5Anthropic文本排名10 个信源在谈事件专题推荐理由:想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
00:20lmarena.ai@lmarena_ai74°Claude Sonnet 5 (Thinking) 在 Code Arena: Frontend 中排名第6,较前代 Sonnet 4.6 得分提高 29 分,并领先 Opus 4.6 (Thinking) 9 分。该模型在 Document Arena 排名第11,Search Arena 第17,Vision Arena 第21,Text Arena 第32。Anthropic 称其为最具代理能力的 Sonnet,可自主使用浏览器和终端等工具。AI模型Claude Sonnet 5AnthropicCode Arena10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Sonnet 5 写前端代码得分比上代高 29,还超过 Opus 4.6。搞前端的可以试试它的自主编程能力。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
23:30官方账号LMSYS Org (SGLang)@lmsysorgLaguna XS 2.1是poolside推出的33B总参数MoE模型,专为agentic coding和长时任务设计,已获SGLang Day-0支持。模型采用混合SWA+全局注意力(40层中3:1比例)与sigmoid门控,支持FP8 KV缓存和262K上下文,可在36GB RAM的Mac上运行。在SWE-bench Verified上达到70.9%,SWE-bench Multilingual相比XS 2提升5.4%。AI模型Laguna XS 2.1poolsideSGLang推荐理由:poolside新出的Laguna XS 2.1,33B MoE专为编程智能体设计,SWE-bench 70.9%还支持Mac本地跑,值得编程党试试原文稍后读已读值得跟进有用关注 Laguna XS 2.1
23:29官方账号LMSYS Org (SGLang)@lmsysorg76°NVIDIA推出Qwen3.6-27B-NVFP4模型,采用4位浮点量化,模型大小仅为BF16版本的约1/2.5。该模型在MMLU Pro基准上达到86.3分,与FP8版本性能几乎无损。上下文长度完整保留262K。SGLang已提供Day-0支持,并附带cookbook。AI模型Qwen3.6-27B-NVFP4NVIDIASGLang9 个信源在谈事件专题推荐理由:NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。原文稍后读已读值得跟进有用关注 Qwen3.6-27B-NVFP4
22:47berryxia@berryxiaGenRecon提出将生成式3D先验与多视角重建相结合的新方法。它把场景切成重叠chunk,使用生成模型Trellis.2进行条件重建。通过投影式conditioning机制,将多视角图像特征提升到3D空间。最终输出高质量可编辑的PBR mesh,在室内场景重建上比当前SOTA高16%保真度和完整度。AI模型GenRecon3D重建多视角重建推荐理由:GenRecon用手机拍几张照片就能生成高精度3D模型,细节比传统方法多16%,还能直接编辑。原文稍后读已读值得跟进有用关注 GenRecon
20:30官方账号vLLM@vllm_project精选DeepSeek 的 DSpark 投机解码技术现已原生集成到 vLLM 推理框架中。DSpark 是一种半自回归草稿模型,通过非因果滑动窗口注意力并行生成多个 token,单次验证即可保持输出一致,减少解码步数。在 NVIDIA 8×B300 GPU 上,DeepSeek-V4-Pro-DSpark 在 batch size 1 时达到约 250 tokens/s,平均接受长度约 5,且在不同草稿深度下比 MTP 方法接受率高 12-42%。vLLM 通过复用 SparseMLA 后端、捕获完整草稿主干和采样循环到单一 CUDA graph,并支持前缀缓存和 FP8 KV cache。AI模型DeepSeekvLLMDSpark8 个信源在谈事件专题推荐理由:DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
20:29官方账号vLLM@vllm_project72°Qwen3.6-27B-NVFP4模型在vLLM上可用,针对NVIDIA Blackwell GPU优化。该检查点将GPU内存需求降低约2.5倍。模型拥有27B参数,采用混合注意力机制。在MMLU Pro上得分86.3,GPQA Diamond上得分85.5。仅支持vLLM作为运行时引擎。AI模型QwenvLLMNVIDIA Blackwell10 个信源在谈事件专题推荐理由:Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。原文稍后读已读值得跟进有用关注 Qwen
20:15Genspark@genspark_aiGenspark 宣布 Anthropic 的 Claude Fable 5 模型已重新在 Genspark Code Agent 和 Genspark Claw 中可用。该模型被描述为 Anthropic 最强大的 Mythos-class 模型,在编程、研究、知识工作和视觉任务上达到先进水平。Genspark 称任务越长越复杂,优势越明显。用户可通过 genspark.ai 免费体验。AI模型Claude Fable 5GensparkAnthropic10 个信源在谈事件专题推荐理由:Genspark 把 Claude Fable 5 请回来了,编程、研究、视觉都好使,任务越难越强,快去试试。原文稍后读已读值得跟进有用关注 Claude Fable 5
16:21AI Will@FinanceYF5用户Machina在X上反馈,使用Fable 5时任务被路由到Opus 4.8,后者又生成了Sonnet 5子代理,消耗了30%的周限额后只输出了劣质结果(slop)。而此前同一系统能一次性构建完整开放世界或重构整个代码库。用户愤怒质问Anthropic的更新方向。AI模型Fable 5Opus 4.8Sonnet 510 个信源在谈事件专题推荐理由:Anthropic用户吐槽新模型链路性能狂降,从全能变废物,还烧额度,老用户都在骂。原文稍后读已读值得跟进有用关注 Fable 5
16:00AI Will@FinanceYF5Fable 5回归不到一天,用户发现同样任务被自动路由给Opus 4.8,再派生Sonnet 5子代理执行,单次消耗30%周限额。最终结果被形容为"糊弄活",质量远不如以前。该模型此前能一次性写完整个开源库或重构整个代码库。路由链条变长后,体验反而明显下降。AI模型Fable 5Opus 4.8Sonnet 510 个信源在谈事件专题推荐理由:有用户发现Fable 5回归后,同样任务被拆给Opus 4.8和Sonnet 5,消耗大量限额但效果反而不如以前,体验缩水了。原文稍后读已读值得跟进有用关注 Fable 5
15:20AI Will@FinanceYF5精选开发者使用Fable 5为强化学习训练出的生物添加了毛发和动态声音。声音并非录制,而是直接从神经网络的激活值实时生成。训练过程基于JAX和MuJoCo模拟器,渲染使用three.js和WebGPU。最终效果看起来像活物在地板上爬行,引发对AI艺术与研究边界的讨论。AI模型Fable 5RLJAX10 个信源在谈事件专题推荐理由:这个项目把RL训练的活物做得超逼真,毛发和声音都来自神经网络激活值,技术堆叠很酷,值得看一眼。原文稍后读已读值得跟进有用关注 Fable 5
15:19AI Will@FinanceYF5一项测试比较了4个模型在3个HTML5物理场景(断桥脱轨、峡谷碰撞、怪兽卡车)中的表现。Fable 5 以 $3.12 成本获得 A+ 评级且无穿模,GPT 5.5 花费 $1.14 表现最接近,Opus 4.8 成本 $0.56 效果一般,GLM 5.2 仅 $0.08 但未赢任何一局。结果显示质量与价格尚未兼得。AI模型Fable 5GPT 5.5Opus 4.810 个信源在谈事件专题推荐理由:Fable 5 和 GPT 5.5 在物理模拟上差距明显,但价格差近三倍,看你在意效果还是成本。原文稍后读已读值得跟进有用关注 Fable 5
15:18AI Will@FinanceYF5精选Fable 5在三个HTML5物理演示场景中全部获得A+评级,消耗62158 tokens,成本3.12美元。GPT 5.5最接近Fable,消耗37753 tokens,成本1.14美元。Opus 4.8消耗22280 tokens,成本0.56美元。GLM 5.2最便宜,消耗36246 tokens,成本0.08美元,但未赢得任何场景。Fable是质量最佳选择,但成本是Opus 4.8的6倍。AI模型Fable 5GPT 5.5Opus 4.810 个信源在谈事件专题推荐理由:Fable 5写物理动画确实牛,但钱包要厚;GLM 5.2便宜到离谱,预算有限就选它。原文稍后读已读值得跟进有用关注 Fable 5
14:00AI Will@FinanceYF573°Google Research 发布了 TabFM,一个专门针对表格数据的基础模型。该模型支持零样本预测,无需训练、调参或特征工程。TabFM 直接输出预测结果,大幅降低使用门槛。目前该推文获得 388 次查看。AI模型TabFMGoogle Research基础模型1 个信源在谈事件专题推荐理由:如果你厌倦了 XGBoost 调参,TabFM 不用训练直接预测,省时省力,适合表格数据任务。原文稍后读已读值得跟进有用关注 TabFM
13:58AI Will@FinanceYF5精选该架构通过交替行列注意力机制同时学习表格中行与列的关系,解决了行列无序问题。采用先压缩每行为向量再进行上下文学习的方式提升计算效率。专门为表格数据重新设计,而非直接套用通用大语言模型。AI模型表格数据架构设计交替注意力推荐理由:专门为表格数据设计的架构,用交替行列注意力处理无序,还压缩行向量做上下文学习,比硬套LLM聪明多了。原文稍后读已读值得跟进有用关注 表格数据
13:57AI Will@FinanceYF5该方法使用结构因果模型生成数亿条合成数据,替代稀缺、敏感的真实工业数据进行预训练。这是目前唯一能规模化预训练工业模型的路径,解决真实数据不足问题。AI模型合成数据结构因果模型预训练推荐理由:这个做法用合成数据解决工业场景真实数据稀缺的问题,数亿级数据集全靠模型生成,思路挺新颖。原文稍后读已读值得跟进有用关注 合成数据
09:41AI Will@FinanceYF5Anthropic 与美国政府沟通后更新了 Fable 5 的网络安全防护,短期内正常编程请求被误拦概率增加。一旦误拦触发,回复会替换为 Opus 4.8 模型。生物化学分类器保持原状,仍偏严,基础问题也可能被拦。促销持续到 7 月 7 日,可用 50% 周限额,超额可用 credits 续。AI模型Fable 5Opus 4.8Anthropic10 个信源在谈事件专题推荐理由:Anthropic 给 Fable 5 加了更严的安全过滤,编程时容易被误拦,拦了就自动切到 Opus 4.8,用之前得想好怎么绕过。原文稍后读已读值得跟进有用关注 Fable 5
09:17elvis@omarsar0GLM-5.2、Fugu Ultra、Fable 5 三个模型在同一个 one-shot prompt 下进行了生成效果对比。作者认为最后一个模型 Fable 5 表现最佳。该测试未提供具体基准分数或评测指标。AI模型GLM-5.2Fugu UltraFable 510 个信源在谈事件专题推荐理由:博主 omarsar0 用同一个 prompt 对比了 GLM-5.2、Fugu Ultra、Fable 5,他最喜欢 Fable 5 的生成结果,你可以看看三个模型的差异。原文稍后读已读值得跟进有用关注 GLM-5.2
09:12Notion@NotionHQNotion在X上宣布,Claude Fable 5模型已正式集成到Notion中。该模型专为最复杂的自定义智能体和自动化工作而设计,在Notion内部基准测试中创下了多步骤任务的新高。目前面向Biz和Ent计划用户开放。AI模型Claude Fable 5Notion智能体10 个信源在谈事件专题推荐理由:Notion 把 Claude Fable 5 放进来了,专治复杂多步骤任务,比之前更强的推理和智能体能力。原文稍后读已读值得跟进有用关注 Claude Fable 5
08:19eric zakariasson@ericzakariassonClaude Fable 5 模型现已重新在 Cursor 中可用。该模型在 CursorBench 基准测试中排名第一,超过所有其他模型。不过其每次任务成本也是最高的。开发者可再次在 Cursor 中选择并使用 Fable 5。AI模型Claude Fable 5CursorCursorBench10 个信源在谈事件专题推荐理由:Cursor 里又能用 Claude Fable 5 了,它在 CursorBench 上排第一,就是有点贵,适合追求极致效果的场景。原文稍后读已读值得跟进有用关注 Claude Fable 5
07:49Fireworks AI@FireworksAI_HQFireworks AI 发布推文宣传 GLM 5.2 开源模型,声称其编码和智能体性能达到闭源模型级别。该模型无需支付闭源模型的高昂费用,仅需推理成本。Fireworks 提供部署服务,用户可在其平台上运行。适合追求高性能但预算有限的开发者。AI模型GLM 5.2Fireworks开源模型推荐理由:GLM 5.2 编码和智能体表现接近闭源,用 Fireworks 跑划算,适合不想花大钱又要高水平的开发者。原文稍后读已读值得跟进有用关注 GLM 5.2
06:20lmarena.ai@lmarena_aiFable 5 模型现已切换至 Agent Mode,在 arena.ai 的评测中可能影响其领先地位。该模式针对智能体任务进行优化,目前尚未有新的测试轨迹数据更新。社区正在关注其是否能保持排名。AI模型Fable 5Agent Mode智能体10 个信源在谈事件专题推荐理由:Fable 5 的 Agent Mode 刚上线,看看它能不能在智能体任务上继续领先原文稍后读已读值得跟进有用关注 Fable 5
05:59lmarena.ai@lmarena_ai72°Fable 5模型重新加入Agent Arena基准测试,该模型首次亮相时曾排名第一。Agent Arena通过全球用户提交的数百万真实任务评估模型,支持网页搜索、文件系统和终端工具。基准使用因果追踪方法计算模型相对于平均模型的表现改善,而非原始胜率。Anthropic的最新模型也已在Text、Vision、Document和Code Arena: Frontend上线。AI模型Fable 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Anthropic的Fable 5又回Agent Arena了,上次拿过第一,这次看看它还能不能霸榜。还有新模型上了多个测试战场,快去试试。原文稍后读已读值得跟进有用关注 Fable 5
05:47Fireworks AI@FireworksAI_HQGLM 5.2 模型已在 Microsoft Foundry 平台上线。通过 Fireworks AI 的 FireConnect 功能,开发者能使用 Foundry PTUs 将 GLM 路由到 Codex、OpenCode 或 Pi 等工具。该集成旨在帮助团队从零重建工作流并加速开发。开发者现可立即开始使用。AI模型GLM 5.2Fireworks AIMicrosoft Foundry1 个信源在谈事件专题推荐理由:Fireworks AI 在微软 Foundry 上推出了 GLM 5.2,还支持用 FireConnect 路由到 Codex、OpenCode,搞工作流开发能快不少,试试呗。原文稍后读已读值得跟进有用关注 GLM 5.2