16:55Geek@geekbb精选NVIDIA 基于智谱 GLM-5.2 模型量化出 NVFP4 精度版本,命名为 nvidia/GLM-5.2-NVFP4。该模型通过 Hugging Face 免费层级 API 提供,限制为每小时 300 次或每天 1,000 次请求。作者认为其性能至少应优于 deepseek-v4-flash。AI模型nvidia/GLM-5.2-NVFP4智谱NVIDIA4 个信源在谈事件专题推荐理由:NVIDIA 把智谱的 GLM-5.2 量化成 NVFP4 精度,放 Hugging Face 上免费调,还能白嫖,日常推理够用了。原文稍后读已读值得跟进有用关注 nvidia/GLM-5.2-NVFP4
14:24Lilian Weng@lilianweng精选74°Lilian Weng 发布了一篇关于 scaling laws 的博文,详细解释了如何通过缩放定律在数据量和模型尺寸之间做计算最优分配。文章对比了 Kaplan et al.(2020)和 Chinchilla(2022)两篇经典论文的分歧:前者主张模型尺寸随计算量更快增长,后者主张等比例增长。文中还指出数据限制和拟合细节会使外推变得不可靠。AI模型Scaling LawsChinchillaKaplan et al.推荐理由:想搞懂 Scaling Laws?Lilian 这篇把 Kaplan vs Chinchilla 的争论讲透了,还有实操建议。原文稍后读已读值得跟进有用关注 Scaling Laws
11:01AI Will@FinanceYF5精选Jayden Teoh提出Next-Latent Prediction(NextLat),一种自监督学习方法。该方法教Transformer预测下一个隐状态而非直接预测token。NextLat使模型形成紧凑的世界模型,在推理和规划任务上表现更好。通过自speculative decoding,推理速度最高提升3.3倍。AI模型NextLatTransformer推理模型推荐理由:Transformer预测隐状态而不是token能加速3.3倍,还能形成世界模型。Jayden Teoh的新框架值得看看。原文稍后读已读值得跟进有用关注 NextLat
10:02shao__meng@shao__meng71°Snowflake CEO使用103个dbt任务对GLM和Opus进行3轮测试。GLM原始token消耗860M,Opus 439M,差距约2倍。差距源于GLM平均轮次99次(Opus 80次)、工具调用为原子化(Opus批量化)、缓存命中率53%(Opus 96%)。尾部失败案例主导均值:少数任务中GLM陷入400+次调用。归一化到90%缓存率后,GLM成本$1.12/session,Opus $2.14/session,GLM便宜48%。AI模型GLMOpusSnowflake推荐理由:Snowflake CEO用103个真实任务实测GLM和Opus,发现调整缓存后GLM成本不到Opus一半,适合注重预算的团队。原文稍后读已读值得跟进有用关注 GLM
09:39向阳乔木@vista8一个团队展示了能实时计数乒乓球颠球数的AI系统,并认为Physical AGI需要满足三个必要条件:统一的多模态大脑(非模型拼接)、在同一个大脑中完成任意模态的理解与生成、理解与生成以流式方式持续运行。最关键的一点是该大脑必须完整运行在端侧。团队还提供了更多介绍和演示视频。AI模型Physical AGI多模态端侧模型推荐理由:看看这个团队对Physical AGI的看法,他们提出了3+1个必要条件,还做了颠球计数的演示,强调端侧运行和统一多模态大脑。原文稍后读已读值得跟进有用关注 Physical AGI
08:51Viking@vikingmute精选Ornith-1.0 系列开源模型发布,专门用于 agentic coding,参数从9B Dense到397B MoE全覆盖。在 Terminal-Bench 2.1 上得分77.5,SWE-Bench verified 82.4,NL2Repo 48.2。397B MoE模型在多个基准上超过 Claude Opus 4.7。模型采用自改进训练策略,利用强化学习同时生成解决方案和 task-specific scaffold。基于 gemma4 和 qwen3.5 后训练,MIT 许可开源。AI模型Ornith-1.0gemma4qwen3.53 个信源在谈事件专题推荐理由:Ornith-1.0 开源了从9B到397B的编程模型,在SWE-Bench等基准上超越Claude Opus 4.7,还能自己优化任务框架。原文稍后读已读值得跟进有用关注 Ornith-1.0
08:19官方账号Pika Labs@pika_labsPika Labs 发布 Seedance 2.0 Mini 视频生成模型,可通过 Pika MCP 调用。官方称其兼具低成本与高速生成特性。目前暂无具体基准测试数据。AI模型Seedance 2.0 MiniPika LabsPika MCP推荐理由:Pika 出了个新视频模型 Seedance 2.0 Mini,便宜又快,还支持 MCP 调用,做视频的朋友可以试一下。原文稍后读已读值得跟进有用关注 Seedance 2.0 Mini
07:54elvis@omarsar0精选71°Meta 的研究提出了 AutoData 框架,将 AI agent 作为数据科学家自动构建训练和评估数据。其实现 Agentic Self-Instruct 扩展了经典 Self-Instruct,增加了 agent 规划和工具使用。在计算机科学、法律推理和数学对象推理等任务上,AutoData 超越了传统合成数据方法。通过元优化训练数据生成 agent,还能获得更大性能提升。AI模型MetaAutoDataAgentic Self-Instruct1 个信源在谈事件专题推荐理由:Meta 搞了个 AutoData,让 AI agent 当数据科学家自动造训练数据,比自己写死的流水线强不少,在多个推理任务上效果更好。原文稍后读已读值得跟进有用关注 Meta
04:52官方账号LangChain@LangChainAILangChain与Fireworks AI合作,基于阿里巴巴Qwen模型微调了一个法官模型。该模型用于检测用户交互中的“感知错误”(Perceived Error)。具体微调方法和评估结果已在LangChain博客文章中发布。AI模型LangChainFireworks AIQwen推荐理由:LangChain和Fireworks用Qwen搞了个裁判模型,专门抓对话里的感知错误,挺实用的,去博客看具体数据吧。原文稍后读已读值得跟进有用关注 LangChain
04:51官方账号LangChain@LangChainAILangChain 与 FireworksAI 合作研究显示,微调后的阿里巴巴 Qwen 模型在所有规模上性能优于原版模型。与使用顶级前沿模型相比,微调模型在规模运行时可降低 10-100 倍成本,具体取决于追踪数量和模型选择。随着追踪量增长,微调模型的成本节约效果将更加显著。该结果基于对多个模型规模和基准的对比测试。AI模型QwenFireworksAI微调推荐理由:微调 Qwen 能跑赢大模型,还省 10-100 倍成本,适合大批量任务。原文稍后读已读值得跟进有用关注 Qwen
03:54Mustafa Suleyman@mustafasuleyman精选72°Microsoft 发布 MAI-Image-2.5,在 Artificial Analysis Image Arena 文本到图像基准中排名第2,仅次于 OpenAI 的 GPT Image 2。其图像编辑能力排名第3,仅次于 OpenAI 模型,性能与 Google 的 Nano Banana 2 相当。MAI-Image-2.5 最大输出约 1MP 分辨率,支持灵活宽高比和 32K token 上下文。定价为每千张图 $48(Flash 变体 $20),可通过 Foundry API 和 MAI Playground 使用。AI模型MAI-Image-2.5Microsoft文本到图像10 个信源在谈事件专题推荐理由:微软新出的 MAI-Image-2.5 图像生成和编辑都很强,排名只输给 OpenAI,价格也透明,值得试试看。原文稍后读已读值得跟进有用关注 MAI-Image-2.5
03:42Mustafa Suleyman@mustafasuleyman72°MAI-image-2.5 在 ArtificialAnalysis 基准中文本到图像排名第二,仅次 GPT 模型,图像编辑排名第三。MAI-Image-2.5-Flash 在质量/价格比上全球领先。该模型已通过 Foundry API 提供,正逐步在 OneDrive 和 PowerPoint 中推出。用户也可在 MAI Playground 直接体验。AI模型MAI-image-2.5MAI-Image-2.5-FlashMicrosoft1 个信源在谈事件专题推荐理由:微软新图像模型 MAI-image-2.5 文本到图像只输 GPT,性价比版全球第一,可以 OneDrive 和 PPT 里直接用。原文稍后读已读值得跟进有用关注 MAI-image-2.5
03:00官方账号Allen AI (Ai2)@allen_ai精选Allen AI 发布了 Olmo 3(纯 Transformer)与 Olmo Hybrid(Transformer-RNN 混合)的对比研究。Hybrid 模型在长序列任务中展示了更高效的 token 处理,性能提升约15%。该研究揭示了混合架构在减少计算复杂度的同时保持了与 Transformer 相当的准确率。具体基准上,Hybrid 模型在 Long Range Arena 任务中得分高于 Olmo 3 约 8%。AI模型OlmoAllen AI混合模型推荐理由:Allen AI 拿自家 Olmo 3 和 Hybrid 版做了实测对比,看混合模型到底比纯 Transformer 好在哪,结果挺有意思。原文稍后读已读值得跟进有用关注 Olmo
02:57Gary Marcus@GaryMarcus神经符号代理(以Codex为例)的任务表现显著优于纯聊天机器人。Ethan Mollick引用的数据以OpenAI为风向标,展示了技术发展方向。聊天机器人时代已经结束,基于代理的系统正向工程以外的任务扩展。技能有望成为企业标准化AI使用的工具。AI模型CodexOpenAI智能体10 个信源在谈事件专题推荐理由:Codex这类神经符号代理比纯聊天机器人强得多,Ethan Mollick用OpenAI数据说明代理系统即将全面铺开,搞AI的不妨看看。原文稍后读已读值得跟进有用关注 Codex
02:18Fireworks AI@FireworksAI_HQFireworks与Faros_AI联合对211个真实软件工程任务进行了评估。Claude Code搭配GLM-5.2的Judge得分0.568,每任务耗时321秒,成本0.92美元。对比组Claude Code + Opus 4.8得分为0.521、耗时775秒、成本1.76美元;Codex + GPT-5.5得分为0.466、耗时392秒、成本2.06美元。评测基于Faros自有代码库而非公开基准,更贴近实际开发场景。AI模型GLM-5.2Claude CodeOpus 4.8推荐理由:Fireworks和Faros拿真实工程任务实测GLM-5.2,结果比Opus 4.8和GPT-5.5都更便宜更快,得分还高。想为代码任务选模型可以看看这个。原文稍后读已读值得跟进有用关注 GLM-5.2
02:16官方账号vLLM@vllm_project精选vLLM 宣布 Day-0 支持 Liquid AI 的 LFM2.5-230M 小模型。该模型仅 230M 参数,预训练于 19T tokens 且支持 32K 上下文。专为手机、机器人、家庭自动化和网络设备上的 agent 任务设计。可运行于 CPU、NPU 和 GPU 等硬件。AI模型LFM2.5-230MvLLMLiquid AI推荐理由:vLLM 第一时间给 Liquid AI 的 LFM2.5 小模型做了适配,230M 参数跑 agent 任务,手机、机器人上都能用。原文稍后读已读值得跟进有用关注 LFM2.5-230M
01:57官方账号Google DeepMind@GoogleDeepMind74°Google DeepMind 宣布 Gemini 3.5 Flash 新增原生计算机使用能力。开发者可利用该内置工具构建能跨浏览器、移动端和桌面界面观察并执行操作的定制智能体。该功能无需额外适配即可直接操控 GUI 元素。AI模型Gemini 3.5 FlashGoogle DeepMind智能体推荐理由:DeepMind 给 Gemini 3.5 Flash 加了个内置计算机操作工具,开发者能直接让模型看屏幕、点按钮,跨浏览器和桌面都行。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
01:31AK@_akhaliqDomainShuttle是一个开放域主题驱动的文本生成视频模型,允许用户通过自然语言描述控制视频内容。该模型能够根据文本提示生成包含特定主题的视频片段,无需对每个主题进行单独训练。与现有方法相比,DomainShuttle在主题保真度和视频质量上表现更优,支持更灵活的自由形式主题控制。AI模型DomainShuttle文生视频开放域推荐理由:想快速生成特定主题的视频素材?DomainShuttle 的开放域能力让你不需要训练就能直接用文字生成视频,很方便。原文稍后读已读值得跟进有用关注 DomainShuttle
01:24lmarena.ai@lmarena_ai精选Zai_org的GLM系列在Code Arena: Frontend基准上持续增长,GLM-4.6得分1408,GLM-5.2 (Max)达到1595,超越Opus 4.8并逼近Claude Fable 5的1665分。GLM-5.2 (Max)是该实验室最强的编码模型,在HTML/React真实任务上缩小了与前沿实验室的差距。该模型为开源发布。AI模型GLMZai_orgCode Arena推荐理由:Zai_org的GLM-5.2开源模型在前端编码上超过了Opus,离领先的Claude Fable只差一点,值得试试原文稍后读已读值得跟进有用关注 GLM
23:37berryxia@berryxiaOrnith-1.0 模型家族覆盖 9B 到 397B MoE 全尺寸。在 Terminal-Bench、SWE-Bench 等 agent coding 基准上达到当前开源模型顶尖水平。其训练方式使用 RL 同时优化任务脚手架和最终解决方案。模型全系列 MIT 开源,并提供了 GGUF 版本,可在 Ollama、Unsloth 等工具中直接运行。AI模型Ornith-1.0Terminal-BenchSWE-Bench推荐理由:Ornith-1.0 用 RL 教模型搭执行框架,在 SWE-Bench 上表现顶尖,本地党还有 GGUF 版本可玩。原文稍后读已读值得跟进有用关注 Ornith-1.0
21:57shao__meng@shao__mengGLM-5.5 据传将于八月发布,智谱尚未官方确认。该模型预计与 Claude Fable 5、GPT-5.6 等下一代模型正面竞争。目前无具体参数或基准数据公布,市场关注度较高。AI模型GLM-5.5Claude Fable 5GPT-5.61 个信源在谈事件专题推荐理由:有传闻说智谱的 GLM-5.5 可能八月上线,要和 Claude 和 GPT 的新版硬刚,吃瓜群众可以蹲一下。原文稍后读已读值得跟进有用关注 GLM-5.5
21:45Thomas Wolf@Thom_Wolf实验让100多个智能体协作一周,优化vLLM中Gemma 4推理速度,最终实现5倍提升。智能体自发拒绝人类社交工程尝试,发现验证漏洞并请求社区裁决。四智能体接力构建int4-lm_head检查点,经诊断配置错误后达到118 TPS(2.68×)。GPU富/贫分工、跨智能体内核调试、配额池化等行为涌现。智能体还指出127 TPS“墙”是假象,并讨论了int4-Marlin floor的循环证明问题。AI模型Gemma 4vLLM多智能体2 个信源在谈事件专题推荐理由:这个实验展示了100多个AI智能体像人类社区一样自发协作、互相监督,甚至发现了验证漏洞。一周将Gemma 4推理速度优化5倍,很酷。原文稍后读已读值得跟进有用关注 Gemma 4
17:27Stanford AI Lab@StanfordAILab精选Stanford AI Lab发布OpenThoughts-Agent-v2和OpenThinkerAgent-32B,两者均基于Qwen-3开源数据。在计算控制比较中,该模型在全部训练规模下领先,并在7个agent基准测试上平均得分44.8%。模型在终端使用和编码任务上表现突出,且泛化能力强。AI模型OpenThoughts-Agent-v2Qwen-3Stanford AI Lab推荐理由:斯坦福开源了新agent模型,基于Qwen-3在7个基准上平均44.8%,小模型也能打,值得一试。原文稍后读已读值得跟进有用关注 OpenThoughts-Agent-v2
17:26berryxia@berryxiaUnsloth团队将GLM-5.2模型压缩至1-bit量化版本,在Mac Studio M3 Ultra(256GB RAM)上实现约21 tok/s的推理速度。该量化模型在创意输出任务(如HTML/设计生成)上,能与Claude Opus和GPT-5.5正面对比且不落下风。这显示极端量化后的大模型仍能保留较强表现,展示了开源模型通过优化缩小与闭源前沿模型在实际可用性上的差距。AI模型UnslothGLM-5.2量化推荐理由:Unsloth把GLM-5.2压到1-bit,Mac Studio上跑21 tok/s,创意性居然不输Claude Opus,本地部署党有福了。原文稍后读已读值得跟进有用关注 Unsloth
14:45Fireworks AI@FireworksAI_HQ精选Fireworks AI 与 Harvey 合作研究发现,将前沿闭源模型(如 Opus 4.8)作为顾问代理,与微调的开源工作代理结合,在三个基准测试中均取得更优结果。相比全部使用 Opus 4.8,该混合方案成本降低40-67%。该方法简单部署即可提升效果,为模型调用提供新思路。AI模型Fireworks AIHarveyOpus 4.81 个信源在谈事件专题推荐理由:Fireworks AI 的实验证明,把闭源大模型当参谋、开源模型当打手,效果更好还省40%-67%的钱,值得关注。原文稍后读已读值得跟进有用关注 Fireworks AI
11:35AI Will@FinanceYF591°OpenAI 新语音模型 Bidi 1 首次曝光,支持双向语音交互:用户说话时模型同时监听,中途打断可立刻切换任务。实时翻译能力与上下文记忆均优于现有 Advanced Voice(高级语音模式)。该模型已小范围推送,ChatGPT 设置中可选,气泡变黄色即为 Bidi 1。后续将推出 Codex 版本。AI模型Bidi 1OpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI 出了新语音模型 Bidi 1,你说它听,还能打断换话题,实时翻译也更强,快去 ChatGPT 设置里试试。原文稍后读已读值得跟进有用关注 Bidi 1
11:34AI Will@FinanceYF576°据TestingCatalog爆料,OpenAI正在测试名为Bidi 1的双向语音模型。该模型支持用户在说话时同时说话并继续监听,可在句子中间来回切换任务。Bidi 1能更好地处理打断和停顿,并保持对话上下文记忆。模型有持续时间上限,但可连续计数到23不暂停。Bidi 1尚未可用,但预计很快登陆ChatGPT和Codex。AI模型Bidi 1OpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI的新语音模型Bidi 1能边听边插话,还能中途换任务,比现在强多了。原文稍后读已读值得跟进有用关注 Bidi 1
11:33AI Will@FinanceYF581°Gemini 3.5 Flash 现在能直接看屏幕、理解内容,并跨浏览器、手机、桌面执行操作,无需额外接入其他模型。安全方面加入了 prompt injection 对抗训练,敏感操作需用户确认,检测到注入攻击时自动停止任务。企业可用它做自动化测试和跨平台知识工作。AI模型Gemini 3.5 FlashAI Agent跨平台推荐理由:谷歌给 Gemini 3.5 Flash 加了个能直接操控电脑屏幕的智能体,跨平台执行任务,还自带防注入安全机制,挺实用。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
10:48AI Will@FinanceYF5精选LatentMAS提出让多智能体在隐空间直接传递推理状态,跳过文字编解码。该方法在多个基准上准确率提升13.3%,推理速度提高4.3倍,token用量减少83.7%。LatentMAS无需额外训练,可直接插入现有LLM使用,入选ICML 2026 Spotlight论文。AI模型LatentMAS智能体ICML推荐理由:这个新方法让多智能体能悄悄交换推理状态,不用写文字,又快又省token,直接插进现有LLM就能用。原文稍后读已读值得跟进有用关注 LatentMAS
10:09berryxia@berryxiaPP-OCRv6已正式上架Hugging Face平台。本次更新新增transformers和ONNX Runtime两个推理后端,用户可以通过统一API在不同框架间无缝切换。相比PP-OCRv5,PP-OCRv6在字符识别精度上有进一步提升。该版本尤其适合希望在transformers生态中直接使用高性能OCR的开发者。AI模型PaddleOCRPP-OCRv6Hugging Face推荐理由:PaddleOCR的PP-OCRv6上HF了,支持transformers和ONNX Runtime双后端,切换框架不用改代码,超实用。原文稍后读已读值得跟进有用关注 PaddleOCR
09:30Jerry Liu@jerryjliu0精选Unlimited OCR是百度开源的OCR模型,总参数量3B,仅500M激活。它在表格解析和阅读顺序方面表现优秀,在OmniDocBench v1.5和v1.6上达到SOTA。核心创新是Reference Sliding Window Attention(R-SWA),能保持恒定KV缓存大小,单次前向传递处理40+页文档。与PaddleOCR-VL-1.6对比显示,它在语义格式和图表方面略有不足。AI模型Unlimited OCRBaiduPaddleOCR-VL-1.67 个信源在谈事件专题推荐理由:百度开源了Unlimited OCR,3B参数却只有500M激活,表格解析超强,能一次性读完40页文档,比PaddleOCR-VL-1.6强在表格和阅读顺序上。试试看?原文稍后读已读值得跟进有用关注 Unlimited OCR
08:42lmarena.ai@lmarena_ai精选72°Wan-2.7 I2V在视频生成竞技场中取得第5名,得分1,434。该排名来自与顶级模型的一对一对决,由全球用户在其创作任务中投票选出。它超越了Grok Imagine Video(720p)和所有Google Veo-3.1变体。该模型支持文本、图像、音频和视频的多模态控制,以及最多5个参考输入的角色自定义。阿里通义万相团队还提供了视频编辑、克隆、重风格化等全栈工具。AI模型Wan-2.7AlibabaVideo Arena推荐理由:阿里通义万相出了个新视频模型Wan-2.7,在Video Arena排第5,干掉了Grok和Veo,视频创作能力挺强,可以试试。原文稍后读已读值得跟进有用关注 Wan-2.7
08:26Jerry Liu@jerryjliu0精选Jerry Liu 发布了 Mistral OCR 在 ParseBench 上的更新结果。该模型的总体得分超过了 GPT-5.5,仅略低于 Gemini 3.1 Pro。在内容忠实度、语义格式和视觉定位方面表现优秀,在表格处理上表现一般,图表能力有限。这些结果展示了该价格区间内模型的竞争力。AI模型Mistral OCRGPT-5.5Gemini 3.1 Pro推荐理由:Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。原文稍后读已读值得跟进有用关注 Mistral OCR
07:59Fireworks AI@FireworksAI_HQFireworks AI 与 Cursor 合作,让用户在 Cursor 中即可切换至最新的开源前沿模型 GLM 5.2,无需更换编程工具。该模型在多项评估中获得提升,具体基准成绩见原文链接。这意味着开发者可以轻松尝试 GLM 5.2 的代码能力,而无需离开日常使用的 AI 编程助手。AI模型GLM 5.2CursorFireworks AI6 个信源在谈事件专题推荐理由:Fireworks 和 Cursor 联手,让你直接在 Cursor 里换用最新的 GLM 5.2 模型,省去切换工具的麻烦。原文稍后读已读值得跟进有用关注 GLM 5.2
07:33@koltregaskes@koltregaskes72°Gemini 3.5 Pro 发布推迟至7月,多个 Google DeepMind 关键研究人员已跳槽至 Anthropic 等竞争对手。在顶级模型排行榜上,Gemini 目前位列第三,与 Claude 和 ChatGPT/Codex 差距明显。Google 拥有远超对手的资源,但 Gemini 的表现和人才流失反映出内部问题。AI模型GeminiGoogle DeepMindAnthropic10 个信源在谈事件专题推荐理由:谷歌的Gemini 3.5 Pro要拖到7月了,DeepMind的人还在往外跑,Anthropic趁机挖人。现在Gemini在排行榜上被Claude和ChatGPT甩开,看看这个局面多尴尬。原文稍后读已读值得跟进有用关注 Gemini
07:30ChatGPT@ChatGPTapp88°OpenAI 推出 GPT-5.5 Instant 模型,声称更智能、更直观、对话更有趣。模型首先面向 Pro 和 Plus 用户开放,免费用户预计明天可用。当前推文获得 141 条评论、115 次转发和 2149 个点赞。AI模型GPT-5.5 InstantOpenAI智能对话10 个信源在谈事件专题推荐理由:OpenAI 发了新的 GPT-5.5 Instant,对话更聪明更自然,Pro 和 Plus 用户现在就能用,免费用户明天也能体验到。原文稍后读已读值得跟进有用关注 GPT-5.5 Instant
06:28Ate-a-Pi@svpino精选Tripo AI 推出 Project Eden 世界模型,与传统逐帧预测方案不同,它先构建包含几何、物体位置等真实状态的地图,再根据地图生成画面。该架构解决了传统模型遗忘问题,物体离开视线后仍存在于地图中,并支持多人/智能体共存与编辑。公司刚完成两轮近 2 亿美元融资,将在 SIGGRAPH 2026 展示。AI模型Tripo AIProject Eden世界模型推荐理由:Tripo AI 搞了个新世界模型 Project Eden,先建好地图再渲染,物体不会消失,还能多人同在一个世界。刚融资 2 亿美元,值得关注。原文稍后读已读值得跟进有用关注 Tripo AI
05:56Guillermo Rauch@rauchgVercel 通过 AI Gateway 独家推出 GLM 5.2 Fast (via Wafer) 模型。内部基准测试显示,其 token 吞吐量比其他提供商快 2 倍。该模型可通过指定 'zai/glm-5.2-fast' 调用。开发者可在 Vercel 平台上直接使用,无需额外配置。AI模型GLM 5.2 FastVercel AI GatewayWafer推荐理由:Vercel 搞了个 GLM 5.2 Fast,速度是其他家的两倍,做推理任务可以试试。原文稍后读已读值得跟进有用关注 GLM 5.2 Fast
05:39lmarena.ai@lmarena_ai71°GLM-5.2 (Max) 在 Code Arena: Frontend 排名第二,仅次于 Fable 5,但击败了 Claude Opus 4.8 (Thinking) 和 Opus 4.7 (Thinking)。对 Kimi-K2.6 胜率 61.0%,对 Sonnet 4.6 胜率 59.4%,对 Opus 4.7 (Thinking) 胜率 55.0%。最接近的挑战来自 GPT-5.5 (xHigh)(41.7% vs 40.0%)和 Opus 4.6(47.0% vs 42.4%)。与前任 GLM-5.1 打成平手(45.5% - 45.5%)。在 Brand & Marketing、Data & Analytics 等多项子类别中排名第一。AI模型GLM-5.2OpusKimi-K2.6推荐理由:GLM-5.2 在前端任务上干掉了 Claude Opus 系列,对 Kimi 和 Sonnet 胜率超 60%,开源模型里相当能打。原文稍后读已读值得跟进有用关注 GLM-5.2
04:24elvis@omarsar0谷歌推出了Gemini 3.5 Flash模型,专注于计算机使用场景的智能体循环和长任务。该模型旨在满足对更强大计算机使用模型的需求,同时保持低成本。用户表示对Gemini 3.5 Flash的效率尚不确定,但赞赏其作为替代选项的出现。AI模型Gemini 3.5 FlashGoogle智能体推荐理由:谷歌新出了一个Gemini 3.5 Flash,专门优化了计算机使用场景,做长任务和智能体循环可能更划算,值得试试。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash