18:08官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云宣布 Qwen3.8 即将发布并开源权重,模型参数规模达 2.4T。官方称其兼容领先前沿 AI 模型,综合能力仅次于 Fable 5。预览版 Qwen3.8-Max-Preview 已上线 Token Plan、Qoder 和 QoderWork 平台。用户可率先体验这一开源大模型。AI模型Qwen3.8阿里云Token Plan推荐理由:阿里云发了 Qwen3.8,2.4T 参数即将开源,预览版现在就能在 Token Plan 上试,看看是不是真仅次于 Fable 5。原文稍后读已读值得跟进有用关注 Qwen3.8
17:52Geek@geekbb阿里云发布了Qwen3.8模型,即将开源权重。其参数规模达2.4T,官方称仅次于Fable 5,是目前最强模型之一。预览版Qwen3.8-Max-Preview已在阿里云Token Plan、Qoder和QoderWork上线。用户可立即体验。AI模型Qwen3.8Fable 5阿里9 个信源在谈事件专题推荐理由:阿里刚发Qwen3.8,2.4万亿参数,说仅次于Fable 5,还开源权重。快上Token Plan试试预览版。原文稍后读已读值得跟进有用关注 Qwen3.8
17:44向阳乔木@vista8社交媒体用户vista8在X平台发帖,称DeepSeek v4正式版性能强大,除Fable 5外可能是最强模型,预计下周上线。该帖获得4条回复、5次点赞、828次查看。目前DeepSeek官方尚未确认相关信息。AI模型DeepSeek v4Fable 5开源模型9 个信源在谈事件专题推荐理由:DeepSeek v4可能要来了,网友说很强,下周就能看到了。原文稍后读已读值得跟进有用关注 DeepSeek v4
17:42官方账号阿里通义 Qwen@Alibaba_Qwen阿里巴巴通义千问宣布Qwen3.8即将发布并开源权重,模型参数量达2.4T。官方称其为当前最强模型之一,仅次于Fable 5。同时上线了Qwen3.8-Max-Preview版本,可在Alibaba的Token Plan、Qoder和QoderWork平台体验。该模型持续迭代中,开发者可立即试用。AI模型Qwen3.8阿里巴巴Token Plan推荐理由:阿里开源2.4T参数的Qwen3.8,预览版已上线,想试超大模型赶紧去Token Plan平台玩。原文稍后读已读值得跟进有用关注 Qwen3.8
17:26berryxia@berryxia83°Qwen团队发布Qwen 3.8-Max-Preview模型,参数规模达2.4万亿,官方声称其性能仅次于Fable 5。该模型即将开源权重,预览版已上线Token Plan和Qoder平台,普通用户可先试用。这是继闭源顶级模型之后,又一大型开源模型的尝试。AI模型QwenQwen 3.8-Max-Preview开源模型推荐理由:阿里把2.4万亿参数的Qwen 3.8开源了,预览版现在就能玩,性能只比Fable 5差一点。想试试顶级开源大模型千万别错过。原文稍后读已读值得跟进有用关注 Qwen
17:06Geek@geekbb精选Perplexity AI 开源了一个名为 w? 的基准测试,专门衡量 AI 智能体在广域深度研究任务中的表现。该测试涵盖大规模信息发现、信息富集、抽取、实体消歧和证据合成五个关键能力。基准通过多步骤任务模拟真实研究场景,要求模型在开放域中整合分散信息。Perplexity AI 表示该基准旨在推动更可靠的知识工作自动化。AI模型Perplexity AI基准测试信息检索推荐理由:Perplexity AI 刚发布一个专门测深度研究能力的基准,想试试你家智能体能不能像人类一样做信息拼图?原文稍后读已读值得跟进有用关注 Perplexity AI
16:07宝玉@dotey精选宝玉将 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 集成到剪映工具 BaoCut 中,可直接输出带精确时间戳和说话人标注的结构化转写结果。该模型无需专用发言人识别模型,但转录速度比 Qwen3-ASR-0.6B 慢,且不支持标点符号,自定义 Prompt 与热词也未生效。项目地址为 github.com/OpenMOSS/MOSS-Transcribe-Diarize。AI模型BaoCutOpenMOSSMOSS-Transcribe-Diarize-0.9B推荐理由:宝玉给 BaoCut 集成了 MOSS-Transcribe-Diarize-0.9B,能一次搞定长音频转写和说话人标注,省去额外模型,适合做字幕或会议记录。原文稍后读已读值得跟进有用关注 BaoCut
16:06宝玉@dotey精选OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B 模型,参数规模 0.9B,支持 128K 上下文,最长可一次处理约 90 分钟音频。该模型采用 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端完成转写、说话人分离和时间对齐,无需级联流程。在单张 4090 显卡上,RTF 为 0.017,5-10 分钟录音约 30 秒转完,并支持热词增强。模型以 Apache 2.0 协议开源,可商用。AI模型OpenMOSSMOSS-Transcribe-Diarize-0.9BWhisper推荐理由:OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。原文稍后读已读值得跟进有用关注 OpenMOSS
15:20小互@imxiaohu73°商汤于7月18日在WAIC发布SenseNova U1 Pro,这是日日新SenseNova U系列的旗舰模型。该模型支持原生8K分辨率出图,能精准控制密集图文版式与文字,小字放大后依然清晰。它围绕一个目标可运行数十轮生成循环,提升复杂版面的一次性准确率。AI模型SenseNova U1 Pro商汤日日新SenseNova U推荐理由:商汤发了SenseNova U1 Pro,出8K图、小字放大也不糊,做海报排版不用反复改。原文稍后读已读值得跟进有用关注 SenseNova U1 Pro
14:07Ethan Mollick@emollick用户向Kimi K3提问,要求推荐两首适用于当前GenAI模型状态的诗。Kimi K3的思维链(CoT)长度达到32页。推理过程中出现大量循环和死路,展现了K3复杂的推理模式。AI模型Kimi K3CoT思维链10 个信源在谈事件专题推荐理由:Kimi K3的思维链居然有32页长,还不停绕圈,看看它怎么解诗题原文稍后读已读值得跟进有用关注 Kimi K3
13:18小互@imxiaohu精选Anthropic内部对谈指出,模型外围的harness正在变薄,其编码的“模型做不到什么”的假设随模型能力提升而过期。旧harness像固定流水线,每个工位顺序执行任务。新harness更像战术教练,根据实际战况选择阵型。这种变化反映了模型能力跃迁后对控制框架的反思。AI模型AnthropicHarness模型架构4 个信源在谈事件专题推荐理由:Anthropic拆掉了模型外面那层死板的控制代码,换成能随机应变的教练。想了解模型架构演进,可以看看这篇对谈。原文稍后读已读值得跟进有用关注 Anthropic
09:54AI Will@FinanceYF576°Elon Musk 表示,将速度和成本纳入考量后,Grok 4.5 是目前第一名。在 Artificial Analysis 上,Grok 4.5 每项 Intelligence Index 任务仅花 $0.31,而 Claude Fable 5 为 $2.75、Claude Opus 4.8 为 $1.80、GPT-5.6 Sol 为 $1.04、Kimi K3 为 $0.95,Grok 4.5 成本比 Claude Fable 5 低近 9 倍。在 FrontierSWE 基准上,Grok 4.5 每任务 token 用量比 Fable 5 少近 6 倍,仍排名靠前。SpaceXAI 通过 token 效率实现顶级智能与低成本结合。AI模型Grok 4.5效率成本推荐理由:SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。原文稍后读已读值得跟进有用关注 Grok 4.5
09:53AI Will@FinanceYF5Grok 4.5 模型参数规模为 1.5T,远低于 Kimi K3 的 2.8T 参数。但 Kimi K3 每次任务成本比 Grok 4.5 高出 3 倍。SpaceXAI 宣称在智能效率上实现突破,暗示参数更小但性能更优。若 Grok 扩至 3T 参数,效率优势可能进一步放大。AI模型GrokKimi参数规模推荐理由:SpaceXAI 的 Grok 4.5 用 1.5T 参数就挑战了 2.8T 的 Kimi K3,成本还低 3 倍,看看参数效率和成本怎么平衡的。原文稍后读已读值得跟进有用关注 Grok
09:52Guillermo Rauch@rauchg精选72°Moonshot AI的Kimi K3在一项私有网络安全基准测试中表现顶级,召回/精度/价格比优秀。Sol模型安全能力大幅跃升,但成本是第二名的7倍以上。GPT 5.6召回和精度最佳,但价格最高。Fable 5完全拒绝执行任务,无法用于安全分析。建议用Sol做单次基线,Kimi K3做持续分析。AI模型Kimi K3SolGPT 5.610 个信源在谈事件专题推荐理由:Moonshot AI的Kimi K3在网络安全任务上性价比很高,比GPT 5.6便宜7倍但效果接近,适合做代码安全审计。原文稍后读已读值得跟进有用关注 Kimi K3
09:51AI Will@FinanceYF5据 X 平台用户爆料,xAI 的 Grok 4.5 模型参数规模为 1.5 万亿,而 Kimi K3 参数达 2.8 万亿。但 Grok 4.5 每项任务的成本比 Kimi K3 低 3 倍。该推文称 xAI 已突破智能效率瓶颈,并展望 3 万亿参数版本的 Grok 性能更强。AI模型GrokKimi K3参数规模10 个信源在谈事件专题推荐理由:xAI 的 Grok 4.5 用不到一半的参数实现更低成本,对比 Kimi K3 的效率差异值得关注。原文稍后读已读值得跟进有用关注 Grok
07:58Ethan Mollick@emollick用户以中文请求 Kimi K3 挑选两首不陈腐且适用于 LLM 的诗,但模型在思维链中 95.5% 的字符(88% 的单词)使用英文,即便它明确考虑的是面向中文读者的中文诗歌。这一比例揭示模型在处理中文任务时可能依赖英文推理空间。测试基于单次交互,未涉及更大规模统计。AI模型Kimi K3思维链多语言10 个信源在谈事件专题推荐理由:Kimi K3 回应中文请求时,思维链几乎全英文,挺有意思的观察,适合好奇模型内部机制的朋友。原文稍后读已读值得跟进有用关注 Kimi K3
05:54elvis@omarsar0精选ProofAgent-Harness 是一个开源评估基础设施,通过多陪审员共识对 Agent 上下文进行七维评分,涵盖角色清晰度、护栏覆盖、指令一致性、工具模式质量、基础充分性、注入防护和令牌效率。实验表明,基础充分性分数预测幻觉抵抗能力,护栏覆盖分数预测操纵抵抗能力,工具模式质量分数预测工具使用准确性。该工具将上下文评分与行为指标和发布决策分离,独立作为 Agent 可靠性的领先指标。论文发布于 arxiv.org/abs/2607.14275。AI模型ProofAgent-Harnessdair.aiAgent可靠性推荐理由:dair.ai 团队搞了个开源工具 ProofAgent-Harness,能给你的 Agent 上下文质量打分,提前知道它会不会幻觉、被攻击或乱用工具,比光看行为测试靠谱多了。原文稍后读已读值得跟进有用关注 ProofAgent-Harness
04:12Aravind Srinivas@AravSrinivasTogether AI 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5 的软件工程任务表现。结果显示,Kimi K3 以 Fable 5 约 35% 的价格实现了相同性能,且在更高 pass@k 指标上领先。该分析来自 Together AI 的 Arav Srinivas,数据基于内部测试。AI模型Kimi K3Claude Fable 5Together AI10 个信源在谈事件专题推荐理由:想省钱又要强性能?Kimi K3 在编程任务上和 Claude Fable 5 打个平手,价格只要三分之一,高要求场景还更强。原文稍后读已读值得跟进有用关注 Kimi K3
00:09OpenRouter@OpenRouterAIOpenRouter汇总了本周发布的9款新模型。其中包括Kimi K3、Muse Spark、Thinking Machines Inkling。这些模型可通过OpenRouter平台直接体验。AI模型OpenRouterKimi K3Muse Spark10 个信源在谈事件专题推荐理由:OpenRouter汇总了本周9个新模型,有Kimi K3、Muse Spark等,想尝鲜可以看看。原文稍后读已读值得跟进有用关注 OpenRouter
00:03@koltregaskes@koltregaskesxAI的Grok 4.6(2T参数模型)将在下周完成初始训练。其性能可能超过Kimi K3。速度和成本与Grok 4.5相当。根据Elon Musk以往从训练完成到发布的时间,估计发布时间为9月中旬。AI模型Grok 4.62T模型Kimi K310 个信源在谈事件专题推荐理由:xAI的Grok 4.6下周完成训练,号称又快又便宜,还比Kimi K3强,预计9月中旬发布,可以关注。原文稍后读已读值得跟进有用关注 Grok 4.6
23:57官方账号LangChain@LangChainAI精选GPT Researcher是由Assaf Elovic和Tavily开发的开源深度研究实现,在GitHub上接近30k星。它基于LangChain的Deep Agents,采用规划-并行研究-审查-发布流程,代码量更少。与Tavily Web搜索相比,其验证引用数量约2倍,质量相当或更好,在Deep Research Bench的10项任务中7项胜出。AI模型GPT ResearcherDeep AgentsLangChain推荐理由:LangChain推的GPT Researcher基于Deep Agents,代码更少,引用翻倍,7/10任务赢,开源省心。原文稍后读已读值得跟进有用关注 GPT Researcher
22:19berryxia@berryxia精选73°Google更新Gemma 4,修复历史轮次处理、思考保留、工具输出延续和工具调用一致性问题。预填充速度提升25-70%。Unsloth跟进发布GGUF、MLX和NVFP4量化版本,支持本地部署。此次更新解决了Gemma之前工具调用不稳定或卡住的痛点。AI模型Gemma 4GoogleUnsloth3 个信源在谈事件专题推荐理由:Google刚修了Gemma 4工具调用的老毛病,速度还快了25-70%,Unsloth立马出了量化版能本地跑,做Agent的兄弟可以试试。原文稍后读已读值得跟进有用关注 Gemma 4
20:25官方账号vLLM@vllm_project83°Kimi Moonshot 发布新模型 Kimi K3,并将 KDA 前缀缓存实现直接贡献给 vLLM。KDA 突破了传统前缀缓存的假设,可提升长上下文服务的效率。vLLM 将在发布当天(July 27, 2026)开放权重时同步支持 K3 模型。该合作确保了社区从第一天起就能高效使用长上下文推理。AI模型Kimi K3vLLMKDA前缀缓存10 个信源在谈事件专题推荐理由:Kimi 和 vLLM 合作搞了个新缓存方案,K3 模型上来就能高效处理长文本,开源权重明年7月放出来。原文稍后读已读值得跟进有用关注 Kimi K3
14:02Ate-a-Pi@svpino研究人员用强化学习训练机器人从杂乱容器中捡起水瓶并递给人类,仅针对水瓶训练。测试显示,机器人在水瓶上的成功率从80%提升至98%,对未训练的零食罐吞吐量提高40%,对更难处理的软袋性能提高13%。这表明强化学习泛化能力可以节省机器人训练成本。AI模型机器人强化学习泛化能力推荐理由:看看这个用强化学习练水瓶的机器人,结果连零食罐和软袋也能捡,效率还涨了40%原文稍后读已读值得跟进有用关注 机器人
13:21向阳乔木@vista8Kimi K3在6个真实场景项目中表现突出,优化了长程高难任务,主动性很强;但遇到简单模糊需求会过度思考。在交互、界面、视觉等场景可作为首选模型,而架构、后端场景落后于Claude Fable 5和GPT-5.6。由于训练方式原因,与官方Kimi Code匹配更好,接入Claude Code效果有折损。AI模型Kimi K3Kimi CodeClaude Code10 个信源在谈事件专题推荐理由:想看看Kimi K3的真实水平?乔帮主用6个项目实测,告诉你它哪里强哪里弱,值得一试。原文稍后读已读值得跟进有用关注 Kimi K3
11:14shao__meng@shao__mengSemiAnalysis 报道称,中国公司 Moonshot 的 Kimi K3 模型在 front-end coding 基准测试中超越了所有美国模型。该模型参数量小于大多数闭源前沿模型。这一结果来自 SemiAnalysis 的分析报告。AI模型KimiK3SemiAnalysis推荐理由:Moonshot 的 Kimi K3 在前端编码上打败了所有美国模型,而且模型更小,值得关注。原文稍后读已读值得跟进有用关注 Kimi
11:09官方一手歸藏(guizang.ai)@op741874°Claude 宣布自 7 月 20 日起,Fable 5 将长期包含在 Max 和 Team Premium 订阅计划中,限额为总使用量的 50%。Pro 和 Team Standard 用户则通过积分访问,并将一次性获得 100 美元积分。官方称此前需求难以预测,曾多次延期。此举可能是应对 OpenAI 和 Kimi K3 的竞争压力。AI模型ClaudeFable 5Max10 个信源在谈事件专题推荐理由:Claude 终于把 Fable 5 长期固定进 Max 和 Team Premium 了,限额 50%,Pro 用户也有 100 美元积分补贴,比之前稳定多了。原文稍后读已读值得跟进有用关注 Claude
10:00官方账号Clement Delangue@ClementDelangue精选Kimi k3每token价格是GPT-5.6 Sol的一半,但GPT-5.6 Sol生成所需token数仅一半,总成本相近。GPT-5.6 Sol的TPS是Kimi k3的2倍,实际任务速度快约4倍。用户指出Kimi k3性能优秀但并非超值选择。AI模型Kimi k3GPT-5.6 Sol推理模型10 个信源在谈事件专题推荐理由:有人觉得Kimi k3便宜?其实和GPT-5.6 Sol算下来价格差不多,GPT-5.6 Sol速度还快4倍,别被误导了。原文稍后读已读值得跟进有用关注 Kimi k3
09:38官方账号Together AI@togethercomputeTogetherCompute使用DeepSWE评估了Kimi K3与Claude Fable 5在软件工程任务上的表现。Kimi K3以约35%的价格达到与Claude Fable 5相同的性能水平。在更高的pass@k指标上,Kimi K3甚至领先于Claude Fable 5。该分析为开发者提供了性价比更高的模型选择参考。AI模型Kimi K3Claude Fable 5DeepSWE10 个信源在谈事件专题推荐理由:如果你写代码,Kimi K3花不到一半的钱就能干和Claude Fable 5一样好的活,高通过率时还更强。原文稍后读已读值得跟进有用关注 Kimi K3
08:09OpenRouter@OpenRouterAIThink Machines开发的Inkling模型已上线OpenRouter。该模型采用MoE架构,总参数975B、活跃参数41B。支持1M上下文长度,可处理文本、图像和音频。具备可控推理能力。AI模型InklingThink MachinesOpenRouter10 个信源在谈事件专题推荐理由:Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。原文稍后读已读值得跟进有用关注 Inkling
06:54官方账号OpenAI@OpenAI91°GPT-5.6 Sol在“The Last Ones”网络靶场中达到网络安全领域新SOTA。该能力已转化为实际防御效果,帮助团队在真实代码中查找、验证和修复漏洞。OpenAI将其集成到Codex Security中供用户使用。AI模型GPT-5.6SolOpenAI10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6 Sol在网络安全靶场拿了第一,还能直接帮团队修真实漏洞,试试Codex Security吧。原文稍后读已读值得跟进有用关注 GPT-5.6
06:34官方账号Greg Brockman@gdbOpenAI 近期推出了 /goal 功能,但 GPT-5.6-sol 模型无需该功能即可持续执行任务直至完成。Shopify 的 tobi lutke 在 X 上表示,GPT-5.6-sol 是第一个不再需要 /goal 的模型,能自己持续推进任务。该推文获得 201 个赞和超过 2.2 万次查看。AI模型GPT-5.6-solOpenAI智能体10 个信源在谈事件专题推荐理由:OpenAI 悄悄升级了 GPT-5.6-sol,它能自己把事做完,不用你再设目标了,执行力超强。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
06:20Cognition@cognition_labsCognition发布FrontierCode排行榜,专门评估模型生成可合并代码的能力。榜单包含Grok 4.5、Inkling等模型的得分。官方提供了完整的评分方法和示例任务。AI模型FrontierCodeGrok 4.5Inkling10 个信源在谈事件专题推荐理由:想知道哪个AI写代码最靠谱?FrontierCode榜单直接告诉你哪些模型写的代码能直接合并。原文稍后读已读值得跟进有用关注 FrontierCode
05:46官方一手@OpenAIDevs@OpenAIDevsOpenAI发布GPT-5.6模型,社区开发者分享了超过10,000个使用该模型的理由。通过GPT-5.6,用户可以将产品从概念快速转化为成品。案例展示了GPT-5.6在代码生成和原型设计中的实际应用。AI模型GPT-5.6OpenAI编程助手10 个信源在谈事件专题推荐理由:OpenAI社区分享了用GPT-5.6开发产品的真实案例,能帮你快速把想法变成成品,效率很高。原文稍后读已读值得跟进有用关注 GPT-5.6
05:30官方账号Greg Brockman@gdb精选OpenAI 发布的 GPT-5.6 Sol 模型在网络安全任务中达到最先进水平,能够发现并修复新型漏洞。AI 安全研究所的评测显示,在名为“The Last Ones”的网络安全测试中,GLM-5.2 匹配了约 7 个月前发布的 Opus 4.5,而 DeepSeek 的 V4-Pro 低于约 7 个月前发布的 Sonnet 4.5。该模型目前面向防守方开放注册,用于保护系统。AI模型GPT-5.6 SolOpenAI网络安全10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 专攻网络安全,能找漏洞并修复,防守方现在就能注册用。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
05:18官方账号OpenAI@OpenAIOpenAI在推特上宣布GPT-5.6 Sol模型,声称用户有10000个理由喜爱它。该模型通过switch-to-codex.openai.chatgpt.site可访问。目前尚未公开基准测试结果或具体改进细节。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI刚发了GPT-5.6 Sol,号称一万人说好,去那个链接看看它到底强在哪。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
05:15官方账号Runway ML@runwayml独立人类评估对六款AI视频智能体进行了30个电影提示和16个指标的测试。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三大支柱上均排名第一。Physion Labs 发布的 Physion-Arc 1.0 基准测试了100个剧本和600个生成视频,Runway 在主观指标(如电影品味)上优势尤其明显。AI模型Runway AgentPhysion-Arc视频生成推荐理由:Runway Agent 2.0 在视频生成评测里全面碾压了 Luma、MiniMax 这些对手,叙事和电影感都拿第一,做视频的可以看看。原文稍后读已读值得跟进有用关注 Runway Agent
04:45lmarena.ai@lmarena_ai77°月之暗面(Kimi_Moonshot)发布的Kimi-K3模型在Frontend Code Arena基准上首次超越美国模型,击败了此前领先的Fable。这是自2025年初DeepSeek-R1以来中国模型再次接近领先位置,仅隔6周。Kimi-K3使月之暗面成为全球前端编程能力第一的AI实验室。该模型为开源,标志着中国开源模型首次在编码领域超越美国。AI模型Kimi-K3Frontend Code Arena月之暗面10 个信源在谈事件专题推荐理由:月之暗面刚发的Kimi-K3直接打败了Fable,中国模型第一次在Frontend Code Arena登顶,开源领域又一大动静。原文稍后读已读值得跟进有用关注 Kimi-K3
04:24官方账号NVIDIA AI@NVIDIAAI71°NVIDIA发布Nemotron 3 Embed系列嵌入模型,8B版本在LMEB排行榜上位居第一,1B版本紧随其后排名第二。LMEB专门测试嵌入模型在长对话和记忆密集型任务中的检索能力,对需要跨会话保持上下文的智能体非常关键。此外,8B模型还以整体第一的成绩登顶RTEB基准,该基准评估真实世界场景下的检索准确性。AI模型NemotronNVIDIALMEB10 个信源在谈事件专题推荐理由:NVIDIA的Nemotron 3 Embed 8B在LMEB和RTEB两个排行榜都拿了第一,适合做智能体长期记忆的检索。原文稍后读已读值得跟进有用关注 Nemotron
03:36Gary Marcus@GaryMarcus精选73°Kimi K3是一款2.8万亿参数的模型,支持100万token上下文窗口,在SWE-Bench Pro、SWE-bench Multilingual、BrowseComp和Toolathlon上达到SOTA。它自主运行20小时内核优化实验,实现1.6倍加速。推理价格仅$0.25/百万token,而Fable 5收费$1.30。背后公司Moonshot估值$30B,计划于7月27日开源权重。AI模型KimiK3Moonshot推荐理由:Kimi K3性能打平甚至超越Claude和Fable,价格却只有它们的五分之一,还开源,性价比炸裂。原文稍后读已读值得跟进有用关注 Kimi