10:06官方账号arXiv cs.LG@Zeyun Zhong, Joya Chen, Manuel Martin, Frederik Diederichs, Juergen Gall, Juergen Beyerer精选测试时训练(TTT)通过推理过程中的连续权重更新实现长上下文处理,但现有方法难以平衡每token更新动态的表达性与分块近似硬件效率。我们提出E$^2$-TTT(表达性和高效TTT)以弥合这一差距。在标准分块近似梯度取自块起始权重的情况下,我们推导出封闭形式的态转换,精确地重现了每token递归的块末快速权重和动量状态。这使块级训练可以完全并行化,同时保留了先前块方法丢弃的更新规则的时间结构。通过从头训练高达1.3B参数的模型验证E$^2$-TTT。它在语言建模方面与先前TTT和混合注意力基线表现相当,但在上下文检索方面表现更优。其优势在长度外推方面最为明显:在标准的“针插麦堆”passkey测试中,它在8倍训练上下文长度下保留了超过90%的准确率。同时,E$^2$-TTT可以匹配高效分块方法的训练吞吐量,表明它有效地协调了表达性和效率。代码可在https://github.com/zeyun-zhong/E2-TTT获取。论文测试时训练表达性效率推荐理由:E$^2$-TTT模型在语言建模和上下文检索方面表现优异,且在长度外推方面具有明显优势,值得一看。原文稍后读已读值得跟进有用关注 测试时训练
16:27向阳乔木@vista8一位用户在社交媒体上吐槽,新手使用AI时消耗的Token费用比工资还高,但产出质量不达标。该用户认为除了限制Token用量,未来可能需要类似“AI驾校”的培训机制来提升使用效率。这条帖子引发了5条评论和9个点赞,浏览量达1770次。技巧TokenAI驾校提示词工程推荐理由:看到有人吐槽新手烧Token比工资还高,产出还不合格,挺真实的,想学怎么省Token的可以看看。原文稍后读已读值得跟进有用关注 Token
03:37eric zakariasson@ericzakariassonGrok Bot 已进入公测阶段,用户 Eric Zakariasson 分享了 100 个实际用例。这些用例覆盖销售、招聘、社区运营等多个场景,例如将 90 分钟到 2 小时的销售流程自动化约 95%,以及用 Bot 团队在一天半内重建大部分自定义 CRM。其他用例包括筛选 1000+ 活动申请者、审查约 200 份招聘申请、将一周的 Gong 通话转化为胜负备忘录等。这些用例展示了 Grok Bot 在自动化工作流和提升效率方面的广泛潜力。AI产品Grok Bot自动化销售推荐理由:Grok Bot 公测了,有人整理了 100 个真实用法,从自动约会议到建 CRM 都有,看完就知道它能帮你省多少时间。原文稍后读已读值得跟进有用关注 Grok Bot
04:04官方一手OpenAI Blog(博客/媒体)OpenAI发布GPT-5.6,该模型在模型架构、推理过程和智能体工作流上进行了效率优化,旨在提升每美元实现的智能水平。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI新模型GPT-5.6,在模型、推理和智能体效率上都有提升,每美元能换更多智能,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6
09:54AI Will@FinanceYF576°Elon Musk 表示,将速度和成本纳入考量后,Grok 4.5 是目前第一名。在 Artificial Analysis 上,Grok 4.5 每项 Intelligence Index 任务仅花 $0.31,而 Claude Fable 5 为 $2.75、Claude Opus 4.8 为 $1.80、GPT-5.6 Sol 为 $1.04、Kimi K3 为 $0.95,Grok 4.5 成本比 Claude Fable 5 低近 9 倍。在 FrontierSWE 基准上,Grok 4.5 每任务 token 用量比 Fable 5 少近 6 倍,仍排名靠前。SpaceXAI 通过 token 效率实现顶级智能与低成本结合。AI模型Grok 4.5效率成本推荐理由:SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。原文稍后读已读值得跟进有用关注 Grok 4.5
08:08berryxia@berryxia关于AI Agent组的组织方式,推荐直接让Agent们发挥自身优势,而不是套用现实中的组织框架。这样能避免低效和token浪费。Agent Group可以自定义角色和职能,操作更方便。技巧智能体Agent工作流推荐理由:别用管人的那套管Agent,让它们自己组队干活,省token又高效。原文稍后读已读值得跟进有用关注 智能体
01:09官方一手OpenAI Blog(博客/媒体)文章介绍了企业衡量AI投资回报的核心指标:每美元产生的有用工作量。通过优化效率,可以规模化高价值工作流。这种方法帮助管理者在不增加成本的情况下提升AI产出。技巧OpenAI智能体AI投资10 个信源在谈事件专题推荐理由:OpenAI教你用'每美元有用功'衡量AI投资效率,比单纯看成本更实用。原文稍后读已读值得跟进有用关注 OpenAI
09:19官方账号arXiv cs.LG@Sudipto Ghosh, Tanmoy ChakrabortyGRADE是一种分层多智能体系统,通过四个轻量级门控网络联合控制智能体选择、层次深度、智能体间通信和分支修剪。训练采用CoGRPO(协作组相对策略优化),无需批评网络,为参与rollout的每个门控和智能体分配共享优势信号。在平均约17B活跃参数下,GRADE在GSM8K、MMLUPro和GPQA上超越所有基线,其中在MMLUPro上以一半活跃计算量高出最强基线4.8个百分点。在AIME-2025上,GRADE与现有框架竞争力持平。消融实验表明层次结构和掩码交叉注意力是精度最大贡献者,且每个智能体的校准对安全热替换必要。论文GRADECoGRPO多智能体推荐理由:GRADE用17B参数在MMLUPro上以一半计算量超基线4.8分,靠四个门控路由动态调深度,很实用。原文稍后读已读值得跟进有用关注 GRADE
12:52AI Will@FinanceYF589°OpenAI 宣布推出 GPT-5.6 Sol,在代码、知识工作、网络安全和科学任务上达到领先表现。该模型在多项基准中实现了更高准确率,同时使用更少 Token 并降低推理成本。GPT-5.6 Sol 的定价较前代版本下降约 30%,继续推动大模型效率提升。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 发了 GPT-5.6 Sol,智能更强还更省 Token,跑代码写论文都比以前快还便宜。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
10:41Geek@geekbb推文指出,一个普通人使用DeepSeek V4能够胜过不使用AI的普通工程师。Dillon Mulroy补充说,好工程师用Kimi 2.7可以超越用Fable的普通工程师。这两项对比凸显了AI工具对工作效率的显著提升作用。DeepSeek V4和Kimi 2.7作为具体模型被引用来支撑观点。行业DeepSeek V4Kimi 2.7Fable推荐理由:一条推文对比了普通人+DeepSeek V4和普通工程师不用AI,还有好工程师+Kimi 2.7 vs 普通工程师+Fable,直接说明AI能拉平技能差距。原文稍后读已读值得跟进有用关注 DeepSeek V4
13:50官方账号François Chollet@fcholletFrançois Chollet 指出当前 AI 技术栈存在 3-4 个数量级的数据效率低下和 4-5 个数量级的计算效率低下。他预测 2040 年的 AI 将更接近最优,而符号学习(symbolic learning)是实现这一目标的关键路径。Chollet 认为现有深度学习架构在数据和算力利用上远未达到理论极限。行业François Chollet符号学习深度学习推荐理由:AI 大神 Chollet 直言现在的深度学习数据效率差 1000 倍、算力差 10000 倍,未来要靠符号学习翻盘。原文稍后读已读值得跟进有用关注 François Chollet
12:39官方账号Noam Brown (OpenAI 推理)@polynoamial73°OpenAI 的 GPT-5.5 模型在一项公开评测中取得了最高分。更令人关注的是,它在考虑 token 消耗、成本和实际运行时间后,依然保持最佳表现。这表明 GPT-5.5 不仅在能力上领先,在效率方面也具备显著优势。对于追求高性能与低成本平衡的开发者来说,这是一个重要信号。AI模型GPT-5.5OpenAI模型评测10 个信源在谈事件专题推荐理由:GPT-5.5 在评测中不仅性能第一,还兼顾了 token 和成本效率,做模型选型的团队可以直接参考这个结果来优化预算。原文稍后读已读值得跟进有用关注 GPT-5.5
05:24elvis@omarsar0精选一篇新论文从经济学视角分析了 AI 智能体如何改变知识工作,研究了智能体在自主性、效率和任务委托范围三个维度的采用情况。论文指出,用户与智能体交互的主要障碍并非模型质量,而是大多数人从未被教导如何以这种方式工作。该研究为理解智能体如何直接填补知识工作中的空白提供了有价值的参考。论文AI 智能体知识工作经济学分析推荐理由:这篇论文戳中了知识工作者用 AI 智能体的真实痛点——不是模型不够好,而是没人教你怎么用。做知识管理、流程优化的团队值得一读,看完会对智能体落地有更清醒的认识。原文稍后读已读值得跟进有用关注 AI 智能体
08:53shao__meng@shao__meng一位 AI 行业产品/开发者指出,每天追踪最新 AI Agent 信息是必备功课,但手动刷 X、Reddit、Hacker News 等效率低,用 Perplexity 等工具效率高但信息深度不够。他提出一个核心需求:是否存在一款面向 Agent 的搜索产品,能同时满足效率、信息完整度和深度,让使用者放心。这条推文反映了 AI 从业者在信息过载时代对高效、高质量信息筛选工具的迫切需求。行业AI Agent信息筛选搜索工具推荐理由:AI 行业 TL 和开发者每天被信息淹没,这条推文精准戳中了「手动刷效率低、工具刷深度不够」的痛点,做 Agent 相关产品的团队值得看看评论区有没有解决方案。原文稍后读已读值得跟进有用关注 AI Agent
09:59elvis@omarsar0Claude Opus 4.8 在 DeepSWE Bench 上取得 58% Pass@1 的成绩,排名第二,仅次于 GPT-5.5。该模型在原始分数上略逊一筹,但在多个最新基准测试中展现出最高的可靠性和效率。这一结果延续了近期趋势:模型在追求极致性能的同时,更注重实际应用中的稳定性和资源效率。对于关注 AI 编程和模型选型的开发者来说,这是一个值得关注的信号。AI模型Claude Opus 4.8GPT-5.5DeepSWE Bench10 个信源在谈事件专题推荐理由:Claude Opus 4.8 在 DeepSWE Bench 上以 58% Pass@1 证明了自己是效率与可靠性的标杆,做 AI 编程选型的团队可以把它作为性价比参考。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
18:36Philipp Schmid@_philschmid一位开发者指出,使用编程助手(如AI编码代理)是一项需要学习的深度技能,而非简单工具。许多人因使用不当而产生糟糕结果,但这恰恰说明它需要练习和提升。该技能的上限很高,掌握后能显著提升效率。这一观点引发共鸣,提醒开发者重视AI工具的熟练运用。技巧编程助手技能提升AI工具推荐理由:AI编程助手正成为开发者必备工具,但很多人因使用不当而效果不佳。这篇文章点出关键:用好它是门技能,值得花时间练习,做AI辅助开发的团队建议看看。原文稍后读已读值得跟进有用关注 编程助手
10:50宝玉@doteyAI 从业者 dotey 分享了自己的使用原则:优先选择推理能力更强的模型(Reasoning Max),而非追求速度(Speed Fast)。他认为慢推理能减少后续验证时间,而快速模型性价比不高。这一观点引发了对 AI 模型选择策略的讨论,尤其适合注重准确性和效率的开发者。技巧推理模型模型选择效率推荐理由:做 AI 应用或模型选型的开发者,这条原则帮你省下反复验证的时间——慢推理反而更快,值得一试。原文稍后读已读值得跟进有用关注 推理模型
07:26Ethan Mollick@emollickEthan Mollick 在 X 上发文,呼吁用户停止将 AI 提示词神秘化,包括使用含义不明的斜杠命令。他认为与 AI 交互应该像与经理沟通一样,用清晰、结构化的格式直接提出需求,而不是像巫师念咒语。这一观点直击当前提示工程中过度复杂化的痛点,强调简单直接才是高效使用 AI 的关键。技巧提示工程AI交互效率推荐理由:Mollick 戳破了提示工程中的玄学泡沫,做 AI 应用或日常使用大模型的团队,看完会重新审视自己的提示词写法,建议直接照做。原文稍后读已读值得跟进有用关注 提示工程
01:10Ate-a-Pi@svpinoAI 工具正在快速整合,一个应用就能完成过去需要多个工具才能完成的任务。这意味着公司可以减少订阅数量,从 12 个工具缩减到少数几个甚至一个。这种趋势将改变企业的软件采购和使用方式,提高效率并降低成本。行业AI 工具整合企业软件推荐理由:做技术选型或管理软件预算的团队,这篇文章点出了 AI 整合带来的实际好处——少订阅、多做事,值得一看。原文稍后读已读值得跟进有用关注 AI 工具