14:08shao__meng@shao__meng81°阿里发布 Qwen3.8-Max,参数规模 2.4T,主打自主编码和长时任务。官方称它能在无人干预下完成 10 天以上的开发流程,并跑过 500 多轮芯片设计优化。定价为输入 2 美元/百万 tokens,输出 6 美元/百万 tokens,缓存 0.25 美元/百万 tokens。下周 Qwen3.8-Max 和 Qwen3.8-27B 的权重将一同开源。AI模型Qwen3.8-MaxQwen3.8-27B开源模型1 个信源在谈事件专题推荐理由:阿里把 2.4T 参数的 Qwen3.8-Max 拿出来,下周连 27B 一起开源,缓存价只要 0.25 美元,可以蹲一手。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
12:36小互@imxiaohu72°Qwen3.8-Max 总参数量 2.4T、激活参数 95B,官方宣布下周开源,是 Qwen Max 系列首次开源。它在 oh-my-cli 项目中自主运行 16 天完成无人编程,并在电商多模态意图识别竞赛中提交 45 次,准确率从 0.60 提升到 0.853,击败 458 支队伍。在 365 天模拟电商经营中,模型实现 4.16 倍资金回报,净赚超 10 万元。它还花 125 小时写 7,600 行代码复现论文,并在 AIME24 上反超原论文 2.71 分。视觉与多模态方面,模型支持分析 100+ 小时长视频,并能通过 Hybrid Agent 编程与 GUI 操作复刻应用。AI模型Qwen3.8-Max开源模型智能体推荐理由:Qwen Max 首次开源,2.4T 参数下周见;它能自己跑 16 天干活,还拿过 4.16 倍回报。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
16:40向阳乔木@vista8一位开发者使用Codex的Goal指令,让AI自主完成了一个网站开发任务,包括开发、测试、部署和上线,整个过程持续了10小时,功能还在不断完善中。这个AI资讯订阅RSS站(rss.qiaomu.ai)现已开放体验,展示了AI在长期自主编程任务中的潜力。这证明了Goal指令能有效驱动AI持续迭代,无需人工干预即可完成复杂项目。AI产品CodexGoal指令自主编程推荐理由:对于做AI编程或自动化开发的团队,这个案例展示了Goal指令如何让AI自主完成10小时的长任务,值得亲自试试看能否复现类似效果。原文稍后读已读值得跟进有用关注 Codex
14:05官方一手arXiv: DeepSeek@Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin, Tariqul Islam, Tarannum Shaila Zaman精选72°A-ProS 是一个自主 AI 智能体,通过混合多模型反馈框架解决竞争编程问题,将解决方案生成与专门调试分离。它结合了 ChatGPT 生成器(GPT-4 和 GPT-5)与三个调试批评模型:Codestral-2508、Llama-3.3-70B 和 DeepSeek-R1,采用 2x3 因子设计。在 367 个 ICPC 世界总决赛(2011-2024)和 Codeforces(评级 1200-1800)问题上的评估显示,GPT-5 工作流经过三轮优化后,初始接受解决方案从 39 个提升到 85-90 个,GPT-4 从 15 个提升到 31-38 个。控制消融实验表明,有状态优化比无状态方法性能提升 8.5-10.6 个百分点,重复失败减少高达 3.5 倍。与基线智能体循环相比,A-ProS 的增益超过 2 倍,凸显了持久上下文和多模型反馈对于可靠自主程序合成的重要性。论文自主编程多模型反馈竞争编程推荐理由:竞争编程开发者终于有了一个能可靠迭代的 AI 助手——A-ProS 通过多模型反馈将 GPT-5 的初始通过率提升 2 倍以上,做算法竞赛或自动化代码生成的团队可以直接参考其架构设计。原文稍后读已读值得跟进有用关注 自主编程