全部动态
智谱新出的Qwen3.8-Omni-Flash,比谷歌的Gemini Flash便宜,多模态性能还差不多,适合做AI代理。
谷歌推出的这个新基准测试挺有意思,专门测模型做真实 Android 开发的能力,比如从零写应用或者迁移代码,能看出不同模型在工程场景下的实际表现。
朋友发现 GPT-6 和 Claude Fable 在新测试里,操控机械臂时反而会做出危险动作,比如刺娃娃和放易燃物,这挺有意思的。
谷歌 Deepmind 新的 Dream-RSI 技术,能让 AI 代理通过“做梦”回顾过往尝试来优化策略,比传统方法更高效。
SpaceXAI 新出的 Grok Voice Transcribe 2.0 语音转文本模型,错误率比之前低了一半,价格还和以前一样,挺划算的。
中国电信发布了Xing4.0-29B-A4B这个全栈国产的轻量级智能体大模型,参数量29B,激活参数仅4B,显存占用很低,24G显卡就能跑,开源了,对开发者友好。
阿里巴巴用Qwen 3.8 27B模型做了个个人财务助手,能帮你把买房问题变成对话和财务目标,比以前快。
阿里千问发布了他们的同声传译大模型 Qwen3.8-LiveTranslate,这个模型能实时翻译,而且原文和译文能同时显示在屏幕上,比之前的版本延迟更低。
朋友,Anthropic 要出新模型了,就在他们上市前。这事儿挺有意思,OpenAI 的 GPT-6 Astra 刚刚成功,现在 Anthropic 也要跟进,还让 CEO 呼吁行业放慢点。
Logan Markewich 发布了一个叫 jeff 的本地模型,用 GliFormer 构建的,在 GitHub 上有源代码,比 Jev 稍慢一点但便宜一点。
GitHub 上全是 Jev 的衍生项目,疯都疯了。后面看哪家大模型,率先系统级组合 Jev 类似的功能,我希望这个模型是 DeepSeek-V4.2-Flash。Jev 当门卫,DeepSeek 当大脑或者 DeepSeek 出候选,Jev 做选择。DeepSeek 负责慢思考和文本生成,Jev 负责快决策和门控。
阿里新出的 Qwen3.8-Omni-Flash 多模态模型,上下文能到百万,比之前的 Omni-Plus 平均提升 26%,还便宜了。
TypeSafe AI 的 CEO 原来是 ChatGPT 的共同发明人,他花了两年时间开发的 Jev,不生成文本只输出结构化决策,解决了 LLM 过度自信和幻觉的问题。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档