全部动态
Cisco开源了FAPO,能自动修多步LLM管线的提示,比GEPA强在15/18个测试里,想搞提示优化的快去试试。
想精细控制Agent工具?Nous Research给Hermes Agent加了Blank Slate模式,从零选工具,不预装一堆,清爽又可控。
LM Studio 用四台 Mac Studio 跑起万亿参数的 Kimi K2.6,还能用 iPhone 远程调用,给消费级本地部署开了个好头。
上海交大团队搞了个BabelTele,AI之间能说人类看不懂的语言,压缩四分之三文本还差不多全对,省token神器。
OpenAI 要发 GPT-5.6 了,上下文拉到 150 万 tokens,编码能力还干翻了 Anthropic 的 Mythos,价格还更便宜,开发者可以关注一下。
英特尔和AMD联手推出了ACE规范1.15,专门给x86芯片加AI加速指令,未来Zen 6和Zen 7都会用上,搞深度学习的朋友可以关注。
Anthropic 的最强模型 Mythos 和 Fable 5 很快要重新开放了,面向美国之外,韩国市场也在快速扩张。
智谱的 GLM-5.2 刚登顶设计榜单,比 Claude Fable 5 便宜很多,还能用好第三方库,做网页设计的可以试试。
NVIDIA搞了个叫SpatialClaw的智能体,不用训练,直接用写Python代码的方式做3D空间推理,挺创新的。
3B参数就能比肩DeepSeek V3.2和Kimi K2.5,基于Qwen2.5-Coder-3B开源,适合资源受限场景的推理任务。
Liquid AI出了两个轻量模型,350M参数就能做11种语言的搜索,还能装到手机等边缘设备上跑。
银河通用首发人形机器人小脑大模型,2万小时数据训练,成功率随数据量暴涨,跟GPT一样有规模定律,值得技术控关注。
小米把全屋智能 Agent 开源了,基于 MiMo 大模型,能认人、记习惯、主动干活,自己搭一套试试。
阿里开源的 LOGOS 模型,用 1/56 参数就碾压了微软 NatureLM,还统一了蛋白质、小分子等科学对象的语言,搞科研的可以看看源码和论文,开箱即用。
想看看AI搞科研到底多强?OpenAI出了个750道专家题的LifeSciBench,GPT-Rosalind才36.1%,差距大到让你吃惊。
OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。
Vercel 出了个开源 Agent 框架 Eve,把 Agent 做成文件目录,自带沙箱和评估,用 npx init 就能部署,挺省事的。
OpenAI搞了个新方法,用历史对话模拟测试模型,能估算不良行为率,误差才1.5倍,做AI安全评估的朋友可以看看。
xAI 刚上线的 Grok Imagine Video 1.5,6 秒 720P 视频生成只要 25 秒,音画同步和运动真实感比前代强不少,做短视频挺合适。