#多模态
朋友,青海师范大学的藏语智能实验室发布了我国首款藏语多语言全模态 AI 输入法,叫智达 AI 输入法,支持手机、电脑全终端,还能语音输入藏语,挺方便的。
智谱新出的Qwen3.8-Omni-Flash,比谷歌的Gemini Flash便宜,多模态性能还差不多,适合做AI代理。
阿里新出的 Qwen3.8-Omni-Flash 多模态模型,上下文能到百万,比之前的 Omni-Plus 平均提升 26%,还便宜了。
朋友,你肯定听说过 Tilly Norwood 这个新 AI 模型,它最近在媒体上很火。不过它好像有点小问题,在一次采访里居然说中文了,这有点尴尬。
朋友发了新模型,叫 Nemotron-SEA-LION-v4.8,是 AI Singapore 和 NVIDIA 联合做的,专门针对东南亚的语言,比之前版本更好。
阿里新出的 Qwen3.8-Omni-Flash 模型,音频视频理解能力更强,还能用工具自动编辑视频、翻译视频,比之前的版本更便宜,适合做长视频处理。
DeepSeek 新出的 V4.1-Flash 模型,KV 缓存占用比之前版本小很多,适合做长上下文对话,比如百万级文本的对话,而且性能还更好。
朋友,有个挺有意思的,有人用 Claude Opus 5 做了个网站,里面有 25 个迷你房间,每个房间都有个 Claude 陪着,挺有趣的。
这个框架挺有意思,它把大语言模型的决策和具体的无人机技能(比如搜索、检查)给连接起来了,让无人机群组能更灵活地执行任务,而且不需要中央控制,通过经验数据在线更新技能,挺实用的。
科大讯飞发布了他们的语音基座大模型 Spark-Audio-1.0-Preview,这个模型能直接理解语音,而不是先转文字再处理,解决了传统方法的两个问题,效果也不错。
Anthropic 推出了 Claude 3.5 Sonnet,这个新模型在多项任务上比 GPT-4 更强,你可以用它来写代码、做推理,甚至处理图片信息。
豆包大模型 2.1 Pro 新版本更新,Agent 能力提升,能多源交叉验证,减少幻觉,对金融投研有直接价值;还能看图写代码,直接还原 28 万行 Java 代码,对开发者很实用。
火山引擎的豆包大模型更新了,Agent 交付更可靠,多模态 Coding 能力也进化了,适合做金融投研、办公自动化这些长报告任务。