01:33Philipp Schmid@_philschmid78°Gemini 3.1 Flash Live在人工智能语音分析领域表现优异,成为最受欢迎的语音智能体之一。AI模型Gemini 3.1 Flash Live语音智能体人工智能语音分析推荐理由:Gemini 3.1 Flash Live在语音智能体领域表现卓越,值得一试。原文稍后读已读值得跟进有用关注 Gemini 3.1 Flash Live
23:03techcrunch@Ivan MehtaMeta 推出了一款新的 Mac 应用。该应用的核心功能是语音交互。Muse Spark 模型为该应用的听写功能提供支持。AI产品MetaMuse SparkMac推荐理由:Meta 新出的 Mac App,能用 Muse Spark 模型直接语音操控应用,不用打字了。原文稍后读已读值得跟进有用关注 Meta
18:10techcrunch@Theresa Loconsolo过去两年,AI笔记硬件从信用卡大小设备、吊坠到转录耳塞层出不穷。可穿戴厂商Sandbar推出戒指形态的Stream,押注用户用语音捕捉零散想法。Sandbar认为,语音比按键和触摸更适合AI可穿戴设备。他们相信AI可穿戴会逐步转向语音优先的交互方式。行业SandbarStream可穿戴设备推荐理由:Sandbar说未来AI戒指靠语音,不用动手就能记下想法,比别针和耳塞更自然。原文稍后读已读值得跟进有用关注 Sandbar
06:49IT之家(博客/媒体)精选77°OpenAI 已更新 ChatGPT 桌面应用,新增 ChatGPT Voice 语音交互功能,基于新推出的 ChatGPT-Live 语音模型系列。该功能支持 ChatGPT Work 和 Codex,并能调用计算机操作能力访问网站和应用。在 macOS 上,用户可通过 Appshots 允许 ChatGPT 读取屏幕内容。演示中,开发者用一句语音指令让 ChatGPT 创建代码线程、提交 Pull Request 并定位 Bug 根因。此外,Anthropic 也更新了 Claude 语音模式,可调用 Opus、Sonnet 和 Haiku 模型完成 Gmail 等应用中的任务。AI产品ChatGPTOpenAICodex10 个信源在谈事件专题推荐理由:桌面版 ChatGPT 现在能听懂人话干活了,说一句就能建分支、提 PR、查 Bug,还能配合 Codex 远程操作,比 Claude 语音模式多了屏幕理解。原文稍后读已读值得跟进有用关注 ChatGPT
22:53官方账号ElevenLabs@elevenlabsioElevenLabs 宣布将 ElevenAgents 推广到全线业务。首个应用是 ElevenReader 的语音聊天功能。官方数据显示,采用该功能的用户平均收听时长提升了 24%。这意味着智能体正在直接拉动音频产品的用户粘性。AI产品ElevenLabsElevenAgentsElevenReader推荐理由:ElevenLabs 把智能体塞进自家阅读器,用户收听时长涨了 24%,语音交互这波有戏。原文稍后读已读值得跟进有用关注 ElevenLabs
07:22IT之家(博客/媒体)76°彭博社马克·古尔曼爆料,OpenAI 首款 AI 硬件采用甜甜圈造型,大小约等于冰球,体积约 115.8 立方厘米。该设备售价预估在 300 到 400 美元(约合 2029 至 2705 元人民币),计划 2027 年发布。它本质上是没有显示屏的智能音箱,由 OpenAI 与前苹果设计师乔纳森·伊夫合作开发,面向家庭场景。硬件配备可移动部件、灯光、摄像头和传感器,交互方式类似 ChatGPT 语音模式,将使用更先进的模型。AI产品OpenAIChatGPTAI硬件10 个信源在谈事件专题推荐理由:古尔曼说 OpenAI 和苹果前设计师在搞甜甜圈 AI 音箱,纯语音操作,2027 年卖 300 美元起。原文稍后读已读值得跟进有用关注 OpenAI
03:38官方一手@OpenAIDevs@OpenAIDevsOpenAI在Codex中推出语音对话功能,用户可边走路边整理思路并开始编程。一位学生在去上课途中使用该功能,在20-25分钟内完成并修订了一个14会话的数据库实验。完成后,这份14会话实验的草稿已就绪,主要细节和个人语气都得到保留。该用户表示语音交互让他不想再打字,认为Codex的体验已接近AGI。AI产品CodexOpenAI语音交互10 个信源在谈事件专题推荐理由:OpenAI给Codex加了语音模式,通勤路上动嘴就能整理思路、改代码,用户实测20多分钟搞定14会话实验。原文稍后读已读值得跟进有用关注 Codex
02:10elvis@omarsar0Project Deskless 发布首款物理按钮式智能体交互界面:按住按钮说话即可向 AI 员工 Viktor 下达任务。官方演示称,一句口语指令可以在三个团队之间传递四项工作,全程无需看屏幕或打字。该界面没有 App,也不依赖鼠标和触摸,适合开车等不便操作的场景。Viktor 目前可免费开始使用。AI产品Project DesklessViktor智能体推荐理由:把智能体做进一个实体按钮,按住说话就行,不用找 App 也不用打字,开车时眼睛不用离开路。免费就能开始用。原文稍后读已读值得跟进有用关注 Project Deskless
04:44官方账号OpenAI@OpenAI76°OpenAI 发布 GPT-Live,支持边说边听。为适配 ChatGPT 的流量规模,团队从客户端到模型重建了语音栈。GPT-Live 的音频流保持连续,深层推理和工具调用不会打断对话。AI模型GPT-LiveOpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-Live 能边听边说,音频一直连着,推理和调工具也不断,挺酷的。原文稍后读已读值得跟进有用关注 GPT-Live
04:30官方一手OpenAI Blog(博客/媒体)OpenAI用六个月构建了GPT-Live实时语音系统。GPT-Live采用无轮次语音模型,实现了连续语音交互。低延迟架构使得对话响应更迅速,更接近自然交流。OpenAI官方博客公开了这套系统的构建方法与技术细节。AI模型OpenAIGPT-Live语音交互10 个信源在谈事件专题推荐理由:OpenAI搞了个GPT-Live,能连续对话不用等你说完,延迟更低,比传统语音助手自然多了。原文稍后读已读值得跟进有用关注 OpenAI
23:40官方账号ElevenLabs@elevenlabsioElevenLabs 官方宣布,其 ElevenAgents 平台每周运行超过1000万次对话。这些对话由自然语音或聊天代理完成,涉及退款请求、预约、福利查询和航班更改等真实场景。该平台已支撑起大规模自动化客户交互,相关数据在 ElevenLabs 官方推文中披露。AI产品ElevenAgentsElevenLabs智能体推荐理由:ElevenLabs 说他们的智能体每周能跑一千万次对话,退款、改签这类活都能自动干,规模不小。原文稍后读已读值得跟进有用关注 ElevenAgents
06:05ChatGPT@ChatGPTapp82°ChatGPT Voice 官方宣布,语音对话功能现已登陆 macOS 和 Windows 客户端。用户无需键盘输入,全程用语音即可向 ChatGPT 下达指令并获取回复。该功能在桌面端实现了免提操作,官方同步发布了演示视频展示实际效果。AI产品ChatGPTmacOSWindows3 个信源在谈事件专题推荐理由:OpenAI 把 ChatGPT Voice 搬到了 Mac 和 Windows 上,现在你动嘴不动手就能让它干活,适合手忙不过来的时候用。原文稍后读已读值得跟进有用关注 ChatGPT
00:24elvis@omarsar0开发者用Fable 5框架创建了一个AI数学导师,语音部分由Grok Voice Think Fast 2.0驱动。演示中,AI通过语音与用户实时交互,解答数学问题。目前体验仍显粗糙,但作者指出随着未来模型升级,效果将显著提升。该示例展示了语音智能体在教育场景中的潜力。技巧Fable 5Grok VoiceThink Fast 2.03 个信源在谈事件专题推荐理由:看看这个用Fable 5和Grok语音做的数学AI导师,能和你对话解题,虽然还粗糙但潜力巨大原文稍后读已读值得跟进有用关注 Fable 5
16:18IT之家(博客/媒体)阿里云 Qoder 推出实时语音交互智能体 QoderVoice,由全双工语音模型 Qwen-Audio-3.0-Realtime 驱动。用户可通过语音下达指令、讨论方案,智能体实时响应并执行任务,支持多轮对话和打断。QoderVoice 已登陆 Qoder 国际版,个人与企业用户可享受 3 天免费试用,CN 版即将上线。AI产品QoderQoderVoiceQwen-Audio-3.0-Realtime推荐理由:阿里云搞了个能边聊边干活的语音智能体 QoderVoice,说话就能让代码自动改方案,还支持打断和讨价还价。原文稍后读已读值得跟进有用关注 Qoder
18:56AI Will@FinanceYF572°用户Alex Finn分享他通过ChatGPT Voice在4小时徒步中完成的工作量超过在办公室8小时。他利用AirPods语音控制电脑,在45分钟自驾途中处理副业项目,在咖啡厅20分钟内写出下月时事通讯草稿。核心设置是选定一台常开台式机作为总部设备,在所有节点设备(iPhone、iPad、笔记本)安装ChatGPT应用,并开启连接功能让节点设备控制总部设备。这套工作流让他可以不依赖桌面,随时随地用语音驱动超级智能完成工作。技巧ChatGPTVoiceAirPods推荐理由:一个真实用户分享用ChatGPT Voice+多设备联动,在徒步、车里、咖啡馆用语音搞定工作,效率翻倍。4步设置就能实现,想远程办公的可以试试。原文稍后读已读值得跟进有用关注 ChatGPT
07:28IT之家(博客/媒体)精选Andrej Karpathy提出使用AI时不必精心打磨提示词,而是通过语音模式与AI闲聊10分钟。用户可以直接表达零散想法,由大语言模型整理成清晰内容。他建议开头告知模型思路可能混乱,语音转写可能有错别字。这一方法能让人和模型更好理解彼此,减少后续纠错。OpenAI推出的GPT-Live支持语音功能,Anthropic最新升级的语音模型支持Opus、Sonnet和Haiku三种选择。技巧安德烈·卡帕西ChatGPTGPT-Live10 个信源在谈事件专题推荐理由:别死磕提示词了,试试卡帕西的法子:打开语音模式,对着AI瞎聊10分钟,它会帮你理清思路。原文稍后读已读值得跟进有用关注 安德烈·卡帕西
02:07官方账号Replit@ReplitReplit 在本月发布多项更新,新增语音与Agent对话功能,用户可直接用语音指令与AI交互。支持从Claude或Slack启动构建流程,无需手动切换工具。Agent现在能记住用户的技术栈,无需重复解释。这些更新旨在提升开发效率,让AI助手更无缝融入工作流。AI产品ReplitAgent语音交互7 个信源在谈事件专题推荐理由:Replit 这次更新很实用,能用语音指挥Agent,还能从Claude或Slack直接开始写代码,再也不用手动交代技术栈了。原文稍后读已读值得跟进有用关注 Replit
11:40官方一手歸藏(guizang.ai)@op7418Codex 更新后直接集成了 GPT Live 实时语音模型,用户可通过语音与 Codex 交互。无需键盘鼠标,仅靠语音即可执行 Codex 上的任何命令,包括询问生成结果、控制编程流程。使用 AirPods 等耳机可在家庭任何地方对话,投影或电视连接电脑后可边做其他事边管理编程进度。实测体验流畅,大幅提升 vibe coding 的便捷性。AI产品CodexGPT Live语音交互推荐理由:Codex 现在内置 GPT Live 语音,你戴上耳机就能用嘴写代码,连键盘都省了,干活玩游戏两不误。原文稍后读已读值得跟进有用关注 Codex
05:42官方账号OpenAI@OpenAIOpenAI 官方宣布,Codex 的 iOS 应用现已集成 ChatGPT Voice 功能。用户可通过配对远程访问,在 Codex 中直接使用语音进行对话。Android 平台的支持即将推出。该功能让用户无需手动输入,即可在 Codex 环境中进行语音交互。AI产品ChatGPT VoiceCodexOpenAI10 个信源在谈事件专题推荐理由:OpenAI 把 ChatGPT 语音搬进了 Codex iOS 版,还能远程配对用。Android 也快了,干活聊天更方便。原文稍后读已读值得跟进有用关注 ChatGPT Voice
03:03techcrunch@Ivan MehtaAnthropic为Claude语音模式更新了更强的基础模型,新版本支持更自然的对话交互。用户可以通过语音指令安排会议或草拟邮件。此次更新提升了语音识别的准确性和响应速度,但没有提供具体的基准测试分数。AI产品AnthropicClaude语音模式10 个信源在谈事件专题推荐理由:Anthropic给Claude语音模式换了更强模型,现在能用语音直接安排会议或写邮件,比之前更流畅自然。原文稍后读已读值得跟进有用关注 Anthropic
22:31@koltregaskes@koltregaskes78°X用户koltregaskes发帖猜测,Anthropic可能今日发布Opus 5和语音模式。他对比指出,OpenAI的实时语音模式仍在使用较弱的模型,而若Anthropic将Opus用于语音,将带来显著提升。该信息仅为传言,Anthropic官方尚未确认。AI产品AnthropicOpus语音模式10 个信源在谈事件专题推荐理由:Anthropic可能要用Opus模型做语音模式了,如果真这样,比OpenAI现在的语音强不少。看看这个推测。原文稍后读已读值得跟进有用关注 Anthropic
19:14IT之家(博客/媒体)Soul 在 2026 世界人工智能大会上发布了 AI 智能硬件 B Soul,将 SoulX 多模态交互大模型的语音交互与情感表达能力融入可随身携带的终端。B Soul 支持随时唤醒、自然交流与持续陪伴,并配套推出 App 和小程序,软硬件共同承载用户的 AI 角色、长期记忆与情绪关系。该产品预计于今年 8 月逐步量产销售。AI产品B SoulSoulXSoul推荐理由:Soul 出了个 AI 硬件 B Soul,能随身带、能对话,8 月就能买到,比单纯手机里的 AI 更有陪伴感。原文稍后读已读值得跟进有用关注 B Soul
16:24AI Will@FinanceYF5a16z合伙人David George指出,顶尖AI公司的研究员已转向语音交互,打字速度比语音慢5到10倍。研究员同时对屏幕窃窃私语,指挥一群Agent并行执行任务。这反映出打字正成为新的效率瓶颈,AI Agent协作模式正在改变开发者工作流。行业a16z语音交互Agent推荐理由:a16z合伙人说现在AI研究员都不打字了,全靠嘴喊一群agent干活,打字已经成了最慢的环节。原文稍后读已读值得跟进有用关注 a16z
04:14techcrunch@Amanda SilberlingHinge创始人Justin McLeod为新公司Overtone融资1800万美元。Overtone定位为语音和音频优先的AI约会服务,提供高度精选的匹配介绍。其核心特色是利用AI技术分析语音交互,帮助用户筛选更合适的对象。AI产品OvertoneHingeAI约会推荐理由:Hinge创始人搞了个新AI约会App,用语音和AI帮你筛选对象,比刷照片有意思多了。原文稍后读已读值得跟进有用关注 Overtone
22:52官方账号Greg Brockman@gdbSimon Smith 在 ChatGPT 中利用 GPT-Live 创建个性化新闻简报。他设置了一个定时任务生成新播报,原本使用文本转语音按钮朗读,现在发现 GPT-Live 可语音播放并允许用户随时提问,问题回答后能自动从断点继续。这个功能在已有对话线程(包括定时任务线程)中直接开启 GPT-Live 按钮即可使用。技巧GPT-LiveChatGPT个性化新闻推荐理由:GPT-Live 能边读新闻边回答你的追问,听完还能继续播,适合通勤时了解资讯。原文稍后读已读值得跟进有用关注 GPT-Live
23:46官方账号Greg Brockman@gdb86°OpenAI发布GPT-Live,一款新一代语音模型,专注于自然流畅的人机对话。该模型即日起在ChatGPT中逐步推出,用户可体验实时语音交互。开发者可通过申请成为设计合作伙伴,使用GPT-Live API创建新应用或集成到现有产品中。OpenAI表示期待该技术为开发者解锁更多创新可能。AI模型GPT-LiveOpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI刚刚放出了GPT-Live语音模型,现在就能在ChatGPT里体验,自然对话感很强,还能拿API做开发,语音交互的玩法会更多。原文稍后读已读值得跟进有用关注 GPT-Live
11:07小互@imxiaohuGPT-Live-1 基于 GPT-5.5 Instant 模型,提供快速自然的语音回应。用户可通过语音免提操作,例如口述修改 offer 回复文案或在跳舞时查询信息,无需触摸手机。该功能支持在后台同时执行搜索任务,提升多任务效率。AI产品GPT-LiveGPT-5.5语音交互推荐理由:GPT-5.5 Instant 驱动的新语音模式,一边跳舞一边用语音查东西,不用摸手机,超级实用。原文稍后读已读值得跟进有用关注 GPT-Live
09:28官方账号OpenAI@OpenAI76°OpenAI 推出新一代语音模型 GPT-Live,现已面向 ChatGPT 的 Go、Plus、Pro 计划用户全面开放。免费用户正在逐步推送中。用户需更新到最新版 iOS 或 Android ChatGPT 应用即可体验。该模型旨在实现更自然的人机语音交互。AI产品GPT-LiveChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI 推出了 GPT-Live,一个全新的语音模型,可以跟 ChatGPT 更自然地对话了,目前 Plus 和 Pro 用户都能直接用。原文稍后读已读值得跟进有用关注 GPT-Live
08:36berryxia@berryxia86°OpenAI 发布了 GPT-Live,一个基于全双工架构的语音模型,支持边听边说,无需等待用户说完再响应。该模型具备更好的时间感、实时翻译能力和更鲜明的对话人格,可在后台将复杂问题委托给前沿模型处理后自然带回对话。从演示看,对话流畅度和打断处理比之前有明显进步,目标是将语音从辅助输入推向主要交互界面。AI模型GPT-LiveOpenAI全双工10 个信源在谈事件专题推荐理由:OpenAI 新出的 GPT-Live 能边听边说,打断处理很自然,适合日常语音交互。原文稍后读已读值得跟进有用关注 GPT-Live
08:01官方账号Simon Willison’s Weblog(博客/媒体)72°OpenAI推出GPT‑Live,升级ChatGPT语音模式,新模型基于GPT-5.5。它能在对话中实时将网页搜索、深度推理等复杂任务委托给GPT-5.5处理,同时保持对话流畅。作者在iPhone app预览数周,最长使用一小时,交互体验显著优于此前基于GPT-4o的旧版语音模式。作者还反馈了一个打断笑声的bug,OpenAI已调整修复。AI模型GPT‑LiveGPT-5.5OpenAI10 个信源在谈事件专题推荐理由:OpenAI把ChatGPT语音模式升级成GPT-Live了,能边聊边调GPT-5.5干活,比老版聪明太多,值得体验。原文稍后读已读值得跟进有用关注 GPT‑Live
06:43IT之家(博客/媒体)74°OpenAI 发布 GPT-Live 系列全双工语音模型,包括 GPT-Live-1 和 GPT-Live-1 mini 两个版本。该模型可同时聆听与说话,每秒多次判断是否说话、打断或调用工具。复杂任务会委托给 GPT-5.5 系列后台执行。相比 Advanced Voice Mode,在 5-10 分钟对话中 GPT-Live-1 偏好得分更高。每周超 1.5 亿人使用 ChatGPT 语音交互。AI模型GPT-Live-1GPT-Live-1 miniOpenAI10 个信源在谈事件专题推荐理由:OpenAI 这次把语音交互做得更自然了,GPT-Live 系列能边听边说,还能打断和调用工具,比以前的 Advanced Voice Mode 流畅很多。原文稍后读已读值得跟进有用关注 GPT-Live-1
02:48官方账号Decoder@Matthias Bastian74°OpenAI 推出 GPT-Live 全双工语音架构,允许 ChatGPT 同时听和说。复杂问题会被后台的 GPT-5.5 模型接手,显著提升回答质量。GPT-Live-1 已对 ChatGPT 付费用户开放,免费用户可使用 mini 版。API 访问即将到来。AI产品GPT-LiveGPT-5.5ChatGPT10 个信源在谈事件专题推荐理由:OpenAI 让 ChatGPT 能同时听和说了,复杂问题自动转给 GPT-5.5 处理,对话更自然。付费用户现在就能体验。原文稍后读已读值得跟进有用关注 GPT-Live
02:46官方账号Sam Altman@sama78°OpenAI 在 ChatGPT 中推出名为 GPT-live 的下一代语音功能。Sam Altman 表示该功能感觉“神奇且真实”。他原本偏好打字与 AI 交流,现在认为这一偏好可能发生变化。GPT-live 旨在提供更自然的语音交互体验。AI产品GPT-liveChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI 在 ChatGPT 里上线了新语音功能 GPT-live,对话更自然,像真人聊天,适合不想打字的用户。原文稍后读已读值得跟进有用关注 GPT-live
02:38Ethan Mollick@emollick早期体验者Ethan Mollick称GPT新语音功能非常出色,比以往版本更智能,更接近科幻电影中的AI对话体验。通过Claude Tag的提示,他发现GPT语音与Claude的组合能催生新的AI协作工作模式。该语音功能在处理复杂交互方面有显著提升。AI产品GPTClaude语音交互推荐理由:Ethan Mollick分享了他对新GPT语音的体验,说变聪明了很多,对话就像科幻片。想看看AI语音能有多好?原文稍后读已读值得跟进有用关注 GPT
01:22官方账号OpenAI@OpenAI88°OpenAI在社交媒体上宣布推出下一代ChatGPT Voice。该功能旨在提升语音交互体验。直播活动将于太平洋时间上午10点开始。目前尚未公布具体改进细节。AI产品OpenAIChatGPT Voice语音交互10 个信源在谈事件专题推荐理由:OpenAI发了新版ChatGPT语音,今天有直播,想了解语音对话升级的可以看看。原文稍后读已读值得跟进有用关注 OpenAI
01:04官方一手OpenAI Blog(博客/媒体)73°OpenAI 发布了新一代语音模型 GPT-Live。该模型专门用于自然的人机语音交互。目前 GPT-Live 已应用于 ChatGPT Voice。它提升了语音对话的流畅度和响应速度。AI模型GPT-LiveOpenAIChatGPT Voice10 个信源在谈事件专题推荐理由:OpenAI 出了新语音模型 GPT-Live,ChatGPT 语音对话更自然了,赶紧试试吧。原文稍后读已读值得跟进有用关注 GPT-Live
23:23@koltregaskes@koltregaskes73°GPT-Live-1 实时语音模式于今日发布。官方将在2小时内进行直播演示。该模式支持实时语音对话,具体技术细节待直播揭晓。GPT-Live-1 是专注于语音交互的新模型。AI产品GPT-Live-1实时语音语音交互推荐理由:GPT-Live-1 今天发布实时语音模式,马上有直播,可以看看它怎么实现低延迟对话。原文稍后读已读值得跟进有用关注 GPT-Live-1
23:09小互@imxiaohuOpenAI 休假一周后回归,预计本周全面上线 GPT 5.6 模型。同时将推出实时语音控制功能。内部消息称上线日期可能在7月7日。相关推文已获得23次点赞和4605次查看。AI模型OpenAIGPT 5.6实时语音控制10 个信源在谈事件专题推荐理由:OpenAI 被传本周上线 GPT 5.6 和实时语音控制,7月7号可能见分晓,科技圈都在看。原文稍后读已读值得跟进有用关注 OpenAI
12:28官方账号arXiv cs.AI@Sathvik Manikantan Napa Ugandhar, Hao Zhang, Alison Gunzler, Yuzhe Wang, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velázquez论文提出DyadEE数据集,包含真实情感协调对话和通过交换伴侣、情感重合成制造的干扰对话。同时提出TRACE框架,将双人交互建模为基于情感微调Whisper声学嵌入的有序序列,将每个样本视为交互痕迹而非池化话语。在DyadEE上实验表明,融入对话上下文和关系信息可提升检测效果,TRACE达到97.01%的准确率。论文TRACEDyadEEWhisper推荐理由:想研究语音AI如何感知对话中的情感协调?这篇论文提出了新数据集DyadEE和框架TRACE,准确率高达97%,值得做语音交互的朋友看看。原文稍后读已读值得跟进有用关注 TRACE
01:25elvis@omarsar0精选作者完全改用语音而非文字输入与AI代理交互,发现音频描述越详细、越长,代理结果越好。他还开发了屏幕录制、截图、追踪鼠标动作和语音注释功能,帮助代理处理设计和精确开发任务。多模态提示(语音+屏幕+动作)显著提升了代理的可靠性,尽管消耗更多token。作者将这些经验制作为可复用的命令集,插入循环后效果显著改善。技巧智能体多模态提示词工程推荐理由:有人分享用语音+屏幕录制和多模态提示跟AI代理唠嗑,提示越啰嗦结果越靠谱,还教你怎么录屏加注释,值得试试原文稍后读已读值得跟进有用关注 智能体