18:38官方账号Together AI@togethercomputeDecagonAI 通过与 Together AI 合作,将语音代理每轮对话成本降低近6倍,同时保持实时语音所需的低延迟。他们从闭源模型迁移到微调的开源模型,实现 p95 模型延迟低于400ms。采用自定义投机解码和提示缓存技术,并在 NVIDIA Blackwell 上优化服务部署。模型更新频率达到每周甚至每日,体现了从封闭 API 到开放模型的转变。行业DecagonAITogether AINVIDIA Blackwell6 个信源在谈事件专题推荐理由:DecagonAI 把语音成本砍到原来的1/6,延迟还压到400ms以下,实时语音项目可以参考他们迁移开源模型的做法。原文稍后读已读值得跟进有用关注 DecagonAI
18:37官方账号Together AI@togethercompute精选Together AI分享了优化GLM 5.1推理性能的三项关键改进。他们重写了索引器的topk内核。接着融合了索引器内核以减少内存和启动开销。同时消除了限制预填充吞吐量的CPU开销。这些优化显著提升了GLM 5.1在Together AI平台上的运行效率。AI模型GLM 5.1Together AI推理优化推荐理由:想知道Together AI怎么让GLM 5.1跑得更快?他们分享了三个工程优化点,对部署GLM 5.1有直接帮助。原文稍后读已读值得跟进有用关注 GLM 5.1
18:35官方账号Together AI@togethercomputeTogether AI 上线了 Cartesia Sonic 3.5 语音模型,为开发者提供超过150种语音。通过语音查找器,开发者可以试听和比较这些语音,为实时智能体挑选最合适的角色。选定后可直接在 Together AI 平台部署,简化开发流程。AI模型Cartesia Sonic 3.5Together AI语音模型推荐理由:Together AI 集成了 Cartesia Sonic 3.5,有150多种语音可选,做实时语音智能体可以试试这个新库。原文稍后读已读值得跟进有用关注 Cartesia Sonic 3.5
18:34官方账号Together AI@togethercomputeTogether AI 部署的 DeepSeek V4 Pro 在 Artificial Analysis 基准测试中同时获得输出速度和延迟两项第一。该成绩通过优化 KV 缓存、前缀复用、内核及端点配置实现。Together AI 公开了其推理系统的具体工程方案,包括缓存策略和内核调优。AI模型DeepSeek V4 ProTogether AIArtificial Analysis1 个信源在谈事件专题推荐理由:Together AI 把 DeepSeek V4 Pro 调到了速度与延迟双第一,还公开了优化方法,搞推理部署的值得看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
13:13官方账号Together AI@togethercompute精选Together AI的Rish Bhargava在推文中指出,部署语音智能体时延迟超过500ms用户会注意到,超过1秒用户会挂断。他详细分析了整个管道,包括75ms网络延迟为何增加30%开销,以及通过共置所有组件可将延迟降至5ms。推文附有链接,可能提供更深入的技术细节。技巧语音智能体延迟优化Together AI推荐理由:语音智能体延迟优化实战原文稍后读已读值得跟进有用关注 语音智能体
10:53官方账号Together AI@togethercompute精选MiniMax 发布开源权重原生多模态模型 MiniMax-M3,具备 1M 上下文窗口和 MiniMax 稀疏注意力机制。模型提供思考与非思考两种模式。Together AI 作为首选云合作伙伴,通过推理优化在并发场景下实现高达 125% 的吞吐量提升。AI模型MiniMax-M3Together AI多模态7 个信源在谈事件专题推荐理由:MiniMax 新模型上线,吞吐量提升 125%原文稍后读已读值得跟进有用关注 MiniMax-M3
09:48官方账号Together AI@togethercompute精选Together AI 发布了基于 Blackwell 的推理引擎,在 AgentPerf 基准测试中,其 TPS 比次快的开源引擎高出 31%。该引擎通过为 Blackwell 的 Tensor Core 指令定制内核实现性能提升。Cursor 已将其实时编程助手部署在该推理栈上。Together AI 在推文中详细介绍了构建过程。AI模型Together AIBlackwell推理引擎4 个信源在谈事件专题推荐理由:Blackwell 上推理快了 31%原文稍后读已读值得跟进有用关注 Together AI
11:55官方账号Together AI@togethercompute精选Together AI 的前沿智能体负责人 James Zou 在 EinsteinArena 中分享了智能体如何推动开放科学问题的重大进展。他强调了智能体在解决复杂科学问题上的能力提升,特别是在开放科学领域。这一进展展示了 AI 智能体在科学研究中的实际应用潜力,为科研人员提供了新的工具和方法。AI产品智能体开放科学Together AI推荐理由:做开放科学或 AI 智能体研究的开发者可以看看,智能体在科学问题上的突破可能改变你的研究方式。原文稍后读已读值得跟进有用关注 智能体
07:01官方账号Together AI@togethercompute精选Together AI 团队提出 Untied Ulysses 方法,解决了长上下文训练中的显存瓶颈。传统方法在单节点 8xH100 上训练 Llama 3B 模型时,仅模型参数就会耗尽显存,无法支持 3M token 的上下文长度。新方法通过优化注意力机制,在 8B 和 32B 规模下实现了比先前实现长 25% 的序列训练。这项研究让大模型长上下文训练变得更可行,降低了硬件门槛。论文长上下文显存优化注意力机制推荐理由:长上下文训练一直是显存大户,Untied Ulysses 让单节点就能跑 3M token,做 LLM 训练和推理优化的团队值得关注,能省下不少 GPU 预算。原文稍后读已读值得跟进有用关注 长上下文
08:00官方账号Together AI@togethercompute精选Cursor 与 Together AI 合作,为 AI 编程助手提供实时推理基础设施。Cursor 的编辑器内智能体能在开发者编辑代码时生成代码,要求响应必须在编辑器的反馈循环内完成。Together AI 构建了满足严格延迟目标的基础设施,确保大规模下的实时性能。这一合作解决了 AI 编程中响应速度的关键瓶颈,让开发者获得更流畅的交互体验。AI产品CursorTogether AIAI编程助手6 个信源在谈事件专题推荐理由:AI 编程工具的实时性直接决定开发效率,Cursor 用户和关注 AI 编程的团队值得了解 Together AI 如何解决延迟痛点。原文稍后读已读值得跟进有用关注 Cursor
03:02官方账号Together AI@togethercomputeTogether AI 宣布已通过 ISO 27001:2022 认证,由 A-LIGN(ANAB 认可)完成对其信息安全管理体系的数月审计。认证覆盖客户数据保护、访问控制、安全开发和事件响应等关键领域。这标志着 Together AI 在数据安全和合规方面达到国际标准,增强了企业客户对其云服务的信任。详情可查看其博客和官网。行业Together AIISO 27001数据安全推荐理由:对于使用 Together AI 云服务的企业团队,这项认证意味着数据保护和安全合规有了国际背书,建议关注其安全实践细节。原文稍后读已读值得跟进有用关注 Together AI
17:27官方账号Together AI@togethercompute精选DeepCogito团队需要为其前沿推理模型实现低于500毫秒的首令牌时间,并支持每分钟1000+请求。Together AI提供了解决方案,满足了这一严苛的性能要求。DeepCogito团队分享了在创业公司时间线上构建前沿模型的经验。这展示了AI基础设施提供商如何帮助初创企业实现高性能推理。AI产品推理模型Together AIDeepCogito推荐理由:做推理模型部署的团队会关心这个案例——Together AI帮DeepCogito在创业节奏下实现了500ms首令牌延迟,值得点开看看他们怎么做到的。原文稍后读已读值得跟进有用关注 推理模型
17:26官方账号Together AI@togethercomputeTogether AI 宣布与云分销商 Pax8 合作,将高性能、低成本的 AI 基础设施和领先的开源模型带给全球中小企业。此举打破了 AI 资源被大公司垄断的局面,使中小企业也能利用先进的 AI 技术。合作将通过 Pax8 的渠道网络,让更多企业轻松获取 Together AI 的模型和服务。行业AI 基础设施开源模型中小企业推荐理由:中小企业终于能低成本用上顶级 AI 基础设施,做技术选型或预算有限的团队可以直接关注。原文稍后读已读值得跟进有用关注 AI 基础设施
03:02官方账号Together AI@togethercomputeTogether AI 宣布推出 Ideogram 4,一款专为设计场景打造的开源图像模型。该模型具备强大的文字渲染能力、布局控制功能,并原生支持 2K 图像生成。AI 原生用户现可通过 Together Serverless Inference 在创意生产工作流中使用 Ideogram 4。这一发布为设计师和开发者提供了更可控、高质量的开源图像生成方案。AI产品图像生成开源/仓库设计工具推荐理由:做设计或创意生产的团队终于有了开源的高质量图像模型——Ideogram 4 的文字渲染和布局控制解决了 AI 图像生成的常见痛点,建议设计师和 AI 开发者直接上手试试。原文稍后读已读值得跟进有用关注 图像生成
21:46官方账号Together AI@togethercomputeTogether AI 宣布在其平台上推出两款 NVIDIA Nemotron 模型:Nemotron 3 Ultra 专为高吞吐量的智能体工作负载设计,适合构建编码智能体和深度研究智能体;Nemotron 3.5 ASR 则专注于低延迟的多语言语音识别,适用于实时语音系统。这为 AI 原生开发者提供了在 AI Native Cloud 上构建复杂应用的新选择,降低了部署门槛。AI产品NVIDIA NemotronTogether AI智能体10 个信源在谈事件专题推荐理由:做智能体或语音应用的开发者现在有了更专业的模型选择——Nemotron 3 Ultra 适合高并发任务,Nemotron 3.5 ASR 能直接用于多语言实时语音场景,值得在 Together AI 上试试。原文稍后读已读值得跟进有用关注 NVIDIA Nemotron
11:16官方账号Together AI@togethercompute精选MiniMax 的最新模型 M3 已正式上线,并由 Together AI 提供推理基础设施支持。双方将于明天太平洋时间下午6点在 X Spaces 进行深度对话,分享模型和基础设施的细节。这一合作意味着 M3 模型将获得高性能的推理服务,对开发者来说是一个值得关注的进展。AI模型MiniMaxM3Together AI推荐理由:MiniMax M3 上线并由 Together AI 支持推理,意味着模型推理性能有保障,做 AI 应用开发的团队可以直接试用,值得关注。原文稍后读已读值得跟进有用关注 MiniMax
19:35官方账号Together AI@togethercomputeTogether AI 的两位副总裁 Dan Fu 和 Sarung 在 NVIDIA GTC 大会上参加了辣翅挑战,一边吃辣翅一边回答 AI 相关问题。视频展示了他们在辛辣刺激下的真实反应和即兴回答,既有技术讨论也有趣味互动。这个活动以轻松的方式展现了 AI 领域高管的个性和幽默感,同时传递了 Together AI 在 AI 基础设施方面的观点。行业NVIDIA GTCTogether AIAI 行业9 个信源在谈事件专题推荐理由:想看 AI 大佬被辣到冒汗还要聊技术?这个视频把严肃的 GTC 变成了欢乐现场,做 AI 社区运营或喜欢行业趣闻的值得点开,看完会笑出声。原文稍后读已读值得跟进有用关注 NVIDIA GTC
04:17官方账号Together AI@togethercompute72°Together AI 推出了目前最快的两个语音转文字(STT)模型,其中 NVIDIA Parakeet-TDT 0.6B v3 能在 10 秒内转录 20 小时的语音。该模型基于 TensorRT 优化、条件 CUDA 图、事件驱动 I/O 和共享内存等技术实现极致性能。这一进展大幅降低了大规模语音转录的延迟和成本,对需要实时或批量处理语音的团队意义重大。Together AI 通过系统级优化展示了 STT 模型在推理速度上的新标杆。AI产品语音转文字NVIDIA Parakeet-TDTTogether AI5 个信源在谈事件专题推荐理由:语音转录速度提升了一个数量级,做实时语音应用或大规模音频处理的团队可以直接用上,省下不少时间和算力成本。原文稍后读已读值得跟进有用关注 语音转文字
08:39官方账号Together AI@togethercompute精选Together AI 的 DevRel 团队发布了一篇关于 LLM 推理引擎的入门指南,解释了 tokenization、调度、prefill、decode、KV 缓存、批处理和流式处理等关键组件如何影响 API 调用的速度、可扩展性和生产就绪性。这些底层系统决定了 AI 原生应用的体验质量。对于开发者而言,理解推理引擎有助于优化应用性能和成本。AI产品推理引擎LLM APITogether AI推荐理由:做 AI 原生应用开发的团队,理解推理引擎能帮你优化 API 调用成本和响应速度,建议点开这篇入门指南。原文稍后读已读值得跟进有用关注 推理引擎
05:31官方一手marktechpost@Asif Razzaq72°Together AI 开源了 OSCAR,一种面向长上下文 LLM 推理的 INT2 KV 缓存量化方法。与依赖数据无关的 Hadamard 变换不同,OSCAR 通过离线估计注意力感知的协方差结构,为键和值分别推导旋转矩阵。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 以每 KV 元素 2.28 比特的精度,将 BF16 精度差距分别缩小至 3.78 和 1.42 分。该方法可实现约 8 倍的 KV 内存缩减,并在 100K 上下文长度下带来最高 3 倍的解码加速。AI模型量化KV 缓存长上下文推荐理由:长上下文 LLM 推理的内存瓶颈终于有了实用解法——OSCAR 在 2-bit 量化下几乎不损失精度,做长文档/多轮对话推理的团队可以直接集成,显著降低硬件成本。原文稍后读已读值得跟进有用关注 量化
12:33官方账号Together AI@togethercomputeTogether AI 宣布在其平台上新增 600 多种声音,并集成了 MiniMax Speech 2.8 Turbo 企业级 TTS 模型。该模型专为实时、富有表现力的语音代理设计,支持 AI 原生开发者在其专用基础设施上部署。用户可以直接在语音查找器中试听这些声音。这一更新显著扩展了 Together AI 的语音能力,为构建语音交互应用提供了更多选择。AI产品TTS语音代理MiniMax推荐理由:做语音代理或实时对话应用的开发者,现在有 600+ 声音可选,且能直接在企业级基础设施上部署 MiniMax 模型,值得试试语音查找器里的新声音。原文稍后读已读值得跟进有用关注 TTS
04:40官方账号Together AI@togethercompute76°Together AI 的 VP of Kernels 指出,当前推理基准测试与生产负载不匹配。针对多并发编码智能体(每个上下文 45k-200k token)的真实场景,Together AI 的推理引擎在 KV 缓存、调度器限制和吞吐量方面进行了优化。测试结果显示,其 TPS 比最快的开源引擎高 31%,饱和状态下首 token 时间快 2 倍,每请求成本比 Claude Opus 4.6 低 76%。这为运行大规模 AI 智能体的团队提供了更高效、更低成本的推理方案。AI产品推理引擎Together AIKV 缓存推荐理由:做多智能体编码或高并发推理的团队,终于有基准测试对准真实负载了——Together AI 的引擎在成本和速度上都有明显优势,值得跑一下自己的场景试试。原文稍后读已读值得跟进有用关注 推理引擎
17:28官方账号Together AI@togethercompute78°Cursor 团队发布了 Composer 2.5,这是一款面向智能体编程的模型,标志着编程助手领域的重要进展。Together AI 作为 AI 原生云服务商,参与了此次合作发布。Composer 2.5 在速度和生成质量上表现突出,正在引领编程智能体的新潮流。AI产品编程助手智能体Cursor10 个信源在谈事件专题推荐理由:编程开发者和 AI 编程工具用户值得关注——Composer 2.5 提升了智能体编程的速度和质量,做自动化代码生成的团队可以直接体验。原文稍后读已读值得跟进有用关注 编程助手
01:17官方账号Together AI@togethercomputeTogether AI 宣布上线 Gemma-4-31B-it-Pearl 模型,这是 Pearl Research Labs 基于 Gemma 4 31B 进行指令微调的版本,采用了 @prlnet 的 Proof of Useful Work 协议。该模型现已作为无服务器推理端点提供,价格比标准版低 25% 以上。对于需要高效、低成本部署大模型的 AI 开发者来说,这是一个值得关注的新选择。AI产品Gemma-4-31B-it-PearlTogether AI推理模型推荐理由:做模型推理部署的团队可以关注这个价格优势——同样基于 Gemma 4 31B,但成本直降 25%+,适合预算敏感的生产环境。原文稍后读已读值得跟进有用关注 Gemma-4-31B-it-Pearl
10:06berryxia@berryxiaViolin 是一个视频翻译项目,现在支持直接安装为 Claude Code skill,简化了使用流程。用户只需运行 `violin --install-skill` 即可安装,之后可通过 `violin input.mp4 output_zh.mp4 --language Chinese` 命令直接使用。该项目需要从官网注册获取 Key,支持 Together AI、OpenAI、ElevenLabs 等平台。默认使用 Together AI,需设置环境变量 `TOGETHER_API_KEY`。AI产品视频翻译Claude Codeskill10 个信源在谈事件专题推荐理由:视频翻译工作流被大幅简化,做多语言内容处理的团队可以直接在 Claude Code 里调用,省去手动配置的麻烦,建议试试。原文稍后读已读值得跟进有用关注 视频翻译
09:23官方账号Together AI@togethercomputeTogether AI 的语音转文本(STT)模型在 Artificial Analysis 排行榜上包揽了转写速度的前两名。其中 NVIDIA Parakeet TDT 0.6B V3 排名第一,每秒可处理 303 秒音频,速度最快。该模型每 1000 分钟音频仅需 1.50 美元,在三个真实数据集上的平均词错误率为 4.6%。对于构建实时语音助手的 AI 开发者来说,快速 STT 是核心基础设施,Together AI 的云服务能帮助团队降低转录、推理和响应的整体延迟。AI产品语音转文本Together AINVIDIA Parakeet推荐理由:实时语音助手开发者终于有了速度最快的 STT 模型——每秒处理 303 秒音频,成本还低,做语音交互的团队可以直接在 Together AI 上试试。原文稍后读已读值得跟进有用关注 语音转文本
07:09官方账号Together AI@togethercomputeTogether AI 研究团队将有七篇论文在 MLSys 2026 会议上发表,展示从研究到生产的 AI 原生云平台成果。这些论文涵盖 AI 系统优化、模型部署效率等关键领域,体现了 Together AI 在 AI 基础设施方面的技术积累。MLSys 是机器学习系统领域的顶级会议,入选多篇论文说明其技术实力获得学术界认可。行业MLSys 2026AI 基础设施系统优化推荐理由:做 AI 基础设施和模型部署的团队值得关注——Together AI 这七篇论文覆盖了从研究到落地的关键环节,能帮你了解当前 AI 系统优化的前沿方向。原文稍后读已读值得跟进有用关注 MLSys 2026
07:06官方账号Together AI@togethercomputeTogether AI 宣布在其平台上推出 Rime Mist v3,这是一系列面向生产环境的文本转语音(TTS)模型。该模型专注于确定性发音和可控语音输出,解决了语音合成中常见的不一致问题。AI 原生开发者现在可以在 Together AI 的专用基础设施上部署 Mist v3,用于需要大规模一致语音输出的企业级语音代理。这为构建可靠、可定制的语音交互系统提供了新的选择。AI产品文本转语音TTS语音代理推荐理由:做语音代理和 TTS 应用的团队终于有了一个能保证发音一致性的生产级模型,直接在 Together AI 上就能部署,省去自己调教的麻烦,值得试试。原文稍后读已读值得跟进有用关注 文本转语音
03:42官方账号Together AI@togethercomputeTogether AI发布了Voice Finder工具,支持搜索、筛选和试听超过600种语音,覆盖主流TTS模型。用户可以通过描述需求或上传音频样本来快速找到适合应用的声音,显著提升AI语音应用的开发效率。该工具旨在帮助AI开发者更高效地集成语音功能,减少手动筛选的时间成本,推动语音交互应用的普及。AI产品语音合成TTS模型搜索推荐理由:该工具简化了语音选择流程,对开发者构建语音应用有直接帮助,尤其适用于需要多选项测试的场景。原文稍后读已读值得跟进有用关注 语音合成
21:55官方账号Together AI@togethercomputeTogether AI在X平台发布了一款新的开源工具包,旨在简化AI模型的训练和部署流程。该工具包支持多种主流模型架构,并提供了优化后的分布式训练功能。这一发布有助于降低中小团队使用大模型的门槛,推动AI技术的普及。AI产品开源/仓库模型训练Together AI推荐理由:对于AI开发者和研究团队,该工具包提供了实用功能,可提升模型开发效率,值得关注其后续更新。原文稍后读已读值得跟进有用关注 开源/仓库
21:55官方账号Together AI@togethercompute75°DeepSeek V4 Pro在Together AI无服务器平台上发布,具备长上下文推理能力和领先的编程性能。该模型通过KV缓存、前缀重用、混合注意力、批处理、内核优化和端点配置等技术实现高效服务。来自@zhyncs42、@realDanFu等人的深入分析揭示了其技术细节。AI模型推理模型开源/仓库Together AI推荐理由:DeepSeek V4 Pro在长上下文推理和编程任务上的表现达到SOTA,同时其高效服务技术栈的公开分析对AI部署实践有重要参考价值。原文稍后读已读值得跟进有用关注 推理模型
21:55官方账号Together AI@togethercomputeYutori AI的浏览器代理产品(Scouts、Delegate、Navigator)基于Together AI推理平台运行,实现了相比前沿模型每步2倍的速度提升、4-5倍的推理成本降低,并保持99.9%的可用性与弹性扩展。这展示了在AI代理场景中,推理基础设施对产品性能的关键作用。AI产品智能体推理模型Together AI推荐理由:该案例说明了在浏览器AI代理这类高频率模型调用的场景下,专用推理基础设施可显著提升性能并降低成本,对AI代理产品落地具有参考价值。原文稍后读已读值得跟进有用关注 智能体
22:17官方账号Together AI@togethercomputeTogether AI 推理高级总监 Yineng Zhang 将于 5 月 16 日在 PyCon US 发表演讲,主题为生产环境中 LLM 推理的实战经验。他将讲解 Python 在推理运行时优化中的实际作用、真实部署中遇到的挑战及解决方案,以及大规模推理引擎的新设计方向。该演讲定于美国时间 5 月 16 日 17:00-17:30 在 Grand Ballroom A 举行,适合正在优化推理性能的从业者关注。行业LLM推理生产部署Python推荐理由:该演讲聚焦于真实部署中的推理优化和引擎设计,对于从事 LLM 服务化、推理加速的工程师和架构师具有直接参考价值。原文稍后读已读值得跟进有用关注 LLM推理
22:17官方账号Together AI@togethercomputeTogether AI宣布其AI Native Cloud平台现在支持直接从Hugging Face部署任何模型,无需繁琐设置。用户只需单次会话即可运行模型,大幅降低了从“看起来不错”到“实际运行”的门槛。此举旨在简化AI模型部署流程,提升开发者和企业的实验效率。关键点是平台兼容所有Hugging Face模型,且强调零设置体验。AI产品AI平台部署Hugging Face推荐理由:这代表AI基础设施服务商正进一步降低模型部署门槛,对于需要快速实验和迭代的AI开发团队来说,此举能显著减少从发现模型到生产环境的时间成本,推动更广泛的模型应用。原文稍后读已读值得跟进有用关注 AI平台