8月15日
00:28
00:28官方账号阿里通义 Qwen@Alibaba_Qwen
78°
阿里Qwen团队发布Qwen3.8-Max,总参数2.4T、激活参数95B、上下文窗口1M。该模型为开源权重MoE,编码与智能体能力突出。Together AI作为Day 0发布伙伴,已同步上线推理服务。开发者现可直接在Together AI平台调用该模型。

推荐理由:Qwen3.8-Max刚发布就上了Together AI,2.4T参数的开源MoE,当天就能用,编码和智能体能力都挺强。
8月13日
18:04
18:04官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA Nemotron 3.5 Lightning 已在 Together AI 平台上线。该模型被定位为同类中速度最快的开源模型。它专为常驻型智能体设计,能快速完成高吞吐量的专业工作。
事件专题

推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 开源模型上线 Together AI,跑得最快,适合需要高强度处理任务的智能体。
7月24日
05:38
05:38官方账号Together AI@togethercompute
Kimi K3 模型将于7月27日通过 Together AI 平台上线,用户可在发布当天立即使用其推理服务。该服务支持编程、智能体以及生产负载等场景。Together AI 提供高性能推理基础设施,使开发者能第一时间体验 Kimi K3。
事件专题

推荐理由:Kimi K3 马上就能在 Together AI 上用了,7月27日当天就能跑编程和智能体任务,想抢先体验的快去试试。
7月22日
17:41
17:38
17:38官方账号Together AI@togethercompute
81°
Together AI 和 Y Combinator 联合推出首个专为 YC 投资组合初创公司设计的 GPU 集群。该集群允许初创公司以几周的承诺期访问算力,取代传统的 24 个月合同。这一变化降低了初创公司获取高性能计算的门槛,加速 AI 模型训练和部署。
事件专题

推荐理由:YC 的初创公司现在可以用几周承诺期拿到 GPU 算力,不用签两年合同, Together AI 这个新集群太实用了。
7月21日
00:24
00:24Y Combinator@ycombinator
YC与Together AI合作推出首个专属YC GPU集群,为YC初创公司提供更便捷的算力资源。Together AI已服务超过8000家客户,包括Cursor、Cognition和ElevenLabs。视频探讨了计算成本持续上升的原因,并给出早期公司的算力规划建议。
事件专题

推荐理由:YC和Together AI给初创公司搞了个专属GPU集群,能便宜又灵活地用算力,想搞AI创业的看看这个视频。
7月19日
04:12
04:12Aravind Srinivas@AravSrinivas
Together AI 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5 的软件工程任务表现。结果显示,Kimi K3 以 Fable 5 约 35% 的价格实现了相同性能,且在更高 pass@k 指标上领先。该分析来自 Together AI 的 Arav Srinivas,数据基于内部测试。
事件专题

推荐理由:想省钱又要强性能?Kimi K3 在编程任务上和 Claude Fable 5 打个平手,价格只要三分之一,高要求场景还更强。
7月18日
01:46
7月17日
08:04
08:04官方账号Together AI@togethercompute
精选
Thinking Machines Lab 联合 Together AI 发布了 Inkling 多模态 MoE 模型。该模型原生支持文本、图像、音频三种输入。它具备可控推理努力机制,允许在推理时动态调整计算量。基于 Together 的 FlashAttention-4 内核优化,显著提升 token 效率。在多个基准上展示了高效推理能力。
事件专题

推荐理由:Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。
00:31
00:31官方账号Together AI@togethercompute
Together AI宣布在生产环境中为Cursor AI提供推理支持,助力其代码生成功能。Cursor AI是一款AI编程助手,Together AI的推理基础设施将提升其响应速度和稳定性。此次合作标志着双方伙伴关系的进一步深化。
事件专题

推荐理由:Together AI给Cursor AI加了推理引擎,编程助手用起来会更顺滑,竞争格局又变了。
7月16日
03:03
03:03官方账号Together AI@togethercompute
Rime Labs 完成 2400 万美元 Series A 轮融资,由 Together AI 等参投。该公司专注于构建 AI 语音层产品,为应用提供语音交互能力。Together AI 将负责托管和推理 Rime 的模型。融资将用于扩大团队和加速产品开发。
推荐理由:Rime Labs 拿了 2400 万美金做 AI 语音层,Together AI 给他们跑模型,想做语音方向可以关注一下。
7月13日
11:17
11:17官方账号Together AI@togethercompute
精选
GLM 5.2 模型在 Together AI 平台部署后,在 Artificial Analysis 评测中输出速度和延迟均获得第一名。该评测覆盖多个主流模型,GLM 5.2 在吞吐量和响应时间指标上表现领先。Together AI 通过优化推理栈使模型达到接近实时的生成速度。

推荐理由:GLM 5.2 在 Together AI 上跑出了最快速度和最低延迟,想用低成本跑推理的话可以去试试这个组合。
11:15
11:15官方账号Together AI@togethercompute
Together AI联合NVIDIA和Lyra Labs,在ICML 2025会议上主办一场炉边谈话,由Tri Dao主持。活动主题聚焦AI研究与基础设施的未来发展。会议将于ICML期间举行,需RSVP参与。
事件专题

推荐理由:Tri Dao带队,Together AI、NVIDIA和Lyra Labs一起聊AI研究走向,ICML现场限定,想去的赶紧RSVP。
11:07
11:07官方账号Together AI@togethercompute
精选
DecagonAI联合创始人在《纽约时报》指出,在Together AI平台上,将任务从闭源模型迁移到开源模型,成本仅为原来的五分之一到七分之一。这一数据展示了开源模型在实际应用中的经济优势。该观点被视为“充足智能”的实践案例。
推荐理由:DecagonAI联合创始人在NYT说,把任务从闭源模型换到Together AI上的开源模型,成本只要原来的五分之一到七分之一,省太多了。
11:00
11:00官方账号Together AI@togethercompute
NVIDIA的开放模型Nemotron 3 Ultra在Together AI上线后迅速获得社区青睐。该模型在OpenRouter平台上的处理量在几天内达到每天350亿token。这反映了社区对快速、高效且可定制开放模型的积极支持。Nemotron 3 Ultra是一款完全可定制的开放模型,由NVIDIA开发。
事件专题

推荐理由:NVIDIA刚推的Nemotron 3 Ultra在Together AI上火了,几天就在OpenRouter冲到每天350亿token用量,社区超爱这种又快又省又好改的开放模型。
7月2日
6月30日
12:35
12:35官方账号Together AI@togethercompute
随着开源模型越来越强,更多AI工作负载向推理市场迁移。Together AI将开源模型转化为生产基础设施,突出速度、成本、可靠性和控制上的竞争力。推理市场的竞争焦点正从模型能力转向交付效率。
推荐理由:开源模型越来越猛,推理市场开始拼速度成本了。Together AI让开源模型直接上生产,值得关注。
6月29日
13:52
13:52官方账号Together AI@togethercompute
开放模型推动AI栈走向模块化,模型、API、工具和推理各自独立进步。Together AI认为开放模型的价值远超定价优势,正在构建模块化推理层。这种架构让不同组件可以独立优化,降低整体AI应用成本。
推荐理由:Together AI聊开放模型不是拼价格,而是拼模块化。他们正在做AI推理层,让模型、工具自由组合。
13:51
13:51官方账号Together AI@togethercompute
在 aiDotEngineer World's Fair 上,James Zou 将展示 EinsteinArena 和 DSGym 两项工作。EinsteinArena 用于多智能体数学发现,DSGym 则为数据科学智能体提供更好的评估。这两项基准旨在推动 AI 在科学协作中的能力。

推荐理由:想知道多智能体怎么一起搞科研、怎么评估数据科学智能体?James Zou 分享了两个新基准,很实用。
13:51
13:51官方账号Together AI@togethercompute
精选
随着Token使用量爆发式增长,模型选择已从技术决策变为产品策略。团队正在测试GLM-5.2等新模型,追求前沿质量与更好的Token经济学。Together AI正在构建面向开源模型未来的推理层,以提供更可控的成本、数据和部署选项。

推荐理由:团队开始用GLM-5.2替换闭源模型?Together AI的推理层让开源模型更可控,想省钱又保质量可以看看。
13:51
13:51官方账号Together AI@togethercompute
Together AI 构建了基于 Parakeet 的语音转文本堆栈,每秒可处理约 302 秒音频,这是 Artificial Analysis 报告中最高速度因子。该堆栈在 Together 平台上运行,通过系统级优化实现低延迟转录。文章由 @FeelTheBeurn 详细拆解了背后的工程工作。

推荐理由:Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。
13:51
13:51官方账号Together AI@togethercompute
GLM-5.2模型在Together AI平台上运行,生成精美Web应用的成本仅需几美分。开发者可以以极低开销探索多个方向、比较不同版本,并保留最佳结果。这显著改变了传统的构建迭代循环,降低了实验门槛。
推荐理由:GLM-5.2在Together AI上几美分就能生成网页应用,开发者可以随便试不同版本,挑最好的,省钱又高效。
13:51
13:51官方账号Together AI@togethercompute
Together AI 工程师将在 AI Engineer World’s Fair 举办 hands-on workshop,讨论 Agentic Coding 如何改变推理引擎需求。workshop 将讲解推理引擎的工作原理及服务生产级 agentic workloads 的要点。活动时间为6月29日上午9-11点,地点在 Room 2020。

推荐理由:想了解 agentic coding 对推理引擎的新要求?Together AI 的这个实操 workshop 直接带你上手,时间是6月29日上午。
13:51
13:51官方账号Together AI@togethercompute
精选
Together AI与5C合作部署NVIDIA GB300 NVL72系统,该系统采用高密度计算、先进冷却和AI优化存储。专为大规模推理和推理任务设计,提升基础设施的算力密度和能效。部署的重点是支撑下一代AI推理需求,尤其是长链推理场景。
事件专题

推荐理由:Together AI和5C搞了套GB300 NVL72,算力密度高、散热好,专门跑大规模推理,适合那种费算力的长推理任务。
6月20日
03:05
03:05官方账号Together AI@togethercompute
88°
OpenAI 的 GPT Image 2 模型现已在 Together AI 的 Serverless Inference 服务中上线。开发者可通过该接口将图像生成与编辑功能集成到多模态应用中。模型支持精准布局控制、可读文本生成以及参考图像引导生成。Together AI 提供无服务器推理能力,无需管理基础设施即可调用。
事件专题

推荐理由:OpenAI 的新图像模型 GPT Image 2 现在能用 Together AI 的无服务器接口调用了,做多模态应用时直接用它生成和编辑图片,支持布局和文字控制,挺方便。
6月19日
18:43
18:43官方账号Together AI@togethercompute
Together AI 在推文中指出,当团队运行数十亿 tokens 时,缓存、吞吐量和服务效率的微小差异会转化为产品级的经济性。以 MiniMax M3 模型为例,该模型在 Together AI 平台上提供前沿品质和开放模型经济学,其服务栈专为规模化设计。这体现了开放模型在生产中的实际成本竞争力。
事件专题

推荐理由:看看 Together AI 怎么用 MiniMax M3 把开放模型做大,跑几十亿 tokens 还省钱。不是吹概念,是实打实的缓存和吞吐量优化。
18:42
18:42官方账号Together AI@togethercompute
Together AI的James Zou与NVIDIA的Venkat Srinivasan将于7月1日在AI Engineer World's Fair上讨论开放模型如何实现集体智能。该活动聚焦开源模型在协作智能系统中的作用。演讲将结合两家公司的技术实践,分析开放模型对多智能体架构的影响。
事件专题

推荐理由:想了解开放模型怎么支撑多智能体协作?Together AI和NVIDIA的人要聊这个,7月1日别错过。
18:41
18:41官方账号Together AI@togethercompute
精选
Zai_org 推出其最新旗舰开源模型 GLM-5.2,支持 1M token 长上下文,可灵活调整推理思考力度。该模型在智能体编程任务上表现更强,现已通过 Together AI 提供推理服务,专为长上下文和工具密集型智能体工作负载优化。

推荐理由:GLM-5.2 支持百万级上下文,还能控制推理深度,搞智能体编程和复杂工具链的可以试试。Together AI 上直接用。