阿里云在墨尔本峰会上亮出了Qwen、WonderClip和MuleRun三款产品,想知道他们给澳新市场带了什么AI工具,看这个就够了。
#Qwen
Ben Thompson提出了一个实际解决蒸馏禁令与训练数据版权矛盾的方案,同时还能帮美国开源模型对抗中国对手,值得一看。
阿里把2.4万亿参数的Qwen 3.8开源了,预览版现在就能玩,性能只比Fable 5差一点。想试试顶级开源大模型千万别错过。
LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
Apple 和 Alibaba 联手,把 Qwen 模型装进 iPhone,中国用户能用上 Apple Intelligence 了。
想给 Claude Science 换个模型后端?试试 CS Native,它让你在隔离沙箱里调用 DeepSeek、Qwen 或 OpenAI,还不丢官方入口。
Alibaba Cloud 要在 Raise Summit 现场演示 Qwen 和智能体基础设施,想了解云上 Agent 方案可以看看
这篇论文搞清楚了Transformer线性化为什么delta式更厉害,还给出了具体修补方案,在LLaMA和Qwen上跑到了32B,MMLU成绩比之前的后验方法好。
Anthropic 居然拿 Qwen 做了个可解释性演示,还和 Neuronpedia 搞了个在线版,你去试试看神经元怎么工作的。
Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
这篇论文搞了个标准协议EPC,专门用来测LLM代理系统里评估器偏好怎么耦合的,还附带了GPT-4o、Qwen、DeepSeek等8个评估器的大规模实测数据,方便你复现和对比。
这篇论文说清了为什么RMSNorm模型用排列对齐不够,必须考虑符号。实验数据很具体,SAE重建、情感引导效果对比鲜明,对做模型对齐和可解释性的人很有用。
Lindy、Cursor、Coinbase这些大厂都在把AI任务切到DeepSeek、Kimi、Qwen上,连微软都在测试DeepSeek V4,中国模型在西方变主流了。