#Qwen3
Locus这个自动化系统后训练的模型居然干过了人类调的Qwen3 1.7B,在PostTrainBench上拿了第一,还上了Kaggle奖金赛前排。
这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。
想用LLM做实体匹配?这篇论文用Qwen3对比了bi-encoder、cross-encoder和生成式三种架构,告诉你不同场景选什么最靠谱,还公开了代码和实验数据。
用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。
OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。
教你用Colab单GPU跑Qwen3-0.6B的LoRA微调,全程实操,从环境配置到API调用都有,适合想上手NeMo的低资源玩家。
宝玉分享了用 Qwen3 ASR 替代 Whisper 做字幕的心得,时间戳对得很准,还配了发言人识别方案,适合搞视频翻译的朋友。
想在家跑AI大模型?这篇对比了RTX 5090和AMD迷你PC,解释了为什么统一内存能装大模型但速度慢,还教你用MoE模型提速。
想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。
JADR协议能从模型内部直接测出危险识别能力,不用外部裁判,还能对比Qwen3和Gemma 2在不同量化下的安全表现,挺实用。
AMD给vLLM生态的RL训练框架vime加了ROCm支持,现在你的Qwen3-8B在MI355X上能跑到4100 tokens/gpu/s,训练和rollout的logprob很稳,还直接提供预构建容器,省去编译麻烦。
这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。
用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。
PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。
极摩客发了款迷你主机,锐龙AI Max+ 395,126TOPS算力能本地跑235B模型,性能比RTX 4090还猛,21699元起。
这篇论文提出了MAST,一种更精准的模型遗忘方法,在Qwen2.5和Qwen3上只遗忘你想忘的,保留数学能力不掉。适合研究模型编辑或推理安全的同学。
想知道怎么用CoT提示检测政治回避?这篇论文拿Grok-4-Fast跑出了0.51的F1,比微调Qwen3强,还分析了怎么设计提示最有效。
苹果端侧 AI 架构迎来重大更新,CoreAI 在小模型推理上显著提速,做本地 AI 应用或模型部署的开发者值得关注,尤其是 M4 Mac 用户可以直接感受到更快的响应。