AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Qwen2.5-Coder

共 6 条相关 AI 资讯
8月9日
02:28
02:28lmarena.ai@lmarena_ai
精选
Trace-and-Amplify(TA)是UCLA博士生@hgzhou42提出的框架,可在无提示条件下大规模收集训练时奖励黑客轨迹。现有监控器在提示诱导黑客数据上准确率高达97.1%,但面对真实训练时黑客仅28.0%。TA训练的监控器将检测准确率从59.98%提升至90.16%,并在未见黑客类型上表现更好。实验基于Qwen2.5-Coder和DeepSeek-Coder,在LeetCode/TACO基准上验证。
AI模型Trace-and-AmplifyQwen2.5-CoderDeepSeek-Coder

推荐理由:UCLA博士生搞了个Trace-and-Amplify,不用诱导就能抓训练时的奖励黑客,准确率从60%提到90%,比老方法强多了。
原文
7月30日
09:22
09:22官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang Liu
MRCoder采用Map-Reduce范式,在Map阶段通过轻量草稿模型和结构感知草稿引导选择(SADGS)筛选信息上下文,在Reduce阶段聚合上下文并利用并行验证加速解码。在CoderEval和DevEval基准上,使用Qwen2.5-Coder和DeepSeek-Coder作为骨干模型时,MRCoder提升了代码生成准确率,同时减少了30%到50%的token消耗,推理时间降低最多52%。该方法相比现有RAG及上下文选择方法更高效地平衡了质量和计算开销。
论文MRCoderQwen2.5-CoderDeepSeek-Coder

推荐理由:MRCoder用Map-Reduce思路解决仓库级代码生成的上下文选择难题,比现有RAG方法节省30-50% token,推理快52%,在CoderEval和DevEval上准确率更高。
原文
7月21日
10:01
10:01官方账号arXiv cs.AI@Yunze Han
研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。
论文Qwen2.5-CoderLoRASWE-trajectory

推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。
原文
6月19日
09:35
09:35官方一手arXiv: DeepSeek@Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang
该论文提出了SolidityBench,包含5,470个存储库级Solidity智能合约及其自然语言描述。同时提出SolidityScore,一种关注安全性修饰符、合约声明等域关键结构的语义度量。研究评估了Qwen2.5-Coder、DeepSeek-Coder和CodeLlama等模型在零样本、思维链、上下文学习、检索增强生成和监督微调五种方法上的表现。结果显示,通用模型在存储库级Solidity生成中存在结构性缺陷;在非参数方法中,检索增强生成效果最佳,而上下文学习在超过两个示例后因上下文饱和而性能下降;监督微调通过将Solidity特定约束内化到模型参数中实现了最大改进。
论文SoliditySolidityBenchSolidityScore

推荐理由:这篇论文为Solidity智能合约代码生成建了个新基准(5470个合约)和专用评分指标,测试了多个主流代码模型的各种方法,结论明确:靠谱的领域数据+微调最管用。
原文
6月16日
19:02
19:02kimmonismus@kimmonismus
VibeThinker-3B是仅3B参数的小模型,在AIME26上取得94.3分,在LiveCodeBench v6上Pass@1达80.2,在未见过的LeetCode比赛中正确率96.1%。其训练基于Qwen2.5-Coder,结合课程SFT、多领域RL、离线自蒸馏和最终RL指导阶段。结果表明,部分可验证推理能力可被高效压缩到小密集模型中。
AI模型VibeThinker-3BQwen2.5-Coder推理模型

推荐理由:3B的小模型在数学和代码推理上快追上大模型了,适合部署在低算力场景,值得关注。
原文
5月20日
10:38
10:38官方账号arXiv cs.AI@Isaac David, Arthur Gervais
精选
该研究通过构建包含30个本地漏洞分析任务的轨迹基准,比较了Gemma 4 31B、Gemma 4 26B A4B、Qwen2.5-Coder 7B和Llama 3.1 8B等模型及其未审查/去对齐变体在自主安全智能体场景下的表现。结果显示,Gemma模型的去对齐版本在安全任务上成功率显著提升(31B从0.7%升至14.0%,26B从0.0%升至10.7%),且拒绝率、抑制动作率和危险动作率均为0。但非Gemma模型未呈现一致的去对齐增益,Qwen2.5-Coder去对齐版本成功率反而下降(2.0% vs 5.3%),去对齐的Llama变体则无法通过工具协议。研究强调,安全对齐效果应在系统层面测量,区分拒绝率、不安全动作、工具可靠性和证据基础,而非仅依赖拒绝率。
论文安全智能体安全对齐Gemma 4
事件专题

推荐理由:安全智能体开发者需要了解:去对齐模型在漏洞分析任务上可能提升成功率,但效果因模型而异,且硬核漏洞验证任务仍未解决。建议点开查看具体轨迹数据和任务分类,避免盲目采用去对齐策略。
原文
精选全部日报登录