09:39官方账号arXiv cs.AI@Will Badr研究测试了Qwen2.5-3B-Instruct和Phi-3.5-mini模型在HumanEval+和MBPP+基准上的表现。相关提示词能分别挽救36/79和42/101个失败案例,但大多数被挽救的解决方案通过普通采样也能达到。全文本规范解决了24个问题中的22个,而虚拟KV前缀仅解决5-11个。论文Qwen2.5-3B-InstructPhi-3.5-mini代码生成推荐理由:这篇论文揭示了代码生成模型中提示词的实际作用,告诉你哪些提示真正有效,哪些只是表面功夫。原文稍后读已读值得跟进有用关注 Qwen2.5-3B-Instruct