执行结果优先
真实测试通过率是主信号,直接约束代码正确性。
EVIDENCE REPORT · CODE GENERATION
从四步计划 SFT,到 K=16 Monte Carlo rollout、过程奖励模型与 veRL GRPO。 这是一份基于幸存文件重建的工程报告:展示真实完成的工作,也清楚标出证据无法覆盖的部分。
01 · PIPELINE
每个阶段都保留输入、输出或工程证据;历史计划与实际执行严格分开。
将题目转成“四步计划 + Python 代码”的监督样本,建立结构化推理起点。
固定计划前缀,对每个 reasoning step 执行 K=16 次续写,用测试通过率构造过程监督。
以 step 成功率训练 value head,后期不让 PRM 独立主导,而是通过 ORM gate 限制其影响。
将可执行代码测试作为 ORM,叠加 gated PRM 与安全门控,完成至少一次有效训练。
02 · REWARD
最终实现不是历史配置里的简单线性加权,而是一套带质量门控与安全门控的组合。
PROCESS AGGREGATION
PRM = 0.1·s₁ + 0.2·s₂ + 0.3·s₃ + 0.4·s₄
GATED REWARD
prm_gate = 0.4 + 0.6·ORM
safety_gate = safety > 0 ? 1.0 : 0.25
R = 0.8·ORM + 0.2·PRM·prm_gate·safety_gate
真实测试通过率是主信号,直接约束代码正确性。
ORM 较低时,PRM 贡献同步下降,避免漂亮过程掩盖错误答案。
安全检查失败时,过程奖励通路被降至四分之一。
03 · VERIFIED RESULTS
三份评测均为 32 个 HumanEval 与 500 个 MBPP;总体指标不支持夸大结论。
SFT baseline
54.14%总体 · 288 / 532GRPO step 20
53.57%总体 · 285 / 532Unknown candidate
53.95%总体 · 287 / 532GRPO step 20 在 HumanEval 子集上由 71.88% 提升到 75.00%;完整 532 题总体通过率没有超过 SFT baseline。
未完成 A/B/C/D 多组、多 seed 正式消融;未知候选模型没有 checkpoint 身份,不能作为归因结果。
04 · ARTIFACTS
Qwen2.5-Coder-7B · rank 16 · 约 154 MiB
打开仓库 ↗ DATASETsplits、SFT、MC、GRPO Parquet、评测与 reward debug
打开仓库 ↗最终 GRPO adapter、合并模型,以及 PRM 的 adapter_model.safetensors。
已保留路径与日志证据