AI can propose. It cannot grade itself.
AI generates solution.py
↓
candidate claims RMSE = 0.000001
↓
VES ignores the claim
↓
Host recomputes RMSE = 真实值
↓
Search improves candidate
[draft0] VERIFIED rmse: 62.428 mae: 47.177 [draft1] VERIFIED rmse: 92.011 mae: 70.225 [improve0] VERIFIED rmse: 204.356 mae: 161.936 [improve1] VERIFIED rmse: 64.323 mae: 48.458 [improve2] VERIFIED rmse: 66.921 mae: 50.554 BEST VERIFIED candidate: 19095aa7 rmse: 62.428 rejected: 0
真实 LLM(deepseek-v4-flash)+ Docker 沙箱 + 宿主独立验证;不伪造任何 improvement。
spaces/ves_modeling_demo/),
因 Hugging Face 免费 CPU 配额暂未线上运行;本地运行:python spaces/ves_modeling_demo/app.py。📦 GitHub:github.com/Zhuchen00123/VES-Modeling
📊 Dataset:California Housing 回归数据
🧩 VES Core:Verified-Executable-Search