ai.hackcv
自然语言处理 · 大模型、推理与对齐
论文精选 83

Last Translation Benchmark· 最后的翻译基准测试

For scientific progress, we need benchmarks that test the limits of state-of-the-art model…

领域:cs.CL作者:Vilém Zouhar、Niyati Bafna、Mukund Choudhary
📎 arXiv🕒 09-04 01:54🔗 arxiv.org
论文精选 82

The Rise of Verbal Reinforcement Learning· 口头强化学习的兴起

Natural language is emerging as a primary feedback channel for improving language agents, …

领域:cs.CL作者:Kshitij Tayal、Arun Sharma、Genta Indra Winata
📎 arXiv🕒 09-02 01:58🔗 arxiv.org
论文精选 83

TTPO: Test-Time Policy Optimization· 测试时策略优化

Recent prominent post-training methods, such as Reinforcement Learning (RL) and On-Policy …

领域:cs.CL作者:Aozhe Wang、Zhengxi Lu、Jianze Wang
📎 arXiv🕒 08-28 01:58🔗 arxiv.org
论文精选 75

Prefix Sliding for efficient test-time scaling· Prefix Sliding:高效的测试时扩展方法

Test-time scaling uses extra test-time compute to improve performance, such as letting lan…

领域:cs.CL作者:Niklas Muennighoff、Zhengyang Wang、Zeyi Chen
📎 arXiv🕒 08-27 01:37🔗 arxiv.org