Hugging Face · 每日论文·· 3 天前AI 评分39
从帕累托到偏好:通过 amortized agentic 策略发现实现个性化测试时扩展
From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery
AI 导读
PersonTTS 提出一种 amortized agentic 策略发现框架,用于在测试时扩展中满足用户多维要求(如精度、延迟和推理成本)。该方法通过需求匹配的控制器初始化和源蒸馏的程序化指导,减少重复策略发现的开销,并在 AIME 和 HMMT 上显著优于现有 TTS 基线。跨用户经验复用在相同评估预算下提升了策略质量,同时大幅降低发现代理的时间和成本。
来源:Hugging Face · 每日论文 · huggingface.co