Apple · 机器学习研究·· 4 天前AI 评分51
Apple 提出 RLTL;DR:通过内化自生成反馈实现自我改进
RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback
AI 导读
Apple 研究人员提出 RLTL;DR 方法,让模型在任务失败后生成 TL;DR 洞察作为自我反馈,并在后续尝试中利用这些洞察,最终内化出从任务到洞察的直接映射。
来源:Apple · 机器学习研究 · machinelearning.apple.com