建议:既然可以蒸馏模型,也可以蒸馏智能体框架
Swyx在X平台上提出了一条建议,认为模型蒸馏技术可以扩展到智能体框架的蒸馏。推文暗示智能体框架可以像大型语言模型一样被压缩。没有提供更多细节或具体案例。
Loading / 加载中
Thinkgap 信息流
Swyx在X平台上提出了一条建议,认为模型蒸馏技术可以扩展到智能体框架的蒸馏。推文暗示智能体框架可以像大型语言模型一样被压缩。没有提供更多细节或具体案例。
CTGT 采用 DeepSeek V4 Flash 作为教师,将 GPT-OSS-120B 蒸馏用于金融任务,在 8k 令牌预算下取得 FinanceReasoning 上 83.61% 的分数,超越 Kimi K3 和 Inkling。他们通过 152 对匹配的政治提示,由四位 LLM 评委评分,测量审查传递性;教师模型在中国敏感话题上的回避偏差达 +45.45 分(距偶然 7 个标准差),而所有蒸馏学生与其美国基座的行为差距均小于 1 分,审查未传递。CTGT 开源了评估框架 LineageEval、20B 金融模型权重以及一个并行测试平台。下一步计划在 Qwen 等中国血统的基础上开展类似实验。
一篇研究论文提出了 CoRT 方法,该方法利用反事实回放实现词元级、评分规则引导的策略优化。其目标是让语言模型的输出对齐细粒度的词元级评分标准。分享的内容中未提供实现细节或基准测试结果。
CoRT 提出一种面向评分准则引导的强化学习的标记级信用分配方法。它解决了GRPO中评分反馈被压缩为单一标量奖励的局限,改为对每个标记进行细粒度的信用分配。这使得模型能够在标记级别上从详细的评分准则评估中学习。
Andrew Ho宣布在OpenAI任职八个月后离职,并创办一家新公司,专注于生产高质量的强化学习数据集。他指出大型语言模型泛化能力差,现有数据未能很好地呈现经济生产力相关的任务,并预测前沿实验室将需要投入超过1000亿美元进行精准数据采集。公司首批产品聚焦生物学和统计推理:基于GeneBench-Pro的长周期科学推理数据集(GPT-5.6 Sol通过率仅略高于30%),目标将可靠性提升至90%以上;以及覆盖日常科学任务的多模态数据集,如分析细胞培养皿或Western blot图像。后续计划拓展至化学、材料科学、医疗和白领办公领域。