最新文章
XSKILL 不更新模型参数,而是从多模态 Agent 的历史执行轨迹中抽取 Experience 和 Skill,构建外部知识库,让 Agent 在新任务中通过检索、改写和注入持续提升工具使用效率与工具编排能力。
多模态 约 24 分钟
模型学习新东西时,很容易忘掉旧东西;多模态模型不仅会忘旧任务,还可能忘掉“图像和文字原本怎么对应”,“不同模态哪个更可靠”,“预训练模型原本会的零样本能力”等更复杂的知识。
多模态 约 27 分钟
从prompt到context再到harness,本质是编写代码,为模型提供一个可操作的环境,作为harness工程师,真正的工作是实现工具、策划知识、管理上下文、控制权限、收集任务过程数据。
Agent 约 8 分钟
历时一周时间,速刷了一遍leetcode hot100,记录了一些自己的题目解答思路,以及标准答案是如何实现的(主要参考python的灵茶)
秋招 约 65 分钟
使用verl框架,gspo算法,采用gpt-5-mini对采样路径进行打分作为reward,训练qwen3.5模型的function calling能力
强化学习 约 18 分钟