
吴家骥 教授
西安电子科技大学,电子工程学院
邮箱:wujj(a)mail.xidian.edu.cn
欢迎:对 AI 应用产品、工具链、开源生态、AI for Science 感兴趣的同学

LLM Agent RL Lab
复现和拆解前沿 LLM 强化学习算法,用更简单的代码和更低的 GPU 门槛,把 GRPO、OPD、OPSD、GSPO、DAPO、Search-R1、ReTool、Slime 等方法跑起来,方便复现。
面向真实科研与产业问题,探索大模型、AI 工具链与开源协作;
指导学生把研究做成真正可用、能够产生影响的产品。
一个专业、现代化设计的AI训练分析平台
面向模型训练团队,与50+主流框架集成,与你的实验代码轻松结合
SwanLab-Skill 指导 Claude Code、Codex 和其他编码代理使用 SwanLab AI 训练实验跟踪平台的skill——包括编写跟踪代码和查询实验数据。
没有本地 GPU?没关系!
PyTRIO 把 LLM 后训练丢到云端执行,你只需要写数据、算法和训练循环。
PyTRIO-Skill 让 Agent 正确使用 PyTRIO 写 SFT、GRPO、OPD、DPO、推理和实验记录代码。
这个 Skill 会让 Claude Code、Codex 等 Agent 先按任务读取 SFT、GRPO、OPD、DPO/custom loss的本地能力说明,再参考内置示例生成代码,避免把 PyTorch / HuggingFace 的习惯误套到 PyTRIO 上。