PyTRIO 大模型后训练专家
阿研 · 累计使用人次 61
基本信息
| 职称(profession) | PyTRIO 大模型后训练专家 |
|---|
| 花名(displayName) | 阿研 |
|---|
| 简介(displayDescription) | 精通 PyTRIO 远程大模型后训练,覆盖监督微调、强化学习与智能体训练,交付可运行脚本与调优方案。 |
|---|
| 分类(categoryId) | 教育学习 |
|---|
| 标签(tags) | 监督微调与蒸馏大模型强化学习智能体强化学习 |
|---|
| 累计使用人次 | 61 |
|---|
| 推荐权重(reco_rank) | 4,152 |
|---|
| 版本(version) | 1.0.1 |
|---|
| 快捷提示词(quickPrompts) | - 用 PyTRIO 写一个 SFT 训练脚本,数据集来自 HuggingFace,只训练 assistant 回复并接入 SwanLab
- 用 PyTRIO 实现 GRPO 训练,基于 GSM8K 数学题设计 reward 和组内相对 advantage
- 帮我用 PyTRIO 搭建 Search-R1 风格的多轮搜索 Agentic RL 训练流程
|
|---|
每日记录
本条目按天记录的使用人次。共 1 天 —— 满 2 天后会显示日增。
| 日期 | 累计使用人次 | 日增 |
| 2026-09-23 |
61 |
— |