程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
RL训练 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
Shepherd 深度解析:Stanford 把 Git 搬进 AI Agent 运行时——让 Agent 从「能跑」到「可回退、可监督、可训练」的完整实战指南
编程
Shepherd 深度解析:Stanford 把 Git 搬进 AI Agent 运行时——让 Agent 从「能跑」到「可回退、可监督、可训练」的完整实战指南
2026-07-07 13:19:13
Stanford Christopher Manning团队发布Shepherd,把Git式版本控制引入AI Agent运行时:可逆执行轨迹让Agent执行可回退、可分叉、可重放;Syscall Jail把权限约束压到OS内核层物理不可绕过;Tree-GRPO让RL训练翻倍加速。完整实战+代码示例。
Shepherd
AI Agent
Meta-Agent
Git
Stanford
可逆执行
RL训练
Agent工程
版本控制
Python
智谱 slime 深度实战:当 RL 后训练终于有了工业级「炼丹炉」——从 Megatron+SGLang 三模块联调到 GLM-5.2 两天完成 OPD 后训练的生产级完全指南(2026)
编程
智谱 slime 深度实战:当 RL 后训练终于有了工业级「炼丹炉」——从 Megatron+SGLang 三模块联调到 GLM-5.2 两天完成 OPD 后训练的生产级完全指南(2026)
2026-06-23 07:54:24
2026年6月智谱开源RL后训练框架slime,支撑GLM-5.2仅用2天完成OPD后训练。本文深度解析其三模块架构、原生引擎透传设计、PD分离、增量权重同步等核心技术,附完整生产级部署实战代码。
强化学习
RL训练
slime框架
智谱AI
GLM-5.2
Megatron
SGLang
后训练
开源框架
生产级部署
Microsoft Agent Lightning 深度实战:零代码变更优化AI代理的强化学习完全指南(2026)
编程
Microsoft Agent Lightning 深度实战:零代码变更优化AI代理的强化学习完全指南(2026)
2026-05-24 15:00:19
深度解析Microsoft Agent Lightning框架,探讨如何通过零代码变更方式优化AI代理,包括架构分析、代码实战和性能优化
AI Agent
强化学习
微软开源
agent训练框架
RL训练
Agent-Lightning 深度实战:微软开源RL训练框架——零代码优化任意AI代理的生产级实践
编程
Agent-Lightning 深度实战:微软开源RL训练框架——零代码优化任意AI代理的生产级实践
2026-05-22 21:46:28
深度解析微软Agent-Lightning框架,实现零代码修改的AI Agent强化学习训练,解耦架构设计与生产实践
AI Agent
强化学习
微软
RL训练
Agent-Lightning
Microsoft Agent-Lightning 深度实战:零代码优化AI代理的训练框架——微软RL训练的革命性工具与生产级实践
编程
Microsoft Agent-Lightning 深度实战:零代码优化AI代理的训练框架——微软RL训练的革命性工具与生产级实践
2026-05-22 21:46:03
深度解析微软Agent-Lightning框架,实现零代码修改的AI Agent强化学习训练,解耦架构设计与生产实践
AI Agent
强化学习
微软
RL训练
Agent-Lightning
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调