跳转到内容

更新日志 ​

本页记录用户可见的功能、行为与兼容性变化。升级前请阅读版本与模型兼容范围。

[2.0.0] ​

加密交付与 CUDA ​

  • 解压后直接 pip install .,无需 Git 或加密构建工具。支持 Linux x86_64、Python 3.10/3.11,依赖固定为 PyTorch 2.7.1+cu128 及配套版本;示例扩展使用 pip install '.[examples]'。
  • 运行库与独立 ONNX 工具均位于 revive/ 内部;ONNX 工具路径为 revive/deploy/onnxruntime/,可整体复制使用。
  • 本次交付包不包含研发仓库、测试、构建脚本、训练日志或参考模型权重。使用本地训练产生的模型执行示例评估。
  • CUDA 验收在加密后复制到本机的新环境执行,支持硬件和测试范围以本次发行验收记录为准。

安装与迁移 ​

  • 发行包、导入名与命令统一为 revive。加密交付包支持 Linux x86_64、CPython 3.10 / 3.11。解压后在独立环境直接执行 python -m pip install .,由 pip 安装声明的依赖;超参数搜索安装 .[tune]。GPU 需匹配驱动并在目标环境验证,本次加密包不包含 Ascend NPU 环境。详见安装与授权。
  • 支持在线 access key 与离线许可证。revive register 保存在线凭据,首次训练申请授权;离线方式可导出机器信息、安装许可证及查询状态。设备绑定、有效期与断网运行能力以签发条件为准。
  • SDK 数据处理与计算实现以加密形式交付,软件许可统一见 POLIXIR 中文与英文协议。PT 加载及受保护 SDK 功能需要授权,独立运行已导出的 ONNX 模型无需安装 SDK 或 SDK 许可证。
  • 1.x 与 2.0.0 使用独立环境。新增 revive1 train,将基础旧 YAML/NPZ 转换后调用 2.0 训练;支持只读计划、BC / REVIVE-P 世界模型和 PPO / 连续动作 SAC。旧模型续训、旧 JSON 搜索、专家函数等复杂旧任务需手动迁移。仍提供独立转换工具,不恢复旧 API 或复现旧模型结果。详见兼容 revive1。
  • 随包保留十个任务示例,排除 ib 与角速度无人机;Pendulum 附入门数据,其他任务按说明准备数据。Skill 独立分发。数据来源、软件流程、模型效果和业务验收分别判断。
  • 中文文档支持固定版本地址、对应主题的版本切换及静态搜索。命令、配置字段、算法参数与 API 参考随对应 SDK 生成。

建模与训练 ​

  • 提供世界模型 BC、REVIVE-P、ADM2,策略 BC、PPO、SAC,以及 MPC、FFPID、Residual PID 控制器;支持专家函数、专家特征、自定义网络、可选历史窗口与多控制节点。
  • 支持阶段依赖和课程训练。双环境训练为可选功能,以另一侧模型指标交叉选模;默认按资源自动选择串行或并行,单卡 trial 内串行。双分支原子续训及 ADM2、控制器、集成不在双环境首期范围。
  • PPO/SAC 可启用默认关闭的动力学噪声;仅作用于训练,不用于验证或部署。双环境交叉验证修复了加载对侧模型后的设备混用。
  • Hybrid 门控正则已计入世界模型监督阶段及策略 BC 的损失。默认系数为 0.1,未覆写的 Hybrid BC 训练结果可能变化;带该目标的旧状态不能作为修复后目标的精确续训,部署推理不受此训练修复影响。
  • 可选部署初态匹配用于满足限定条件的直接序列监督;无状态 PPO/SAC 串联动作拓扑在预检中明确拒绝。具体范围见设置训练流程。

验证、随机数与搜索 ​

  • 单步验证固定真实上游输入并按实际样本数加权;策略统计保留首次终止转移、排除终止后步骤。return_mean 表示未折扣累计回报,reward_mean 按有效步数及轨迹平均;单轨迹标准差 0 仅为描述值,不表示统计置信度。
  • 归一化仍使用当前可见的训练与验证数据,不能解读为验证数据完全未参与统计。指标签名更新到 v2,历史指标和新口径不得直接比较,旧选模与续训记录不能无条件复用。
  • 固定种子与严格确定性用于同代码、依赖、设备、数据、配置和计算预算下复现。验证、报告和导出隔离训练随机流;验证支持缓存及有序数据准备。跨设备逐位一致、按墙钟截止的更新次数以及异步自适应搜索顺序不在此保证内。
  • PPO 的推演长度与 SAC 的 rollout_length 默认均为 20,SAC 的 rollout_clip 默认为 true。新配置未显式覆盖时采用这些值;建议结合世界模型验证长度调整。
  • Sweep 支持只读计划、共享数据准备、失败分类及按数据、奖励、验证协议等身份分组比较。新增数据建模体检和推演长度建议,建议结果不能替代业务验收。

检查点、部署与兼容性 ​

  • 默认 output.checkpoint_policy: best_only:各阶段、trial、双环境分支保留最优模型及同轮完整状态;不生成独立 latest.pt 或周期归档。使用 --resume best 或 best_train_state.pt 从最优轮次恢复,此后未保存的计算需要重做。
  • 固定学习率的单阶段 BC 可通过 --extend-from 从最优完整状态创建追加训练;旧运行可使用 latest.pt。显式 legacy 保留旧周期保存协议,普通 best_only 训练不接受无界历史快照。
  • 当前默认层包含 policy.ppo: 2、policy.sac: 3、venv.revive_p: 2 及输出层版本 2。精确续训核对原始默认资源、数据、配置与训练身份;旧默认摘要不能静默接受。已有部署模型与精确续训分开判定,详见兼容矩阵。
  • 标准训练要求 ONNX 导出及验证成功;修复多阶段运行中选中模型与导出模型不一致,以及 warmup 输入裁剪后的映射问题。MPC 的数值一致性限制见使用与部署模型。
  • PT 模型支持 Python 加载与推理,ONNX 支持独立运行。部署文件进行摘要、大小、输入域及非有限值检查,损坏或身份不匹配时明确拒绝。
  • 不确定性校准、风险与预测区间属于可选评估;sidecar 身份必须匹配,已退役的 v1 不能静默加载。业务上线仍需独立验证。
  • warmup_depth 必须存在可消费前缀的节点;不满足条件时预检失败。正常训练不会自动覆盖已有记录,显式覆盖与续训互斥。

文档修正 ​

  • 安装页统一说明交付包安装、CPU/CUDA 依赖、在线与离线授权、首次训练及故障排查,示例资产包明确不含 SDK。
  • 提供 revive-project 项目助手及配套离线用法知识,覆盖数据整理、业务图、配置、训练、参数搜索与部署;训练仍需有效 SDK 授权。技能包与软件包分别标识版本。
  • 保留七章导航,专题在左侧展开,API、参数参考和不确定性评估都有入口;右侧目录仅列当前页标题。
  • 修正 Residual PID target 与 PPO eval_gamma 的说明来源,统一追加训练与 Sweep 示例,补充回报标准差的解释边界。
  • 命令参数说明去重,验证执行和旧保存协议单独组织为深入内容。本页保留用户需要了解的变更,工程实现与发布过程继续记录在源码 CHANGELOG.md。