LSF Monitor · by jianpeng

LSF Monitor 完整中文使用指南

按任务查阅 LSF Monitor:安装与首次登录、集群采集、作业分析、PeakGuard 与 LoadFlex、配置发布、通知及维护,附实际 Mock 界面截图。

1. 认识系统与角色

四种角色与导航

适用角色:全部用户。前置条件:账号已启用且拥有所需授权。管理员按实际职责分配角色与数据范围。

角色典型权限与常用任务
管理员管理全局设置、账号、角色和范围;查看集群及作业;审核集成、配置发布和自动化。
运维在授权集群内排查资源、作业、配置和运行状态;全局身份/设置仍取决于额外授权。
部门负责人查看授权部门的用户、项目及作业,分析用量;不自动获得全局管理权限。
普通用户查看映射到自己 LSF 身份的作业与资源信息,使用允许的个人功能。平台登录名与 LSF 身份可不同。
  1. 从侧栏进入总览、资源监控、作业、项目管理、访问管理或运维管理。按角色/范围显示可用菜单,普通用户可能直接进入个人概览。
  2. 顶部集群选择器限定支持该条件的页面;项目列表聚合全部授权集群。修改筛选前核对集群、时间范围及状态。
  3. 在表格用搜索、筛选、排序、页码或“跳转”定位记录;“详情”进入独立页面。资源名称链接携带集群或时间上下文;重名时选择候选。
  4. 顶部“我的账号”改密或退出;切换语言、配色、明暗模式不会提交表单。帮助页中英文可随时切换。

预期结果:看到授权范围内的菜单和数据。失败处理:无权限、空结果和接口失败分别处理:检查授权/身份映射、筛选、功能开关和服务状态。重命名后的旧名称链接可能失效,回列表重新定位。

侧栏将相关页面集中到同一入口:主机资源包含主机与主机组,计算用户包含用户与用户组,项目管理包含项目与里程碑,作业分析包含作业统计与内存分析,告警与通知包含告警规则、通知记录、渠道、策略和来源绑定。通过页内导航切换,各页面仍按原有权限显示。“集群接入”用于采集连接与接入设置,“配置管理”用于 LSF 配置草稿、发布、备份与诊断。原有地址和带筛选条件的详情链接继续有效。

图 1:Mock 管理员总览,用于认识集群范围、指标与侧栏入口。图 1:Mock 管理员总览,用于认识集群范围、指标与侧栏入口。

网站演示与角色切换

适用角色:演示访问者。前置条件:已通过网站访问认证。演示入口为 https://www.jianpeng.site/lsf-monitor/

  1. 直接选择管理员、运维、部门负责人或普通用户,无需再输入软件账号密码。
  2. 页面持续标注“演示环境/合成数据”。在授权界面体验查询和配置流程,数据与响应是模拟结果。
  3. 选择“切换角色”退出当前角色,清理查询和页面状态,再选择其他角色。
  4. 选择“重置演示”并确认,恢复合成数据和角色选择。演示数据保存在当前标签页内存,完整刷新也会恢复模拟业务数据;角色身份可在当前标签页刷新后保留。

预期结果:角色菜单和数据范围随选择更新,上一角色的缓存不复用。失败处理:初始化失败时刷新并确认浏览器允许 Service Worker;不把演示地址当真实采集器或业务 API。演示结果不证明真实邮件、SSH、IBM 校验或模型服务已连接。

2. 安装与首次启动

系统架构与采集链路

浏览器查询平台已经采集的数据。定时任务负责从 LSF 更新这些数据;配置发布则沿另一条操作链路写回 LSF。理解这两条链路,可以区分页面刷新、采集任务和配置生效各自的问题。

采集链路从 LSF 经 SSH 或 Python API 进入 Celery worker,写入 PostgreSQL 和 QuestDB;FastAPI 查询数据库并返回 React 页面。配置从页面提交,经后台任务和 SSH 写回 LSF。
实线表示采集与查询的数据流,虚线表示配置操作。Redis 支撑后台任务队列与缓存。点击图片可放大查看。

获取安装包与预装软件

负责部署的管理员先准备主机和软件,再向作者取得对应离线包。v1.0.0.beta 是首次发布的数据库基线,需要专用空数据目录。 替换开发测试安装时,先保留原程序、配置、密钥和完整数据库备份,再选新目录安装。

主机必须先准备什么

项目安装前要求检查方法
操作系统RHEL、Rocky Linux 或 AlmaLinux 8/9,x86_64,正常运行 systemdcat /etc/os-releaseuname -msystemctl --version
Shell 与基础命令bash、coreutils(含 sha256sum、realpath)、grep、sed、gawk、findutilscommand -v bash sha256sum realpath grep sed awk find
解压工具tar、gzipcommand -v tar gzip
安装锁与文件比较util-linux(含 flock、mountpoint)、diffutils(含 cmp)command -v flock mountpoint cmp
系统包管理rpm、dnf,以及 DNF 自身依赖的系统 Pythonrpm --versiondnf --version;保留系统自带依赖
网络与时区工具iproute、tzdata;确认服务器时区command -v ip sstimedatectl
管理权限root;使用普通管理账号时,还需安装 sudo 并获得相应权限sudo -v

在联网准备阶段,或已配置系统安装介质的本地仓库后,安装基础工具:

sudo dnf install -y bash /usr/bin/sha256sum tar gzip grep sed gawk findutils diffutils util-linux iproute rpm dnf tzdata

/usr/bin/sha256sum 让 DNF 选择提供该命令的 coreutils 软件包,兼容系统已有的 coreutils 变体。若以 root 登录,命令可省略 sudo完全离线的主机应先挂载对应系统安装介质并配置本地仓库;只有复制应用压缩包,还不能替代这些基础命令。

哪些组件由离线包提供

组件是否需要另行预装
安装器不需要。解压目录中的 init 就是安装入口。
Docker Engine、Compose未安装时由包内离线 RPM 安装。已有环境需 Engine 24+、Compose 2.20+;不兼容时安装器会停止并提示处理。
应用 Python、Node.js、Nginx不需要为应用在宿主机另行安装;应用运行环境随包交付。DNF 使用的系统 Python 仍须保留。
PostgreSQL、QuestDB、Redis标准单机部署由包内镜像提供。多应用节点部署需提前准备共享数据库和 Redis 的稳定服务入口。
Keepalived仅相关多节点部署需要,可由包内依赖安装。

按接入方式准备的外部软件或服务

使用场景需要提前准备
接入 IBM LSF已合法授权且正常运行的 IBM LSF 集群;平台不负责安装 IBM LSF。
独立采集器与包版本匹配的 LSF 主机、可读取 conf/profile.lsf 的 LSF 根目录、已有非 root 采集账号及其 UID。详细步骤见独立采集器
SSH 采集或配置管理远端 OpenSSH 服务(sshd)、可用的 LSF 命令、账号及读取权限;发布和自动调整还需相应管理权限。
LDAP 登录、邮件/飞书通知、AI仅启用时准备 LDAP 服务、SMTP 服务/飞书机器人或可达模型服务及凭据。它们不是本地登录的前置条件。
用户访问用户电脑上的浏览器及平台访问地址;服务器不需要安装浏览器。

向作者说明操作系统主版本、CPU 架构、LSF 版本和是否需要独立采集器,取得 EL8 或 EL9 对应的压缩包、外部 SHA-256 文件及验收说明。同一安装包不能跨 EL 主版本使用。安装包请联系作者获取。

校验离线包并启动服务

  1. 准备磁盘。 检查 Docker 镜像和应用数据各自所在的文件系统,例如 df -h /var/lib/docker /data;目录尚不存在时检查父目录。数据文件系统至少有 10 GiB 可用,镜像导入另需大于 images.tar 大小的两倍加 1 GiB。还应为历史数据、完整备份和恢复暂存预留空间。
  2. 校验并解压。 把压缩包和作者提供的外部校验文件放在同一目录,确认摘要来源可靠。下面的命令按当前系统主版本选择文件:
. /etc/os-release
lsf_el=${VERSION_ID%%.*}
lsf_release="lsf-monitor-v1.0.0.beta-el${lsf_el}-linux-x86_64"
sha256sum -c "${lsf_release}.tar.gz.sha256"
tar -xzf "${lsf_release}.tar.gz"
cd "$lsf_release"
sha256sum -c SHA256SUMS
cat VERSION TARGET_EL
  1. 运行初始化。 执行 sudo ./init,按提示填写参数。确认访问域名/IP、HTTP 或 HTTPS、端口和空数据目录。默认程序目录为 /opt/lsf-monitor,数据目录为 /var/lib/lsf-monitor,HTTP/HTTPS 默认端口分别是 80/443。若使用 /data/lsf-monitor,先确认其父目录位于计划的数据盘,之后备份和维护沿用该路径。HTTPS 需准备匹配访问域名的证书。
  2. 启动并检查结果。 init 完成系统检查、镜像导入、凭据和密钥生成、数据库初始化后,执行以下命令。start 会等待健康检查,确认 API、worker、beat 与网页入口就绪,再访问选择的地址。
sudo ./start
sudo ./status
docker version
docker compose version

校验失败时重新取得原包;系统版本不匹配时换用对应包;空间不足时调整目标磁盘。未知非空目录、缺失密钥或证书等问题按安装器提示修复,并从同一完整安装包重试 init,保留已有数据和密钥。看到登录页后,继续下一节完成首次改密。

首次登录与账号安全

适用角色与前置条件:初始或已有平台用户;首次管理员需持有交付的初始凭据。

  1. 使用安装说明提供的初始本地管理员登录。新安装包的默认用户名为 jianpeng;已有部署保留原来的账号。
  2. 打开我的账号,输入初始密码,设置至少 12 位的新密码。保存后重新登录。完成首次改密前,业务配置操作不可用,但仍可阅读本帮助页。
  3. 账号管理创建实名账号,仅分配实际需要的角色与范围。调整目录认证前,先保留另一个可用的本地管理员。本地账号的登录名不可直接修改;需要其他登录名时,可新建替代管理员。

配置接口不会回显保存过的密码。密码框留空通常表示保留原值;需要清空时使用表单提供的明确操作。不要把采集器令牌或密码写进 URL 或截图。

预期结果与失败处理:完成改密并重新登录,账号仅获得所需权限;密码错误按交付说明核对,账号锁定由另一管理员处理。

按需启用功能

适用角色与前置条件:全局管理员;已完成首次改密并确定需要的外部功能。

打开系统设置。全新安装默认关闭 LDAP、AI、通知和集群采集,不创建演示集群,默认关闭 PeakGuard 和 LoadFlex。

只打开需要的功能,并点击该功能的“保存”。仅拨动开关尚未生效,保存后才会出现详细配置入口。“已有配置”只表示保存过参数,不表示远端服务可用。重复初始化和升级保留已有部署的启用状态。

建议先配置采集。LDAP、通知和 AI 均为可选项,不影响本地登录及历史数据查看。停用功能会保留参数和加密凭据。重新启用通知时可能恢复此前排队的消息,请先核对渠道和策略。

预期结果与失败处理:保存后开关状态和配置入口一致;保存失败检查权限或版本冲突,重新加载再比较。

3. 集群与采集器接入

配置集群和采集器

适用角色与前置条件:具有集群写权限的管理员/运维;平台到 LSF 或采集器网络可达。

  1. 系统设置启用“集群采集”。
  2. 打开集群列表,创建集群,通过编辑表单填写连接参数。每个 LSF 集群分别创建一条记录。
  3. 选择采集方式:SSH 使用现有 LSF 主机和账号;Python API 连接独立安装的采集器。采集器未运行在监控平台主机上时,不要把平台地址填成采集器地址。
  4. Python API 方式填写采集器 URL、期望的 LSF 集群名和采集器令牌。期望集群名必须与采集器上报一致。SSH 方式填写主机、端口、账号,选择密码或私钥认证,并填写该集群的 LSF 配置目录。
  5. 保存后进入集群详情,执行采集连接测试。先解决失败项,再启用自动化。等待采集后,在集群概览核对主机、队列和作业数据的最新时间。刚配置完成时列表为空,可能只是尚未收到第一批快照。

尚未保存任何集群配置时,页面会持续显示初始化提醒。提醒消失或单次连接测试成功,并不表示所有可选功能均已配置完成。

连接参数与检查

配置填写及检查方法
采集方式SSH 直接执行已有 LSF 命令;Python API 读取独立采集器快照。两种方式任选其一。
SSH 登录填写主机、端口、账号,选择密码或私钥方式。私钥填写对应账号的完整私钥;免密仍需要服务端授权公钥和平台信任主机密钥。
LSF 配置目录填写实际 lsb.queueslsb.hostslsb.users 所在目录;登录账号需具有读取权限。发布还需要安装配置文件和执行 badmin reconfig 的权限。
Python API 地址填写采集器入口,例如 http://collector-host:8088;添加平台白名单后检查网络访问。不要把管理网站 URL 当作采集器 URL。
期望集群名与已有 LSF 环境的 lsid 和采集器返回的集群名一致。
采集器令牌与采集器环境中的 COLLECTOR_TOKEN 相同,至少 32 个字符;使用初始化生成的令牌,不写入 URL。
状态目录标准安装持久化在 /var/lib/lsf-monitor-collector,容器内为 /state,由采集 UID 读写。升级保留 SQLite 缓存和完成作业游标。
时区安装默认采用服务器时区;采集时间以 UTC 时间点传输和保存,页面按服务器时区展示。同一时间的不同显示格式不表示时间点不同。

配置后使用“测试连接”,逐项查看网络、认证、LSF 环境和权限结果。能登录但缺少管理命令、能读取但不能发布配置、采集成功但没有配置权限是不同状态,应按具体失败项处理;不要仅因 SSH 登录成功就启用自动调整。Python API 采集凭据不替代配置文件管理所需的 SSH 凭据。

预期结果与失败处理:连接检查与新采样均成功;失败按检查项修复网络、令牌、集群名、SSH 信任或权限。

图 2:Mock 集群连接表单中的未保存输入示例,未连接真实服务。实际部署时填写自己的采集器或 SSH 参数。图 2:Mock 集群连接表单中的未保存输入示例,未连接真实服务。实际部署时填写自己的采集器或 SSH 参数。

安装并接入独立采集器

适用角色与前置条件:采集主机管理员;已取得与已有 IBM LSF 环境匹配的采集端包。

采集器部署在已有合法授权且可用的 IBM LSF 环境的 Linux 主机上。平台基础安装包不含 IBM 库;请使用为对应环境构建、包含采集端的安装包,复制基础包不会安装 IBM LSF。

在 LSF 主机上,从包含采集端的安装包执行:

sudo ./collector-init
sudo ./collector-start
sudo ./collector-status

初始化会询问已有 LSF 根目录、非 root 采集账号的 UID 和绑定 IPv4 地址。采集器默认端口为 8088。令牌保存在仅 root 可读的 /opt/lsf-monitor-collector/collector.env 中,由有权限的管理员安全填写到平台集群表单。重复初始化保留令牌和已完成作业的采集游标。

平台主机必须能访问采集器。运维人员还需把采集器域名或 IP 加入平台 config/runtime/app.envCOLLECTOR_ALLOWED_HOSTS,停止并启动平台以让 API 和 worker 加载新配置。多应用节点应保持相同白名单。令牌仅在可信内网传输,或使用受信任的 HTTPS 入口。采集器默认使用 HTTP,填写 HTTPS URL 时需要在前面配置 TLS 代理。

在采集器主机使用 sudo ./collector-logs 查看故障,核对 LSF 账号环境和已完成作业日志的读取权限。不要通过重置游标修复连接问题,这可能导致历史数据重复采集。

运行检查与故障处理

采集器默认每 30 秒刷新主机和完成记录,每 60 秒刷新作业;平台还需通过自己的周期任务读取快照。连接测试成功后等待完整采集周期,核对集群、主机、队列、运行作业与完成作业的最新时间。collector-status 检查服务状态,collector-logs 查看采集失败;健康检查要求主机快照不超过 90 秒、作业和完成记录检查不超过 180 秒。

现象处理
采集服务无法启动核对安装包是否匹配操作系统、CPU 架构及已有 LSF 版本;查看 collector-logs,使用适配该环境的安装包。
返回认证失败核对双方令牌是否一致,确认修改后对应服务已重新加载环境。
集群名不匹配核对填写的期望集群名和 LSF 环境,避免把另一集群的数据接入。
健康检查失败或快照陈旧检查 LSF 命令环境、完成日志读取权限、状态目录写入权限及主机时间,查看日志中的具体失败项。
能采集但配置发布失败单独检查 SSH 管理账号、配置目录权限、badmin 命令与管理权限。
已安装另一版本,初始化被拒绝按该版本的升级步骤处理,先保留配置、令牌及状态目录;不要删除目录重新初始化来绕过版本检查。

预期结果与失败处理:版本、连接、权限和快照时间逐项可核对;按上表具体故障处理,保留现有状态和游标。

SSH 配置与自动调整

适用角色与前置条件:有集群配置权限的管理员/运维;持有经可信渠道核验的 SSH 主机密钥。

SSH 配置管理要求目标主机存在于平台可信主机文件 config/runtime/ssh/known_hosts 中。先由运维人员通过可信渠道核对主机密钥,再写入文件。安装器不会自动扫描并信任主机。Python API 采集成功,不代表已经具备 SSH 配置管理权限。

采集稳定之前保持 PeakGuard 和 LoadFlex 关闭。核对阈值、作用范围和运行影响后,再按需到集群配置中显式启用并保存。这些功能可能影响实际运行的 LSF 作业。

预期结果与失败处理:SSH 信任验证通过,读取与管理能力分别确认;密钥变化先核验来源,不自动接受新密钥。

4. 日常作业与资源

作业查询、详情与操作

适用角色:具有作业读取权限的全部角色;执行操作另需写权限。前置条件:已收到对应集群数据,账号关联的 LSF 身份和范围正确。

  1. 打开作业列表,选择集群、提交时间、状态、队列、用户或关键词。先区分排队、运行、挂起、成功和失败;日期按页面所示服务器时区解释。
  2. 打开“详情”,核对作业编号、提交时间、集群与用户;相同作业编号可重复使用,不省略实例上下文。
  3. 阅读身份、指标、生命周期、执行/输出、内存比较及“完整属性”。排队作业没有真实运行时长或主机采样;缺失值不是零。
  4. 写权限允许时选择作业操作,核对对象和影响后确认。请求被接受后继续查看操作状态,不把“已受理”当成执行成功。

预期结果:筛选命中实际关联作业,操作最终状态可追踪。失败处理:空结果先放宽日期/状态并核对范围;实例失效回列表定位;操作失败查看具体原因、LSF 状态及权限,不反复提交相同操作。

图 3:Mock 作业查询。先确定集群、时间和状态,再打开对应作业实例。图 3:Mock 作业查询。先确定集群、时间和状态,再打开对应作业实例。

图 4:同一 Mock 作业实例的详情:申请内存 32 GiB、峰值 20 GiB、申请 4 Slot。结合生命周期和采样时间解读这些数值。图 4:同一 Mock 作业实例的详情:申请内存 32 GiB、峰值 20 GiB、申请 4 Slot。结合生命周期和采样时间解读这些数值。

批量操作与主机维护

作业和主机列表仅在账号具有管理权限时显示勾选列;全选只选择当前页可写记录。切换账号、集群、分页或筛选后清空选择,其他资源列表不显示无用途的勾选。

作业“批量操作”在未勾选时也可打开,默认继承当前列表的条件;有勾选时默认操作所选实例。选择终止、挂起、恢复或内存优化,先“预览目标”,再核对跨页匹配总数、可执行数量及排除原因。内存优化同时展示当前值和冻结的建议值,保留其他资源要求,执行前配置已变化的作业会跳过。预览有效期为 15 分钟,修改操作或条件必须重新预览;没有可执行目标不能提交。

确认后后台自动按每批最多 200 个目标处理全部已确认作业。通知中的“详情”显示进度、成功/失败/跳过/未知数量和分页结果。关闭弹窗不会取消已受理任务;活动任务在重新打开应用后继续跟踪。未知命令不会自动重试,已成功结果不会回滚。

主机列表勾选后打开“主机管理”,或从单台主机详情进入。填写维护原因(最多 512 字符),核对目标、状态和受影响作业后选择:

策略行为与完成条件
等待完成(默认)立即阻止新作业调度,已有作业继续运行。每 30 秒发起短检查任务;运行、系统挂起、用户挂起和预留全部归零且查询有效后完成。挂起或预留持续存在时继续等待,没有自动强制暂停期限。
立即暂停全部主机关闭调度成功后,逐项暂停确认清单内的运行作业。同一跨主机作业只暂停一次,整个并行作业都可能受影响;需要全部受影响作业的写权限。任一关闭失败或未知都不进入暂停阶段。

查询失败保留最近有效数量和检查时间,不将缺失数据视为零。等待超过 24 小时或应用/worker 重启后仍继续检查;人工锁被外部解除时结束等待并报告。关闭后新增的作业不会自动加入确认清单;已完成或迁出目标主机的作业跳过。暂停不表示主机已清空或可以关机。本功能仅关闭 LSF 调度,操作系统保持运行,人工权限独立于 AI 配置。

“恢复开放”仅解除人工维护锁,保留 AI 和其他管理员的锁,不接管已有的无锁管理员关闭;“恢复作业”单独打开预填主机条件的作业恢复预览。开放调度不会自动恢复作业。

命令语义参见 IBM 主机控制暂停与恢复

实时监控、统计与内存分析

适用角色:具有相关资源读取权限的用户。前置条件:采集稳定,已选择正确资源与时间窗。

  1. 从集群、主机、用户、队列、项目概览查看指标卡、趋势、活动热力图和资源档案,按需打开实时监控。
  2. 查看最新值、最小/均值/峰值、单位、样本时间和缺口。切换时间范围;自定义区间按页面服务器时区填写。“暂停”停止轮询,恢复后继续拉取。
  3. 作业统计比较同一范围的作业状态、执行主机、队列和工具分布;在内存分析比较申请/预留与实测峰值,保留超配和缺失测量的区别。
  4. 记录当前筛选条件后导出可用表格;导出只包含当前授权数据,注意页面提示的数量限制。

主机、工具和项目分类图默认展示前 10 名,可切换前 20/50 名;超过 10 行时在图表内滚动。队列不超过 10 项时使用纵向堆叠柱状图,更多队列使用横向排名。作业分析页将队列分布与每日作业记录放在同一列,工具统计占整行。搜索覆盖当前统计范围的全部分类,不限于已显示排名。「明细」保留各项指标,支持排序、每页 20/50/100 条及页码跳转;「其余」入口同样可以查看完整明细。

工具默认按作业数排名,可切换平均申请内存、平均使用内存、作业峰值均值及平均运行时长。内存单位为 GB,时长单位为小时;均值不计算合计和占比。可相加指标的占比分母是当前业务范围内全部统计对象,搜索不会改变分母。主机项包含多主机执行组合,不等同于物理节点总数;退出原因中的队列分析保留已加载记录的采样范围说明。长名称可通过悬停或键盘聚焦查看。

预期结果:图表与同范围记录一致,不同单位分开比较。失败处理:无曲线先核对资源关系、采样周期和时间窗;陈旧数据检查 worker/beat/采集器。没有阈值依据时不把零值或空图解释为健康。

作业诊断与 AI 助手

适用角色:可读目标作业且获准使用诊断或 AI 的用户。前置条件:该作业具有足够采集证据;AI 需要管理员启用模型。

  1. 在作业详情查看退出/等待原因及中英文说明,再打开可用的诊断入口。
  2. 核对采样时间、状态、退出码、内存与主机证据。分开阅读确定的记录、规则推断和模型建议。
  3. 需要进一步解释时打开AI 助手,选择可用模型并描述作业与问题。对话中使用已有授权上下文,不粘贴令牌或无关机密日志。
  4. 对可执行建议先查看目标、范围、参数与审批/执行状态,再按权限确认。模型回答不会自动成为已验证的故障结论。

预期结果:得到可回溯到作业证据的分析。失败处理:证据不足补采样;模型超时检查模型状态和网络;操作拒绝检查授权,不为排错临时扩大全局自动执行权限。

项目、队列、主机与里程碑

适用角色:资源读取用户;编辑需要相应写权限。前置条件:关联人员、队列和集群已可见。

  1. 项目创建或编辑项目,填写名称、总负责人、协调人、流程编号与状态。状态包含预研、进行中、结项。
  2. 项目详情查看容量、趋势及里程碑,在“项目管理”的里程碑创建阶段、时间和关联项目。检查日期与项目归属后保存。
  3. 队列列表或详情绑定/解除项目;一个队列绑定一个项目,项目可关联多个队列。此关联保存不触发 LSF 配置发布。
  4. 主机、主机组、用户组和队列中阅读概览与属性。改变 LSF 管理配置走配置草稿流程,不将采集到的只读字段当普通表单编辑。

预期结果:项目关联与阶段在列表和详情保持一致。失败处理:候选缺失检查读取范围;冲突重新加载。

5. PeakGuard 与 LoadFlex

峰值余量内存优化(PeakGuard)

适用场景:作业申请的内存长期高于实际峰值,导致可调度资源被过量预留。 PeakGuard 根据已采集的峰值和历史记录,为符合条件的作业计算带余量的预留值;也会识别预留不足的情况。调整的是 LSF 的内存预留,进程实际使用的内存不会因此自动下降。

启用前先保证采集稳定、峰值记录可信,并完成SSH 管理检查。新安装默认关闭。管理员在集群接入编辑目标集群,在“内存优化”分组中查看 PeakGuard 开关、参数与算法说明。

图 5:Mock 集群配置中的 PeakGuard 开关与参数,数值为演示配置。图 5:Mock 集群配置中的 PeakGuard 开关与参数,数值为演示配置。

参数怎么填

页面参数默认值含义与调整依据
运行间隔(分钟)20检查候选作业的间隔。作业短于一个周期时,可能在调整前已结束。
内存阈值(G)1小内存作业的判定阈值;峰值较小且预留未超过此值的作业通常不需要调整。不是所有作业统一的目标内存。
最小内存比例0.8识别预留不足的比例边界。与最大内存比例配合分类,不是把最终预留值限定在 0.8–1.2 倍之间。
最大内存比例1.2识别过量预留的比例边界;判断时同时考虑弹性比例。
弹性比例1.1对可信峰值保留乘法余量,例如 1.1 表示多留 10%。
弹性值0.1 GiB在比例余量外再加固定内存余量,最终向上取整到 0.1 GiB。

一个可核算的例子

假设某作业当前有效峰值为 3.5 GiB,同集群、同用户、同工具的历史有效峰值为 4 GiB,弹性比例为 1.1,弹性值为 0.1 GiB。在当前及可用历史观测中取较大值,得到目标预留:

目标预留 = 向上取整到 0.1 GiB(4 × 1.1 + 0.1)= 4.5 GiB
原预留 5.2 GiB → 目标预留 4.5 GiB,减少预留 0.7 GiB

这是计算示例,实际还需通过作业状态、有效采样及权限检查。有运行中内存或平均内存观测更高时,也会纳入较大值;缺少有效峰值时,不进行该目标计算。

启用、观察与停用

  1. 先记录目标集群中代表性作业的原预留、峰值、完成时间与失败情况,保留关闭功能时的对照。
  2. 检查参数,打开开关并保存。等待完整采集和运行周期;保存参数本身不表示已有作业立即完成调整。
  3. 作业列表打开同一作业实例,核对预留变化、采样时间和退出状态;运维同时检查 worker 日志中的调整或失败记录。执行端通过 LSF 作业修改命令更新满足条件的作业。
  4. 出现内存压力、异常退出或不符合预期的调整时,关闭开关并保存,检查受影响作业及原预留。停用会停止后续自动调整,已改变的预留需按实际情况处理。

读取收益时重点看减少了多少预留、是否改善等待和完成速度,同时观察失败率。未来负载峰值仍可能超过历史观测;收益对照的口径见阅读优化收益

负载感知弹性 Slot(LoadFlex)

适用场景:主机 Slot 已接近占满,但 CPU 和内存仍有余量,待运行作业受并发容量限制。 LoadFlex 综合 Slot 占用、CPU 和内存负载,在上下限内逐步调整主机的 LSF 作业容量。Slot 是调度容量,增加它不会增加硬件 CPU 或内存。

管理员在集群接入编辑目标集群,在“SLOT动态调整”分组中查看 LoadFlex 开关、参数与算法说明。启用前完成采集、SSH 信任和 LSF 管理权限检查;新安装默认关闭。

图 6:Mock 中的 LoadFlex 参数表单,展示每轮步长、容量范围与负载比较设置。图 6:Mock 中的 LoadFlex 参数表单,展示每轮步长、容量范围与负载比较设置。

参数与 32 个逻辑 CPU 的例子

页面参数默认值含义与示例
运行间隔(分钟)20两次自动检查之间的间隔;观察时同时考虑采样延迟。
Slot使用率阈值(%)60Slot 占用达到该值后才进入相应负载比较;不代表 CPU 使用率达到 60%。
调整步长0.1按逻辑 CPU 总数计算每次容量变化量,并取整数、至少 1。32 × 0.1 得到每次 3 个 Slot。
最小超分比率1Slot 下限相对逻辑 CPU 的倍数;32 个逻辑 CPU 对应下限 32。
最大超分比率2Slot 上限相对逻辑 CPU 的倍数;同一主机对应上限 64。
最小资源比例1.12用于缩容侧的 Slot 占用与 CPU/内存负载比较;不是预留 12% 资源。
最大资源比例1.35用于扩容侧的比较:Slot 占用要同时高于 CPU 和内存使用率乘以此比例。
主机组黑名单排除不应自动调整的主机组,例如容量需固定的专用主机。

这里的 32 是逻辑 CPU 总数,计算时包含每个 CPU 的线程数,不能直接用物理核心数替代。假设当前容量为 32、Slot 使用率 100%、CPU 使用率 30%、内存使用率 40%,在状态和其他检查均通过时:

100% ≥ 30% × 1.35,且 100% ≥ 40% × 1.35
CPU 与内存均不超过 70%,满足扩容侧的负载条件
本次容量:32 → 35;允许范围:32–64

资源使用率上升并触发缩容条件时,每轮也只按步长调整;挂起作业和高负载还会参与判断。当前容量明显超出设置范围时,不会通过一次大幅跳变强行拉回边界。因此“开启后没有立刻增加 Slot”可能是阈值、状态、黑名单、周期或已有容量不符合条件。

验证是否适合自己的负载

先记录关闭时同一批作业的完成数量、用时、等待时间、CPU/内存使用率和失败情况。启用并保存后,连续观察主机容量、正在运行的作业和资源压力,再以相同作业规模和配额做比较。资源已经饱和的主机不适合单纯增加 Slot。

需要停用时关闭开关并保存,再核对当前 LSF 容量;如需恢复原容量,按配置发布流程实施。停用不保证自动恢复全部历史容量。两项功能可以分别启用,收益页只展示当前启用组合对应的数据。

在集群详情阅读优化收益

集群列表打开目标集群详情,找到“已启用功能 · 优化收益”。只启用 PeakGuard 时看内存优化对照,只启用 LoadFlex 时看弹性 Slot 对照,两项都启用时看组合场景。两项均关闭时不显示此收益卡;尚无可比记录时显示等待数据。

图 7:Mock 集群详情中的组合收益对照。页面明确标注为演示合成数据,不代表真实集群实测收益。图 7:Mock 集群详情中的组合收益对照。页面明确标注为演示合成数据,不代表真实集群实测收益。

指标怎么读图中演示样本
吞吐提升同一批作业的每分钟完成数,相对关闭功能时的变化8 个作业从 40 秒变成 30 秒:12 → 16 作业/分钟,提升 33.3%
CPU 利用率变化优化场景与基线的平均使用率之差,单位是百分点25% → 40%,增加 15 个百分点
释放预留作业内存预留减少量之和,启用 PeakGuard 时显示(含联合场景)8 个作业各减少 0.7 GiB,合计 5.6 GiB;不等于瞬时空闲物理内存
重复次数与来源判断比较是否来自相同工作量、是否具有重复记录演示每轮 8 个相同作业、重复 3 次;来源写明演示合成对照数据

这些数字用于说明读法。真实评估应固定集群、作业集合、资源配额、参数版本和重复次数,同时记录失败率、等待时间和内存压力。若来源为历史 Docker 受控对照,应按其原始测试环境理解,不能当作当前 LSF 集群的实时收益。

6. 管理与配置发布

配置草稿、校验、发布与回退

适用角色:具有配置写权限的管理员/运维;仅有备份读取权限时只查看备份。前置条件:SSH 信任、配置目录及 LSF 管理权限测试通过,采集与生产变更窗口已协调。

  1. 打开配置管理,选择集群并创建草稿。核对远端基线、草稿名称及版本。编辑队列、主机、用户等可视化对象或配置文件内容,保留系统提示的字段语义。
  2. 保存草稿,检查未保存位置和差异预览,确认没有覆盖其他管理员的修改。
  3. 运行 IBM 校验并检查每项错误;预览和校验必须针对当前版本通过。修改或重命名导致版本更新后重新预览、校验。
  4. 在发布确认中核对集群、文件差异和影响,发布后跟踪操作结果及远程刷新。受理、文件替换和 badmin reconfig 成功是不同阶段。
  5. 在“配置备份”页签查看历史文件快照;需要回退成功的发布时,回到编辑器的历史记录,打开对应成功发布,选择“回滚草稿”,核对差异后重新预览、校验、发布。结果未知时先执行核对;界面提示“恢复配置”时按该操作的恢复说明处理。回退也属于生产变更,历史快照不证明当前正在运行的配置。

预期结果:当前草稿校验通过,目标文件和 LSF 配置刷新完成,备份/审计可追溯。失败处理:版本冲突重载并对比,远端漂移重新取得基线;校验失败定位具体配置;文件安装成功但刷新失败先核对远端状态及日志,避免盲目重试覆盖。配置文件备份不等同于整个平台数据库备份。

图 8:Mock 草稿把 normal 队列 PRIORITY 从 30 改为 35,已保存并预览,未校验或发布。Mock 不执行真实 IBM 校验;正式环境须完成当前草稿的校验后再发布。图 8:Mock 草稿把 normal 队列 PRIORITY 从 30 改为 35,已保存并预览,未校验或发布。Mock 不执行真实 IBM 校验;正式环境须完成当前草稿的校验后再发布。

队列和主机的可视化表单中,ut(CPU 负载阈值)和 mem(可用内存阈值)均支持 loadSched/loadStop:前者控制调度,后者触发暂停条件。例如 ut = 0.7/0.9 使用 0–1 的比例,mem = 8192/4096 使用 MB;内存值表示可用内存,不是 MEMLIMIT。示例只说明格式,应根据站点策略配置。参见 IBM 队列配置主机配置

表单同时提供 r15s、r1m、r15m、pg、io、ls、it、tmp、swp,共 11 个内置负载指标。主机原文件缺少相应列时,保存会补充表头,并为同一表中未设置的主机填 -;留空清除主机阈值也写为 -。队列留空会移除参数并保留行内注释。编辑从原始文件局部修改,保留其他注释、空行、字段、声明及换行符;续行或动态成员等无法安全可视化修改的内容会提示使用源码。保存后请在差异预览中核对实际修改。

发布结果为“已发布 · 部分核验”时,文件已回读并重载,但部分策略尚未从运行态核对。结果会列出文件、对象和字段;组成员或阈值与期望不符会报错。失败恢复也会单独显示未核对的恢复策略,文件恢复成功不能代表全部策略已验证。

新增计算节点时,先确认主机名与地址双向解析一致、节点上的 LSF 服务正常。先发布 lsf.cluster.<实际集群名>,完成维护生效并确认,再发布引用这些节点的主机组和队列;主机声明必须位于引用它的主机组之前。只写入配置不会启动节点服务。尚未取得运行样本的主机显示“未知”;检查集群采集状态和最后成功时间后,再判断节点是否离线。

用户的 JL/P 是每 CPU 的作业槽比例,原生 busers 可能仅显示一位小数;应结合实际 CPU 数和作业并发核验。设置主机组 CONDENSE=Y 后,bhosts -w 会显示组汇总;bhosts -w -X 可查看独立节点。管理员列、动态成员及当前未自动核验的字段仍需结合原生命令和实际作业验证。参见 IBM 用户配置bhosts

核心配置、运行日志与 AI 脱敏

配置编辑器可读取七类文件:lsb.queueslsb.hostslsb.userslsb.paramslsf.conflsf.sharedlsf.cluster.<实际集群名>。后四类由管理员使用源码编辑;按文件展示不可读或缺失原因。旧草稿需要刷新远端基底,核对并保留本地修改后才能加入新增文件。执行适配限 LSF 10.1 FP13;启用了 LSF_LIVE_CONFDIR 或目录无法明确定位的站点不支持这套静态文件发布。

发布 lsf.* 或需要重启的参数后,状态为“待维护生效”。管理员在维护窗口完成相应服务生效步骤,核对实际运行值,再展开“确认生效”填写核验说明。系统保存回读和人工确认记录;确认前阻止后续配置写入。lsb.params 仅 DEFAULT_QUEUE、MBD_SLEEP_TIME、SBD_SLEEP_TIME、JOB_ACCEPT_INTERVAL 的非删除变更支持当前热重载核验。原生校验会临时替换并恢复文件,同样属于写操作。

在「配置管理」中选择集群,打开「核心配置」查看管理节点的磁盘快照和版本差异,或打开「运行日志」按时间、守护进程、级别、关键词查找日志并查看上下文。配置每 5 分钟检查,日志每分钟增量采集。历史从启用后积累;缺口、积压和读取失败会显示在页面上,磁盘快照不代表运行中已加载的配置。

全部日志默认保留 7 天,ERR、CRIT、ALERT、EMERG 默认保留 30 天。具有配置写权限的账号可在日志页的「保留设置」修改两项正整数天数,错误期限不得短于全部日志期限。未知级别和警告按普通期限保留。每小时清理一次;延长保留期不能恢复已删除记录。

在「AI 中心」添加或编辑模型时,「发送前脱敏」默认开启,列表显示状态。每个模型独立设置;关闭后可发送当前用户有权读取的业务原文,平台连接凭据不进入诊断载荷,审计仍保持脱敏。新回合重新读取设置,历史上下文和自动分析也使用所选模型的策略。

账号、部门与角色管理

适用角色:获准管理身份和授权的管理员。前置条件:至少保留一个可用本地管理员,并明确人员对应的部门及 LSF 身份。

  1. 部门维护部门;在角色核对资源、读写操作和全局/集群/部门/个人范围。
  2. 账号创建本地账号或查看目录同步账号,填写姓名、部门、角色及 LSF 身份映射;只分配需要的范围。
  3. 保存后用该账号重新登录,检查菜单及实际记录范围。角色和账号变更可能使已有会话失效。
  4. 停用离职账号前保留审计上下文;目录托管字段通过目录映射修改。系统阻止删除最后的可用管理员时先建立替代管理员。

预期结果:新账号只看到授权数据。失败处理:权限冲突核对角色与单独授权的组合;本地/LDAP 同名时先匹配本地,不用目录密码绕过本地账号。不要移除恢复登录所需的最后管理员。

7. 可选服务与自动化

配置 LDAP 登录

适用角色与前置条件:管理员;保留可恢复登录的本地管理员、目录参数及受信任的 CA。

保留一个已完成改密的可用本地管理员。在系统设置启用 LDAP,再打开LDAP 配置

填写目录 URI、传输安全选项、搜索基准、账号属性和绑定方式。仅在目录需要时填写服务绑定账号。根据实际目录设置允许组、管理员组和默认角色,保存前测试一个有代表性的账号。API 和 worker 必须使用一致的 LDAP_CONFIG_SECRET_KEY,并能读取引用的 CA 或配置文件。

用户和组的搜索范围均可每行填写一个 Base DN,系统读取所有指定范围并去除重叠条目。同名账号对应不同 DN,或任一范围查询不完整时,登录与同步会失败,不采用部分结果。StartTLS 的 URI 主机名必须与域控证书匹配,私有 CA 需部署到 API 和 worker 可读取的位置。

保存完整 LDAP 配置通常会要求所有用户重新认证。只有完整配置保存后,目录角色映射才由页面接管。登录时先匹配本地账号;本地密码错误不会回退到同名 LDAP 账号。目录不可用时,可使用本地管理员修复配置。

预期结果与失败处理:代表性账号验证成功,重新登录后的角色和范围符合映射;目录不可用使用本地账号恢复,不删除原加密密钥。

配置邮件与飞书通知

适用角色:有通知管理权限的管理员。前置条件:系统设置已启用通知;准备真实 SMTP 或飞书机器人参数及获准接收测试的收件人。

  1. 从“运维管理 → 告警与通知 → 渠道”打开渠道,选择“新建”,或编辑已有渠道。SMTP 属于每个“邮箱”渠道,没有独立邮件配置页签;旧 /notifications/smtp 地址会跳到渠道列表。
  2. 渠道类型选择“邮箱”。按“基本信息、服务器连接、账号认证、邮件设置”填写名称、启用状态、服务器、端口、加密方式、认证账号、密码/授权码及收件人。
  3. QQ/163 预设可填服务器和端口,仍需使用自己的完整邮箱账号并在邮箱侧启用 SMTP,填写生成的授权码。按服务商要求选择 TLS、STARTTLS 或无加密;不把加密方式与端口混配。无认证选项用于允许的内网中继。
  4. 核对发件人、回复地址、超时和收件范围;编辑时密码留空保留原凭据。自定义发件地址需要服务商授权。飞书渠道填写对应 Webhook 与签名参数。
  5. 保存后对获准的接收方执行“测试”,在事件查看投递状态与具体失败原因。已受理不是已送达。
  6. 策略绑定渠道、范围和投递规则,再在来源启用所需来源及对应策略。告警规则在告警规则维护,设置指标、比较条件、阈值及范围后核对通知策略。创建渠道不会自动订阅所有事件。

预期结果:测试事件记录成功投递,只有满足已启用来源/策略/渠道条件的事件发送通知。失败处理:核对认证/授权码、TLS 与端口、发件权限、收件地址、网络和投递记录;配置禁用时不自动回退邮箱。停用保留排队消息,再启用前核对可能恢复的投递。

图 9:Mock 邮箱通知渠道。SMTP 连接和认证参数在渠道内配置。图 9:Mock 邮箱通知渠道。SMTP 连接和认证参数在渠道内配置。

配置 AI 与访问权限

适用角色与前置条件:有模型管理权限的管理员;准备可达模型地址和有效 API 凭据。

系统设置启用 AI,进入AI 管理,填写模型服务地址、模型和 API 凭据,测试连接并显式启用需要的模型功能。离线安装包不包含模型服务,需要由应用访问外部或本地部署的模型服务。

AI 助手每次回答最多调用 100 次工具,默认支持逐轮查询到该上限,并保留最后的总结。达到上限时基于已有证据回答;权限拒绝、工具多次失败、超时或管理员设置的更低查询轮数仍可能提前结束。查询额度不会扩大账号权限,写操作仍需确认。

自动化策略及其允许操作的集群应与聊天功能分别审核。不要为了测试模型连接而开启自动执行。在账号管理角色管理分配运维、部门或个人范围。看不到某个菜单时,先检查功能开关及账号权限。

预期结果与失败处理:连接测试和授权账号使用均成功;失败区分模型、认证、网络和权限,保持自动化关闭直到单独审核。

AI 自动化策略与审计

适用角色:拥有 AI 模型管理或自动化权限的管理员/运维。前置条件:模型已测试、集群范围明确、通知渠道按需可用。

  1. AI 中心分别检查模型、策略、建议和执行证据;聊天可用不代表自动执行已启用。
  2. 创建策略时指定集群、触发条件、允许动作和执行模式,保存前核对影响范围。先用建议/需确认流程验证输入与效果,再按实际授权考虑自动执行。
  3. 跟踪建议、批准、执行中和最终状态;失败读取错误与证据。不要重复执行已受理但尚未完成的动作。
  4. 审计日志按时间、操作者和动作筛选,进入独立详情核对目标与前后值。

预期结果:策略仅在授权范围运行,记录可对应到实际操作。失败处理:模型/权限/采集故障分别处理;暂停相关策略保留证据,修复后重新审核再启用。

LSF 自主运维与决策追溯

适用角色:获授权的运维与管理员。LSF 继续负责调度作业,AI 负责 LSF 节点、队列、服务和受限配置的诊断与处置;操作系统、存储、网络和硬件仅参与诊断。正常排队无需强行消除,CPU 空闲也不代表应增加 Slot。

  1. AI 中心的策略中选择集群和已验证模型,保留适合本站的分析间隔,启用自主运维后点击“能力核查”,查看实际版本、采集覆盖和工具不可用原因。首版仅 LSF 10.1 FP13 可执行,其他版本提供诊断。
  2. 在“LSF 知识库”检查原理、命令参数、站点规程和案例的来源、适用版本与集群。管理员验证规程后点击“发布修订”。AI 整理的经验先进入“待审核候选”;未发布内容不能成为自动执行依据。修改已发布知识使用“新建修订”,历史修订保留。
  3. 逐工具设置禁用、仅建议、审批或自动,并限定目标名称、允许参数及影响上限。原生配置校验与发布需分别授权。先完成隔离演练和至少 24 小时仅建议运行,再逐工具开放自动执行。
  4. 在“故障事件”查看关联证据、分析和处置。在运行或计划中展开“决策追溯”,核对采集时间、缺口、知识修订、诊断依据、备选方案、审批、动作和效果复查。模型判断是待验证的判断,命令成功也不等于故障已解决。
  5. 审批前核对冻结的目标、参数与配置差异。方案变化、撤权或暂停会阻止后续变更。节点恢复仅释放本系统原先设置的关闭原因;队列提交开关与调度开关独立。服务操作必须满足管理节点角色、站点恢复机制和节点排空等前置条件。
  6. 发生未知结果时先暂停并回读核对。不要重放同一变更;配置恢复按当前文件版本检查冲突。需要人工处理的运行操作可在核对后记录接管说明。服务重启不能标为已回滚。模型不可用时仍保留采集和事件,暂停新的 AI 变更。

时间线保留最小脱敏证据,原始日志清理后仍可复盘;完整敏感材料受业务权限保护。决策说明区分事实、规则推断和模型判断,不展示模型内部思维链。重新分析会生成新记录,不能保证模型逐字重复回答。

8. 运维与故障处理

根据集群数量扩展 worker

启用集群采集后,平台每 60 秒检查已配置集群数量,按每个集群 1 个 worker 实例自动扩展,默认最多 8 个实例,每个实例 2 个并发进程。未启用采集时需求为最小实例数。容量按集群总数计算,大型集群仍需结合采集耗时、任务积压、CPU 和内存调整上限。

可在 /opt/lsf-monitor/config/settings.env 配置下列参数。实例数 = ceil(集群数 / WORKER_CLUSTERS_PER_INSTANCE),限制在最小值与最大值之间。

WORKER_MIN=1
WORKER_MAX=8
WORKER_CLUSTERS_PER_INSTANCE=1
WORKER_CONCURRENCY=2

WORKER_MIN 不大于 WORKER_MAX,实例上限最多 64;每实例集群数范围 1–1000,并发数范围 1–32。运行中仅新增实例;删除集群或降低上限后,执行 sudo ./stopsudo ./start 才会收缩,以保护在途采集和配置发布任务。修改并发数也需停启。多应用节点按每台机器独立计算实例数量,应为各节点分别设置容量预算。beat 不随 worker 扩展重复创建。

执行 sudo ./status 检查全部 worker 的健康状态,sudo ./logs worker 查看任务日志,sudo journalctl -u lsf-monitor-workers.service 查看扩展记录。数据库暂时不可用时保留已有 worker,恢复后下次检查重试。worker 由宿主机 systemd 管理。

日常运维、备份与恢复

适用角色:平台主机管理员/运维。前置条件:有维护窗口、可验证备份和完整配置/密钥;多节点使用该版本的集群维护说明,不把单机文件替换当集群升级。

  1. 在平台程序目录检查组件状态及日志,核对 API、worker、beat、web、PostgreSQL、QuestDB 和 Redis。数据库存业务关系,QuestDB 存历史指标,Redis 支持任务协调;worker 执行后台工作,beat 安排周期任务。
sudo ./status
sudo ./logs api
sudo ./logs worker
sudo ./logs -f beat
  1. 维护前创建一致的冷备份。该命令会暂停本项目组件,完成后恢复此前运行状态;备份须包含数据、配置、加密凭据与对应密钥。
sudo ./backup /var/backups/lsf-monitor/before-change
  1. v1.0.0.beta 是首次数据库基线,不提供开发版本数据库的升级或降级。不要对开发库执行 upgrade;保留旧环境及备份,在独立空数据目录按安装章节执行 init。后续版本的变更仅按其对应的发布说明执行。
  2. 已按首发基线安装的同版本修复包,先核对交付修订号和 SHA-256,将新包解压到独立目录,再在新包中执行 sudo ./upgrade --rebuild。安装器先做冷备份,保留账号、配置和密钥,再替换镜像;失败时恢复旧程序、数据库和镜像。相同镜像拒绝重复替换,中间件版本变化也会拒绝。备份所在文件系统须有大于程序及数据占用两倍的可用空间;只检查 /data 的空闲空间不够。
  3. 恢复时使用同一次冷备份中的完整程序、配置、数据与密钥,按备份清单核对版本和摘要后再启动。同版本替换意外中断并留下待恢复标记时,在保留的新包中执行 sudo ./upgrade --recover。保留失败现场,不通过清表、重写数据库版本标识或删除密钥处理初始化错误。
  4. 恢复后验证登录、集群列表、历史时间、最新采集、后台任务和已启用集成。单独复制运行中的数据库目录不能获得一致备份。

预期结果:备份可核验,恢复材料的版本、配置和数据相互匹配。失败处理:磁盘不足、密钥缺失、数据库版本不匹配时停止操作并保留现场;不同数据库实例不能同时读写相同目录。

HTTP、HTTPS 与常见问题

适用角色与前置条件:用户可核对访问地址;主机日志和协议配置由运维处理。

访问协议应与安装配置一致。无证书的 HTTP 部署使用 http://主机[:端口];TLS 部署使用 https://主机[:端口]。Cookie 和允许的 Origin 会随协议配置。仅在浏览器把 https 改成 http,不会改变现有 HTTPS 部署。HTTP 不加密密码和会话流量,应在可信网络使用。

现象排查方法
反复要求登录或会话验证失败核对协议、主机和端口;运维修改地址后清理旧 Cookie;检查 API 的 Origin 和 Cookie 配置。
找不到配置菜单检查系统设置中的功能开关和账号权限。
采集器测试失败检查采集开关、worker 到 URL 的网络、白名单、令牌、期望集群名、快照时间和主机时钟。
SSH 拒绝连接核对可信主机密钥、端口、账号权限及 LSF 配置目录。
没有最新指标查看 worker 和 beat 状态、采集器时间戳、当前集群和查询时间范围。
保存提示版本冲突重新加载最新配置后再修改,其他管理员已保存了更新版本。

在平台安装目录执行 sudo ./status,并使用 sudo ./logs apisudo ./logs worker 查看组件日志,添加 -f 可持续查看。排障时保留配置和加密密钥;删除它们不能安全地修复数据库或重置账号。

预期结果与失败处理:登录、采集和后台任务恢复;仍失败时记录版本、时间和脱敏错误,通过联系作者寻求支持。

卸载与支持

适用角色:平台主机管理员。前置条件:已确认停止使用并完成备份,记录数据和配置位置。

  1. 在安装目录执行 sudo ./uninstall,按脚本提示停止并移除本项目容器及开机服务。
  2. 核对数据库仍在原数据目录,程序、配置与密钥备份位于 /var/backups/lsf-monitor/uninstall-*。宿主机 Docker、其他容器和原 IBM LSF 环境保留;没有隐式删除数据选项。
  3. 需要恢复或排障时,通过软件“联系作者”查看离线私人微信二维码。提供产品版本、操作步骤、错误时间、脱敏日志与期望结果。

预期结果:平台停止,数据与恢复材料保留。失败处理:检查日志及残留状态;不要为清理安装而删除共享磁盘。不要发送密码、令牌、证书私钥或真实业务源码。软件为闭源交付,第三方组件保留各自许可证。