Skip to content

面向共享机器的单节点调度

让一台 Linux 机器拥有真正的任务调度器

一个轻量 CLI 加本地 daemon,完成 GPU / CPU 任务的提交、调度与查看。

  • 单节点设计
  • GPU 感知调度
  • 基于 tmux 的执行
  • 可供 Agent 使用的 MCP
工作站会话gflowd · 127.0.0.1:5577
$gflowd up
daemon ready on 127.0.0.1:5577
$gbatch --gpus 1 --project vision python train.py
submitted batch job 184
$gqueue
JOBIDNAMESTATEGPUNODE
184trainRUNNING1e40a
$gjob log 184
step=420 loss=0.184 throughput=178 img/s

为什么需要它

当一台机器不再只属于你

一旦机器开始共享,临时 tmux 和口头约定就会失效。

没有纪律时

  • 长任务和交互式工作互相打架。
  • 失败后日志散落,没有状态可恢复。
  • GPU 规则靠经验,而不是策略。

用 gflow 后

  • 一个 daemon 统一管理状态与队列。
  • 每个任务可查看、可恢复。
  • 资源与依赖在提交前明确声明。

工作流

四条命令,一次可控运行

01gflowd up启动 daemon
02gbatch --gpus 1提交任务
03gqueue查看调度
04gjob log <id>跟踪日志

能力概览

为日常工作站而设计

队列与生命周期

提交、挂起、取消、更新与重做任务。

GPU 感知调度

声明 GPU、共享、并限制显存。

工作流编排

用依赖、数组任务与参数扫描串联。

可观测性

以表格、树、JSON、CSV 或 YAML 查看状态。

可恢复执行

每个任务都跑在独立 tmux 会话里。

自动化与 AI

通过本地 MCP server 驱动调度。

适用场景

适用场景

共享实验室 GPU 服务器

多人共用一台机器,用规则替代口头协调。

个人研究主机

让长时间实验保持结构化、可恢复。

本地评测流水线

串联预处理、训练、评测与汇总。

AI 集成

把调度操作变成 Agent 工具

将 gflow 作为本地 stdio MCP server 运行,Agent CLI 可查看队列并驱动流程。

gflow mcp serve
阅读 AI 指南

从你已有的那台机器开始调度

文档同时也是一本运维手册。

Released under the MIT License.