EN|中文

一次设置,持续共享 GPU,无需日常运维。

MTGPU 自动配置用户账户与 SSH 访问、实施隔离,并管理工作空间和作业。受邀用户登录即可开始工作——无需配置服务器地址、交换密钥、开放端口或部署 VPN。

下载 MTGPU 查看工作方式

MTGPU Server

将现有硬件变成共享基础设施

MTGPU 可安装在运行 Linux 或 WSL2 的现有工作站、机架服务器或云主机上,无论是否配备 GPU,并通过一份便于审核的配置文件定义策略。此后,MTGPU 自动处理用户生命周期、共享资源、工作空间、队列和资源分配等日常运营。需要集群时只需增加节点,用户的工作方式无需改变。仅配备 CPU 的主机同样支持托管 SSH 访问、隔离账户、工作空间、容器和作业;配备 GPU 的主机还提供 GPU 发现、分配和调度。

默认保持私有无需公网 IP、开放入站端口或部署 VPN;连接始终采用端到端加密。
首次访问即可使用租户账户和 SSH 密钥均由系统自动配置;已有系统账户可继续使用,不受影响。
兼顾两种工作方式交互式开发和无人值守作业共享同一资源视图。
单机起步,集群扩展增加节点,无需改变团队已有的工作方式。
Remote-GPU 面板显示可用 GPU 服务器和实时使用率

在一个界面中查看所有获得授权的服务器:硬件信息、实时使用率、SSH 访问、交互式工作空间、Python 环境和作业状态。

同一资源池,两种工作方式

保持交互,或交给调度器

同一批 GPU 既能支持白天的快速实验,也能在所有人离开后继续运行长时间任务。

可复用的工作空间

在终端中打开一个无 root 权限的容器,或连接 Microsoft 的 Dev Containers 扩展,像在本地一样开发项目。工作空间可来自管理员模板、由您自定义工作空间保存的镜像、OCI 镜像或 devcontainer.json;GPU 可见性、挂载和生命周期均由 MTGPU 管理,并按您的选择发布端口——Jupyter、TensorBoard 或您自己的 Web 界面一键即达。

无人值守作业

使用 mt-job 运行原生或容器化命令,无需保持终端打开。您可以声明 GPU、最低显存、CPU、内存和优先级;作业完成后,临时工作空间会自动移除并释放其占用的资源,而执行日志仍会保留,供日后查看和获取。

可自动接替的调度器

作业可以提交给单台服务器或整个集群。队列通过等待时间实现公平调度,任务根据实时空闲资源分配;调度状态会在成员间复制,当选定的调度器离线时,另一成员可以自动接替。

多租户共享,无需复杂管理

共享机器,边界依然清晰

MTGPU 使用标准 Linux 安全机制,而不是另建一套身份系统。每位授权用户都有私有的非特权操作系统账户,容器也以该身份无 root 权限运行。

大体量资源只存一份管理员只需发布一次数据集和准备好的 Python 环境,即可以只读方式供所有账户共享,无需把 CUDA 软件栈和 TB 级数据复制到每位用户的主目录。
缓存比工作空间更长久持久化的用户专属卷让 pip 软件包和 Hugging Face 模型下载在工作空间停止或重建后依然保留——每个账户拥有独立副本,无需每天重新下载数 GB 的内容。
资源自动回到资源池磁盘配额和保留策略控制存储增长;真正处于空闲状态的交互式工作空间会自动停止并释放其预留的 GPU。
继续使用现有工具MTGPU 不会把机器封闭起来:您的工作流程已经依赖的外部工具可以照常与 MTGPU 并行使用,无需任何改变。

扩容,无需改变用户体验

共享或独立租户主目录,都使用同一个集群队列

无论采用共享租户存储,还是每个成员使用独立租户主目录,MTGPU 的集群作业队列都能工作。从任一成员提交作业,集群都会将其安排到资源合适的节点。仅配备 CPU 的节点也可以加入同一集群,并运行不需要 GPU 资源的作业。采用共享存储时,账户身份和文件也会在成员间保持一致,用户可以在 GPU 计算机之间切换,并看到同一个主目录、项目、软件包和运行结果,无需部署单独的目录服务。采用独立主目录时,作业使用所选成员上的文件。集群成员甚至不必在同一个网络中:集群协调通过 DirectLink 传输,位于不同楼宇、不同城市甚至不同云端的机器都能加入同一个队列,工作方式完全相同——无需 VPN,也无需端口转发。

共享主目录的连续体验

共享的 UID/GID 分配机制在 Linux 和 WSL2 成员间保护文件属主关系;存储预检则会发现无法维持租户隔离的文件系统。

了解资源的容量调度

每个节点都会报告 GPU、显存、CPU 和内存余量。作业可独占 GPU,可在保证显存容纳的前提下共享 GPU,也可以超配方式机会共享。集群把每个作业放到真正容纳得下的节点上,并拒绝整个集群都不可能满足的请求。

适应用户的工作方式

同样的访问方式,VS Code 或终端皆可

既可在 VS Code 中使用 MTGPU,也可从终端使用。两个客户端发现同一批获得授权的服务器,并提供相同的核心访问和工作空间操作。

面向 VS Code 的 Remote-GPU

发现服务器、比较实时使用率并创建交互式工作空间。随后启动 Microsoft 的 Remote - SSH 或 Dev Containers 扩展,像在本地一样打开主机或工作空间内的项目;还可在同一 MTGPU 面板中选择 Python 并跟踪作业状态。

remotegpu-cli

无需 VS Code,通过键盘驱动的终端程序获得相似的服务器发现、实时使用率、SSH 访问、工作空间管理、Python 选择和作业状态功能。

两种工作方式,共用同一个作业命令。在 Remote-GPU 或 remotegpu-cli 打开的 SSH 终端中运行 mt-job,即可提交、查看、取消和自动化作业。可复用的作业规范文件可以和使用它的项目放在一起。

几分钟完成设置,也可无界面运行。引导式安装程序可以配置 Linux 和 WSL2 主机,包括无 root 权限容器以及 WSL 特有的网络和 cgroup 要求。所有策略仍集中在一份便于审核的配置文件中。想了解每一个细节?用户手册完整涵盖安装、配置、工作空间和作业。

让您已经拥有的 GPU 真正运转起来。

连接一台主机、邀请团队,然后从第一次交互式实验自然过渡到集群调度作业,无需更换平台。