跳转至

TeleFuser

一个面向实时世界模型和多模态生成的开源**流式推理与服务框架**,覆盖连续流水线、多 GPU 分布式执行和生产服务接口。

PyTorch 2.6+ CUDA 12.8+ Triton kernels FastAPI service Ray distributed

运行时能力

世界模型运行时

连续执行、有状态会话和双向控制循环。

并行推理

Ulysses、Ring Attention、张量并行、流水线并行和 FSDP。

优化算子

编译感知 ops,支持 eager CUDA Triton 内核和 PyTorch 原生回退。

流式服务

FastAPI 批量服务,以及同时支持 server-push 和稳定交互式 WebRTC 的 LiveKit room。

特征缓存

AdaTaylorCache 和运行时缓存控制,面向重复生成工作负载。

可扩展流水线

可复用阶段、模型配置、调度器和流水线编排。

支持的模型

世界模型和实时推理

模型 任务 描述
LingBot-World v2 双向流式推理 通过 LiveKit 进行相机控制的交互式世界模型
LingBot-World-Fast 双向流式推理 通过 LiveKit 可靠数据消息控制的 legacy/causal-fast 模型
ABot-World-0-5B-LF 单卡交互式生成 通过直接 HTTP 或 LiveKit 浏览器控制,并保持因果 KV 状态

视频生成

模型 任务 描述
WanVideo (Wan2.1 / Wan2.2) T2V, I2V, FL2V 视频生成和编辑
LTX Video I2V + Audio 视频生成 + 音频
LTX-2.5 Distilled T2V、I2V + Audio 基于 ModuleManager 的六阶段流水线,支持 ½/4 张 H100 的 Ulysses SP
MiniMax H3 T2VA, FL2VA, Ref2VA + Audio 本地 768p 音视频联合生成
FlashVSR VSR 视频超分辨率
SwiftVR 因果视频修复 支持 BF16、torch.compile、FP8Linear、Ulysses SP 和 stage-parallel
LiveAct S2V 语音转视频
LongCat-Video T2V, I2V 长视频生成
LingBot-Video T2I, T2V, TI2V, MoE refiner 精度优先的 Dense/MoE 视频生成

图像生成

模型 任务 描述
Qwen-Image T2I, Edit 图像生成和编辑
Z-Image T2I 图像生成
Flux2 Klein T2I 图像生成

视觉语言动作

模型 任务 描述
LingBot-VLA v2 机器人操作 面向受支持机器人配置的视觉语言动作推理

从这里开始

文档分区


切换到英文 🇬🇧