TeleFuser¶
一个面向实时世界模型和多模态生成的开源**流式推理与服务框架**,覆盖连续流水线、多 GPU 分布式执行和生产服务接口。
PyTorch 2.6+ CUDA 12.8+ Triton kernels FastAPI service Ray distributed
运行时能力¶
连续执行、有状态会话和双向控制循环。
Ulysses、Ring Attention、张量并行、流水线并行和 FSDP。
编译感知 ops,支持 eager CUDA Triton 内核和 PyTorch 原生回退。
FastAPI 批量服务,以及同时支持 server-push 和稳定交互式 WebRTC 的 LiveKit room。
AdaTaylorCache 和运行时缓存控制,面向重复生成工作负载。
可复用阶段、模型配置、调度器和流水线编排。
支持的模型¶
世界模型和实时推理¶
| 模型 | 任务 | 描述 |
|---|---|---|
| LingBot-World v2 | 双向流式推理 | 通过 LiveKit 进行相机控制的交互式世界模型 |
| LingBot-World-Fast | 双向流式推理 | 通过 LiveKit 可靠数据消息控制的 legacy/causal-fast 模型 |
| ABot-World-0-5B-LF | 单卡交互式生成 | 通过直接 HTTP 或 LiveKit 浏览器控制,并保持因果 KV 状态 |
视频生成¶
| 模型 | 任务 | 描述 |
|---|---|---|
| WanVideo (Wan2.1 / Wan2.2) | T2V, I2V, FL2V | 视频生成和编辑 |
| LTX Video | I2V + Audio | 视频生成 + 音频 |
| LTX-2.5 Distilled | T2V、I2V + Audio | 基于 ModuleManager 的六阶段流水线,支持 ½/4 张 H100 的 Ulysses SP |
| MiniMax H3 | T2VA, FL2VA, Ref2VA + Audio | 本地 768p 音视频联合生成 |
| FlashVSR | VSR | 视频超分辨率 |
| SwiftVR | 因果视频修复 | 支持 BF16、torch.compile、FP8Linear、Ulysses SP 和 stage-parallel |
| LiveAct | S2V | 语音转视频 |
| LongCat-Video | T2V, I2V | 长视频生成 |
| LingBot-Video | T2I, T2V, TI2V, MoE refiner | 精度优先的 Dense/MoE 视频生成 |
图像生成¶
| 模型 | 任务 | 描述 |
|---|---|---|
| Qwen-Image | T2I, Edit | 图像生成和编辑 |
| Z-Image | T2I | 图像生成 |
| Flux2 Klein | T2I | 图像生成 |
视觉语言动作¶
| 模型 | 任务 | 描述 |
|---|---|---|
| LingBot-VLA v2 | 机器人操作 | 面向受支持机器人配置的视觉语言动作推理 |
从这里开始¶
WebRTC 核心体验在浏览器控制 LingBot-World v2 并接收生成视频。 安装安装软件包并验证 CUDA 可用性。 基础推理在本地运行 Wan2.1 1.3B 并提交 HTTP 任务。 支持的模型选择模型、权重来源和经过验证的运行配置。
文档分区¶
运行时与优化配置、并行、注意力、缓存、量化和卸载。 运维与参考指标、日志、性能分析、基准和故障排查。 开发者指南集成模型、阶段、示例和公共算子。 技术博客优化设计、profiling 证据、效果与 Related Work。