TeleFuser¶
一个面向世界模型推理和多模态生成的**高性能运行时**,覆盖长时运行流水线、分布式执行和生产服务接口。
PyTorch 2.6+ CUDA 12.8+ Triton kernels FastAPI service Ray distributed
运行时能力¶
世界模型运行时
连续执行、有状态会话和双向控制循环。
并行推理
Ulysses、Ring Attention、张量并行、流水线并行和 FSDP。
优化算子
编译感知 ops,支持 eager CUDA Triton 内核和 PyTorch 原生回退。
流式服务
FastAPI 批量服务,以及同时支持 server-push 和稳定交互式 WebRTC 的 LiveKit room。
特征缓存
AdaTaylorCache 和运行时缓存控制,面向重复生成工作负载。
可扩展流水线
可复用阶段、模型配置、调度器和流水线编排。
支持的模型¶
世界模型和实时推理¶
| 模型 | 任务 | 描述 |
|---|---|---|
| LingBot-World v2 | 双向流式推理 | 通过 LiveKit 进行相机控制的交互式世界模型 |
| LingBot-World-Fast | 双向流式推理 | 通过 LiveKit 可靠数据消息控制的 legacy/causal-fast 模型 |
视频生成¶
| 模型 | 任务 | 描述 |
|---|---|---|
| WanVideo (Wan2.1 / Wan2.2) | T2V, I2V, FL2V | 视频生成和编辑 |
| HunyuanVideo | T2V, I2V | 视频生成 |
| LTX Video | I2V + Audio | 视频生成 + 音频 |
| FlashVSR | VSR | 视频超分辨率 |
| LiveAct | S2V | 语音转视频 |
| LongCat-Video | T2V, I2V | 长视频生成 |
| LingBot-Video | T2I, T2V, TI2V, MoE refiner | 精度优先的 Dense/MoE 视频生成 |
图像生成¶
| 模型 | 任务 | 描述 |
|---|---|---|
| Qwen-Image | T2I, Edit | 图像生成和编辑 |
| Z-Image | T2I | 图像生成 |
| Flux2 Klein | T2I | 图像生成 |
快速开始¶
# 安装
pip install telefuser
# 批量服务
telefuser serve /path/to/pipeline.py --port 8000
# LiveKit-backed 流服务(基础安装已包含 Python SDK)
telefuser stream-serve examples/lingbot/lingbot_world_fast_image_to_video_h100.py \
--livekit-url ws://127.0.0.1:7880 \
--livekit-api-key devkey --livekit-api-secret secret \
-p 8088
文档分区¶
服务指南批量服务、任务 API 和 SDK。 流式服务LiveKit session、媒体、data topic 和双向控制。 流式调度器Actor 所有权、有界数据流、生命周期、指标和 GPU 卡位。 AIPerf 基准测试Batch 视频与 LingBot LiveKit 测试流程。 配置运行时、注意力、量化和卸载配置。 TF-Kernel安装、编译、验证和使用可选 CUDA 扩展。 并行推理分布式处理策略。 新增模型集成新的模型架构和阶段。 性能分析性能分析工具。