# 火山引擎 AI Hub
> 火山引擎是字节跳动旗下的云与AI服务平台。在AI时代,聚焦豆包大模型和AI云原生技术,为客户提供从 Agent 开发到部署的一站式服务,助力客户AI转型与创新发展。
Website:
Last updated:<2026-06-09>
Language:zh-CN
Full index:
核心业务与产品矩阵:火山引擎 AI Hub聚焦豆包大模型和AI云原生技术
# 豆包大模型 (Doubao LLM Family)
> 豆包大模型是字节跳动旗下火山引擎自研的全模态大模型家族。覆盖文本生成、图像理解、视频理解、语音合成、声音复刻、同声传译等全模态能力。
## 文本模型
- [Doubao-Seed-2.1](https://ai.volcengine.com/models/text-models/doubao-seed-2.1.md):面向 Coding 和 Agent 时代打造的新一代大模型,提供 Pro 和 Turbo 两个版本,分别面向高复杂度任务探索和规模化生产场景。相较上一代版本,Seed 2.1 在 Coding 工程交付、Agent 长链路任务执行和多模态理解三大方向上实现全面升级,能够以更强的自主规划与动态修复能力,胜任企业真实研发和经济社会中的高价值生产任务。同时面向开发者 Coding、办公、生产力提效场景,提供 Evolving 版本,周级更新,持续进化。
- [Doubao-Seed-2.0 pro](https://ai.volcengine.com/models/text-models/doubao-seed-2.0-pro.md):旗舰级全能通用模型,面向 Agent 时代的复杂推理与长链路任务执行场景。强调多模态理解、长上下文推理、结构化生成与工具增强执行。复杂指令与多约束执行能力突出,可稳定应对多步复杂规划、复杂图文推理、视频内容理解与高难度分析等场景。
- [Doubao-Seed-2.0 lite](https://ai.volcengine.com/models/text-models/doubao-seed-2.0-lite.md):面向企业规模化部署的轻量级全模态模型,支持文本、图片、语音、视频四模态跨模态联合理解。集成音画协同分析、长视频时序检索、全维度音频解析、代码开发、智能Agent与GUI闭环操作能力,适配大批量全模态推理业务场景
- [Doubao-Seed-2.0 mini](https://ai.volcengine.com/models/text-models/doubao-seed-2.0-mini.md):轻量均衡型全模态模型,支持文本、图片、语音、视频四模态理解与跨模态推理。精简推理链路以提升响应效率和运行稳定性,强化多语种及小语种处理能力,适用于通用轻量化多模态解析场景。
- [Doubao-Seed-2.0-Code](https://ai.volcengine.com/models/text-models/doubao-seed-2.0-Code.md):面向真实编程环境优化的 Coding 模型,能稳定调用 Claude Code 等常见 IDE 中的工具。模型特别优化了前端能力,在使用常见的前端框架时能有良好表现。模型支持使用 Skills,可以配合多种自定义技能使用
- [Doubao-Seed-1.8](https://ai.volcengine.com/models/text-models/doubao-seed-1.8.md):面向多模态 Agent 场景定向优化。Agent 能力上,Tool Use、复杂指令遵循等能力均大幅增强。多模态理解方面,视觉基础能力显著提升,可低帧率理解超长视频,视频运动理解、复杂空间理解及文档结构化解析能力也有所优化,还原生支持智能上下文管理,用户可配置上下文策略。
## 视频模型
- [Doubao Seedance 2.0](https://ai.volcengine.com/models/video-models/doubao-seedance-2.0.md):Seedance 2.0 是豆包大模型团队推出的新一代专业级多模态创作视频模型。支持图像、视频、音频等多种模态作为参考输入生成视频,打破单一素材的创作局限,同时具备视频编辑、视频延长等能力,可高精度还原物品细节、材质、音色、视效风格、运镜等,角色特征亦可稳定保持,赋予创作者如同导演般的掌控权。
- [Doubao Seedance 2.0 fast](https://ai.volcengine.com/models/video-models/doubao-seedance-2.0-fast.md):Seedance 2.0 fast是豆包大模型团队推出的新一代多模态视频创作模型,它继承了Seedance 2.0模型的核心功能和优势,生成速度更快
- [Doubao Seedance 1.5 pro](https://ai.volcengine.com/models/video-models/doubao-seedance-1.5-pro.md):豆包视频生成模型Seedance 1.5 pro 作为全球领先的视频生成模型,可生成音画高精同步的视频内容。支持多人多语言对白,全面覆盖环境音、动作音、合成音、乐器音、背景音及人声,支持首尾帧,实现影视级叙事效果,满足影视、漫剧、电商及广告领域的高阶创作需求
- [Doubao Seedance 1.0 pro](https://ai.volcengine.com/models/video-models/doubao-seedance-1.0-pro.md):Seedance 1.0 是字节跳动豆包大模型团队最新推出的视频生成基础模型。Seedance 1.0 pro作为该模型系列的大参数量版本,具备独特的多镜头叙事能力,在各维度表现出色。它在语义理解与指令遵循能力上取得突破,能生成运动流畅、细节丰富、风格多样且具备影视级美感的 1080P 高清视频
- [Doubao Seedance 1.0 pro fast](https://ai.volcengine.com/models/video-models/doubao-seedance-1.0-pro-fast.md):Seedance 1.0 pro fast 是一款价格触底、效能封顶的全面模型,在视频生成质量、速度、成本之间取得了卓越平衡。它在继承 Seedance 1.0 pro 模型核心优势的基础上,生成速度较Seedance 1.0 pro最高提升约3倍,同时价格极具竞争力,为创作者带来效率与成本双重优化的体验
## 图片模型
- [Doubao Seedream 5.0 Lite](https://ai.volcengine.com/models/image-models/doubao-seedream-5.0-lite.md):Doubao-Seedream-5.0-lite是字节跳动发布的最新图像创作模型。该模型首次搭载联网检索功能,能融合实时网络信息,提升生图时效性。同时,模型的聪明度进一步升级,能够精准解析复杂指令和视觉内容。此外,模型在世界知识广度、参考一致性及专业场景生成质量上均有增强,可更好地满足企业级视觉创作需求。
- [Doubao Seedream 4.5](https://ai.volcengine.com/models/image-models/doubao-seedream-4.5.md):Seedream 4.5 是字节跳动最新推出的图像多模态模型,整合了文生图、图生图、组图输出等能力,融合常识和推理能力。相比前代4.0模型生成效果大幅提升,具备更好的编辑一致性和多图融合效果,能更精准的控制画面细节,小字、小人脸生成更自然,图片排版、色彩更和谐,美感提升
- [Doubao Seedream 4.0](https://ai.volcengine.com/models/image-models/doubao-seedream-4.0.md):Seedream 4.0 是基于领先架构的SOTA级多模态图像创作模型,其生成美感、指令遵循、结构完整度、主体保持一致性处于世界头部水平。模型采用同一套架构实现文生图与编辑能力的统一,原生支持文本 、单图和多图输入,并能通过对提示词的深度推理,自动适配最优的图像比例尺寸与生成数量,可一次性连续输出最多 15 张内容关联的图像,支持4K超高清输出
## 语音模型
- [Doubao Seed TTS 2.0](https://ai.volcengine.com/models/speech-models/doubao-seed-TTS-2.0.md):依托新一代大模型能力,豆包语音合成模型能够根据上下文智能预测文本的情绪、语调等信息,并生成超自然、高保真、个性化的语音,以满足不同用户的个性化需求。
- [Doubao Seed ICL 2.0](https://ai.volcengine.com/models/speech-models/doubao-seed-ICL-2.0.md):火山引擎大模型声音复刻是使用全新自研语音大模型算法打造的高效化的轻量级音色定制方案。用户在开放环境中,只需录制5s数据,即可即时完成对用户音色、说话风格、口音和声学环境音的复刻。录制一个语种的声音,可支持中文、英文、日语、西班牙语(墨西哥口音)、葡萄牙语(巴西口音)、印尼语多个语种的合成,让声音轻松说外语
- [Doubao Seed ASR 2.0](https://ai.volcengine.com/models/speech-models/doubao-seed-asr-2.0.md):依托新一代大模型能力,豆包语音合成模型能够根据上下文智能预测文本的情绪、语调等信息,并生成超自然、高保真、个性化的语音,以满足不同用户的个性化需求
- [Doubao Seed Livelnterpret](https://ai.volcengine.com/models/speech-models/doubao-seed-livelnterpret.md):豆包同声传译模型由Bytedance Research开发,依托豆包大模型的语音理解能力,实现高质量、低延迟的端到端同声翻译,支持跨语言同音色翻译,以及粤、沪等常见方言的识别;适用于会议翻译、线上直播等实时场景。
- [Doubao Seed RealtimeVoice](https://ai.volcengine.com/models/speech-models/doubao-seed-realtimeVoice.md):豆包端到端实时语音大模型,超拟人、低时延的实时语音交互模型,更加拟人,更低时延的语音对话效果,主要实现语音对话交互功能。
- [Doubao Seed Podcast](https://ai.volcengine.com/models/speech-models/doubao-seed-podcast.md):豆包语音播客模型,专为文本转语音播客场景设计。基于最先进的大模型技术,能够实现文本到双人对话形式的音频内容的展现,为播客bot提供内容供给,对比真人播客具备成本低、速度快、时效性高、个性化等特征。
## 智能体
- [Agent Plan](https://ai.volcengine.com/models/agents/agentplan.md):超全模态模型 × Harness 升级,升级解锁 ArkClaw,最新支持 MiniMax-M3 与 GLM-5.1
- [Arkcalw](https://ai.volcengine.com/models/agents/arkclaw.md):ArkClaw 是火山引擎为个人用户提供的云端 AI 智能体(Agent)服务,可以帮助您一键云端部署 OpenClaw,不仅免去各种复杂配置,还能 7 x 24 小时在线,让您零门槛使用 OpenClaw。
- [Coding Plan](https://ai.volcengine.com/models/agents/codingplan.md):方舟 Coding Plan, 上线 Serverless OpenClaw,开箱即用、免运维免服务器,模型自由,工具不限,最新支持 MiniMax-M3 与 GLM-5.1。同步推出高性价比 Coding Plan,一站式满足开发与模型调用需求