分享好友 健康资讯首页 健康资讯分类 切换频道

又一国产模型重磅开源,有声视频编辑全球第一,16家芯片及平台首日适配

2026-08-04 08:0011036kr

文图音视频一把抓。

智东西8月3日报道,MiniMaxink>正式开源新一代通用视频模型ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3。

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3是一个通用型全模态生成系统,可统一理解文本、图像、视频和音频组成的多模态上下文,生成最长15秒、最高2K分辨率并带有原生立体声音频的视频。

此前7月31日,ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3发布。目前,在Artificial Analysis有声视频编辑榜单中,ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3以1130分的Elo成绩位列第一,领先Gemini Omni Flash、HappyHorse-1.0、Wan 2.7等国内外视频模型。

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3位列有声视频编辑榜单榜首

H3系统由H3-Context-IR、H3-Base、H3-Regenerate-2K三个模块组成。开发者可以直接从Hugging Face下载ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3模型,H3-Base目前支持通过SGLang、vLLM、diffusers和ComfyUI等推理框架和工作流进行部署。

与模型开源同步,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等开发社区和云推理平台,另有vLLM-Omni、SGLang等推理框架,共16家生态伙伴均完成了相关适配支持。

开源地址:

huggingface.co/ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>AI/ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>-H3

模型体验地址:

H3-2K直出:

platform.minimaxi.com/docs/api-reference/video-generation-v2-create

H3-Context-IR:

platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir

H3-Regenerate-2K:

platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> Hub: hub.minimaxi.com

ink data-id="14648" data-name="海螺AI" data-logo="https://img.36dianping.com/20250909/v2_7cee27e5455940c480e049a18cfc76ad_oswg33372oswg600oswg600_img_000" data-classify-list="音乐生成,智能搜索,文本生成" data-refer-type="20">海螺AIink>:hailuoai.com

今天,智东西对ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3进行了实测。ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3已经能够完成不同类型的视频生成任务,在画面自然度、镜头组织和整体风格一致性方面表现较好。模型在画面真实感、镜头编排等方面有一定的提升空间。

比如,我们让模型生成了一段15秒的风光摄影航拍视频,成片中的雪山、草地等自然景观较为真实,色彩、光影和航拍镜头运动也比较自然,长镜头整体保持了较好的视觉连贯性。不过,画面中的寺庙建筑仍有较明显的AI生成感。

随后,我们又让ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3生成了一段奶茶和游戏IP联动的广告宣传视频。ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>生成的视频包含6个分镜头,整体叙事顺序较为清楚,画面风格和广告氛围也基本统一。不过,在多镜头编排方面,模型出现了一处较明显的重复:店员向顾客递出奶茶的动作被连续呈现了两次。

01.最长生成15秒2K视频,画面与立体声同步输出

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3 是一个通用型全模态生成系统。在输出规格方面,H3可生成4秒至15秒的视频,支持21:9、16:9、4:3、1:1、3:4、9:16等多种画面比例,输出帧率为24FPS,并可同步生成32kHz立体声音频。

模型默认生成短边为768像素的视频,通过H3-Regenerate-2K可进一步生成2K版本。H3稳定支持中文、英语、日语、韩语、法语、德语等11种语言,对其他语言也提供不同程度的支持。

H3包含FL2VA和Ref2VA两个版本,分别面向首尾帧生成与全模态参考生成。

H3-Base-FL2VA为首尾帧模式,最多可输入两张图像。不输入图像时,模型执行文生视频任务;输入一张首帧或尾帧图像时,可生成对应的首帧生视频或尾帧生视频;同时输入两张图像时,则可根据指定的首尾画面生成中间的视频内容。

H3-Base-Ref2VA支持全模态参考模式,最多可输入9张图像;视频最多可输入3段,每段时长为2秒至15秒,总时长不超过15秒;音频最多可输入3段,每段时长为2秒至15秒,总时长不超过15秒,且必须与图像或视频一同输入,不能作为唯一输入。图像、视频和音频文件合计最多可输入12个。

02.三大模块协同生成音视频,2K画面采用上下文再生成

H3系统由负责理解和整理多模态指令的H3-Context-IR、负责生成音视频的H3-Base,以及负责生成2K画面的H3-Regenerate-2K三个模块组成。

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3系统概览(图源:ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>)

H3-Context-IR是一套托管式预处理与编排系统,能够理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。其内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理。

H3-Context-IR依赖多阶段工作流,以及多个托管模型与服务,该模块暂未开源。ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>目前提供了相应API和提示词指南,开发者可以据此搭建自己的多模态预处理系统。

视频提示词写作指南:

huggingface.co/ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>AI/ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md

全参考模式输出指南:

huggingface.co/ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>AI/ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

H3-Base负责实际的音视频生成。文本由H3-Encoder编码,视觉素材同时经过H3-Encoder和H3-VisualVAE处理,音频则由H3-AudioVAE编码。不同模态的信息随后被组织成统一序列,输入H3-Omni-Transformer。

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3-Base架构概览(图源:ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>)

对于H3的2K分辨率输出,H3没有采用传统的专用超分辨率模块,而是通过H3-Regenerate-2K,让基础模型结合原始文本及多模态参考素材,对已经生成的768p视频重新生成。这种方式可以再次利用原始上下文,有助于还原小文字和精细纹理等仅凭低分辨率画面难以补全的信息。该模块目前同样尚未开源,开发者可通过官方API复现完整的2K生成流程。

03.本地部署可生成768p音视频,完整2K工作流需调用API

ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>为开发者提供了H3-Base本地部署和完整2K工作流两种验证方式。H3-Base以FL2VA和Ref2VA两个独立模型仓库发布,均包含处理器、分词器、文本编码器、Omni Transformer、Visual VAE和Audio VAE等推理组件,可通过SGLang、vLLM、diffusers和ComfyUI等框架或工作流部署,并支持多GPU并行推理。

仅在本地部署H3-Base时,开发者可以生成短边为768像素的音视频。其中,FL2VA版本支持文生音视频及首尾帧生成,Ref2VA版本支持联合参考图像、视频和音频,完成角色与场景保留、动作和嘴型编辑、音色参考等任务。

完整2K工作流则需要结合本地模型与官方API:首先由H3-Context-IR理解并扩展用户输入,随后由本地部署的H3-Base生成768p音视频,最后通过H3-Regenerate-2K结合原始上下文重新生成2K视频。ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>还提供了文生音视频、首帧生音视频和全模态参考生成等可复现案例,相关请求参数、示例代码和参考结果均可在Hugging Face模型页面查看。

04.结语:全模态视频生成,加速走向开放生态

从实际效果来看,ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3已经能够处理自然风光、商业广告等不同类型的生成任务,在画面自然度、镜头组织和风格一致性方面展现出较高的完成度。

随着多家芯片厂商、开发社区、云推理平台和推理框架同步完成适配,ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink> H3此次开源不仅开放了模型能力,也初步打通了从模型下载、本地部署到应用开发的生态链路。全模态视频模型之间的竞争,正从单一画面效果进一步延伸至声音生成、复杂指令理解和产业生态建设。

本文来自微信公众号“智东西”(ID:zhidxcom),作者:杨京丽,编辑:李水青,36氪经授权发布。

举报
收藏 0
打赏 0
评论 0
上海土拍揽金90.6亿 一家不锈钢企业青山实业成最大赢家
上海第七批次土拍终于落槌。如果只看实时拍地数据,这似乎是波澜不惊的一天:上架5宗地块全部拍出,总揽金90.6亿元,没有所谓的地王地块,也没有超高溢价率的房企争夺战。但如果将视角拉远,会发现这场土拍背后,筛选出了上海楼市中两种截然不同的资本面孔。第一类,是常年参与上海土拍的各大房企们:从绿城、招商,再到华润、联发,几家企业已沉浸这片楼市多年;第二类,则是那些选择“跨界”入局的实业企业们,而本场土拍中

0评论2026-08-0567

早期项目 | 从智能喂养切入,一家创业公司想搭建母婴AI生态
作者 | 张子怡编辑 | 袁斯来母婴市场在全球拥有万亿级规模。中国的母婴消费市场规模已突破5万亿元,年均增速保持12%的稳健水平;全球母婴市场总量更是达到约2万亿美元。庞大的母婴市场背后,其智能化渗透率较低,尚不足1%。全球母婴家庭普遍面临养育压力大、成本高、信息繁杂等核心痛点,而传统母婴产品仍停留在基础功能阶段,智能化程度不足、生态割裂,无法满足新一代家庭需求。以喂奶为例,不少家庭依然采用着极为

0评论2026-08-0569

壹酒店“失败”启示录……
近日,三亚海棠湾阳光壹酒店正式撤牌,原址将引入希尔顿旗下康莱德品牌。这意味着新喜达屋在中国内地的唯一酒店黯然离场,也宣告康莱德阔别四年后重回海棠湾。为何是小众先锋的壹酒店退出,而老派奢华的康莱德归来?在存量竞争白热化的当下,业主为何要么自持、要么纷纷转向国际酒店巨头?壹酒店换牌康莱德,新喜达屋退出中国市场?近日,三亚海棠湾康莱德酒店项目悄然落地了。令人意外的是,该项目曾一度传出要换牌凯悦旗下的奢华

0评论2026-08-0572