Pass IndexThe State of AISign in

MiniMax-H3

MiniMax-H3 is MiniMax's open general-purpose multimodal generation model: it understands a unified context of text, images, video and audio and generates video with native stereo sound at up to 2K resolution and 15 seconds, including multiple shots in one generation.

text + image + audio + video → audio + video · made by MiniMax

$0.04per image
MiniMax

Sold by 2 ways

SellerLaneRate
MiniMax api2k$0.04per image$7.8per minuteplatform.minimax.io · read 2026-08-25
MiniMax api768p$0.04per image$4.8per minuteplatform.minimax.io · read 2026-08-25

Measured 1 standing

PlaceBoardMetricScore
3rdof 32Artificial Analysis · Text to Video ArenaElo1227

About

MiniMax-H3 — an audio and video model from MiniMax, placed 3rd of 32 on Artificial Analysis · Text to Video Arena.

It takes text, images, audio and video and returns audio and video. It was published in July 2026. The catalogue files it under video. It stands 3rd of 32 on Artificial Analysis · Text to Video Arena.

Every current figure

Maker
MiniMax
Register
model
Takes
text + image + audio + video
Returns
audio + video
Published
July 2026
Licence
not read
Boards
1
Best place
3rd of 32 — Artificial Analysis · Text to Video Arena

Known as 1 name

MiniMax H3