← Все статьи

Gemini Omni (он же Google Omni и Veo Omni): видео с персонажами, голосом и 4K

Gemini Omni — мультимодальная генерация видео

Коротко о главном (BLUF)

В этом материале мы разбираем ключевые аспекты работы с нейросетями: актуальные модели, практические советы по промптам и примеры генераций. Читайте дальше, чтобы узнать подробности.

У этой модели три имени, и все три вы наверняка встречали: Gemini Omni, Google Omni и Veo Omni. Кто-то зовёт её по семейству Gemini, кто-то по видеолинейке Veo, кто-то просто «омни» — речь об одной и той же нейросети для генерации видео. У нас она работает в разделе «Видео», и запустить её можно без подписки, с оплатой за конкретную генерацию.

Что стоит за словом «Omni»

Обычная видеомодель принимает текст или одну картинку. Здесь вход смешанный: текстовое описание плюс до семи изображений, видео или аудио как дополнительный контекст. Нужен ролик в духе конкретного кадра и с настроением конкретной мелодии — приносите всё сразу, модель учтёт каждый источник.

Это меняет саму постановку задачи. Вместо абзаца «представь дом такой-то, свет такой-то» вы показываете фотографию дома, а словами описываете только действие. Текст отвечает за сюжет, вложения — за облик.

Персонажи: один герой во всех роликах

Главная беда обычных генераторов — герой меняется от ролика к ролику. В Gemini Omni для этого есть отдельная вкладка персонажей: героя создают один раз, он сохраняется в вашу библиотеку и дальше подключается к любой генерации одним кликом. Внешность остаётся стабильной от видео к видео.

Так собираются серии: виртуальный ведущий рубрики, маскот бренда, персонаж для детских историй. Не нужно каждый раз заново загружать референсы и надеяться, что модель «вспомнит» лицо.

Смешанный вход: текст, изображение и звук в одной генерации

Голос: готовые пресеты и свой собственный

Ролик может сразу выйти со звуком. В настройках есть набор готовых голосов — мужских и женских, от мягких высоких до низких с хрипотцой. Выбираете голос, прописываете реплику в описании — и персонаж говорит прямо в кадре. Если пресеты не подходят, во вкладке аудио создаётся собственный голос на основе базового: он тоже попадает в личную библиотеку. Для бренда это способ закрепить один узнаваемый голос за всеми видео.

До 4K, длительность и формат кадра

Это одна из немногих моделей на сайте с выводом в 4K: доступны 720p, 1080p и 4K. Длительность — 4, 6, 8 или 10 секунд, кадр горизонтальный 16:9 или вертикальный 9:16 под соцсети. Практичный маршрут простой: черновики гонять в 720p, а удачный вариант перезапустить в 1080p или 4K.

Сколько это стоит

Цена зависит от длительности, качества и от того, подаёте ли вы на вход видео, и всегда показывается в форме до запуска — вы видите сумму, прежде чем нажать кнопку. Подписки нет: платите за конкретный ролик из общего баланса, пополнить его можно российской картой. Черновик в 720p на четыре секунды стоит заметно дешевле десятисекундного 4K, поэтому проверять идею дешевле, чем сразу снимать финал.

С чего начать

  1. Откройте страницу модели и сделайте первый ролик из одного текста — так вы почувствуете, как она читает описания.
  2. Добавьте картинку-референс: пусть слова отвечают за действие, а изображение — за облик сцены.
  3. Подключите голос и реплику, если в кадре кто-то говорит.
  4. Заведите постоянного персонажа, когда нужна серия роликов с одним героем.

В описании сцены держите порядок: кто в кадре, что делает, где происходит, как ведёт себя камера. Реплику выносите отдельным предложением. Такая структура почти всегда даёт связный ролик с первой-второй попытки.

Ищете модель по названию Google Omni или Veo Omni — это она же: Gemini Omni доступна здесь. Рядом, в разделе «Видео», лежат и другие видеомодели, если захотите сравнить.

🇬🇧 English version

This model goes by three names, and you have probably seen all of them: Gemini Omni, Google Omni and Veo Omni. Some people name it after the Gemini family, some after the Veo video line, some just say "omni" — it is the same AI video generator. On NeuralSpace it runs in the Video section, with no subscription and pay-per-generation billing.

What "Omni" actually means

A typical video model takes text or a single picture. This one takes a mixed diet: a text prompt plus up to seven images, video or audio as extra context. Want a clip inspired by a specific frame, carrying the mood of a specific track? Bring everything at once — every attached source is taken into account.

That changes how you frame the task. Instead of a paragraph painting "a house like this, light like that", you show a photo of the house and use words only for the action. Text drives the plot, attachments define the look.

Characters: one hero across every clip

The curse of ordinary generators is that the hero mutates from clip to clip. Gemini Omni solves it with a dedicated character tab: you create a hero once, it lands in your library, and from then on you attach it to any generation with one click. The appearance stays consistent video after video.

That is how series get made — a virtual show host, a brand mascot, a recurring character for children's stories — without re-uploading references and hoping the model remembers the face.

Mixed input: text, image and sound in a single generation

Voice: presets and your own

A clip can come out with sound from the start. The settings offer preset voices, male and female, from soft and high to low and gravelly. Pick a voice, put the line into your prompt, and the character speaks right in the frame. If none of the presets fit, the audio tab lets you build a custom voice on top of a base one; it joins your library and plugs into generations like any other. For a brand, that means one recognizable voice across every video.

Up to 4K, duration and frame format

It is one of the few models on the site with 4K output: 720p, 1080p and 4K are available. Clip length is 4, 6, 8 or 10 seconds; the frame is widescreen 16:9 or vertical 9:16 for social feeds. A practical routine: iterate drafts in 720p, then rerun the winning version in 1080p or 4K.

What it costs

The price depends on duration, quality and whether you feed video in, and it is always shown in the form before you start — you see the amount before pressing the button. There is no subscription: you pay for a specific clip from your NeuralSpace balance. A four-second 720p draft costs noticeably less than a ten-second 4K render, so testing an idea is cheaper than shooting the final cut straight away.

How to start

  1. Open the model page and make the first clip from text alone, to feel how it reads descriptions.
  2. Add a reference image: let the words carry the action and the picture carry the look.
  3. Attach a voice and a line if someone speaks in the frame.
  4. Set up a persistent character once you need a series with the same hero.

Keep the classic order in your scene description: who is in the frame, what they do, where it happens, how the camera behaves. Give a spoken line its own sentence. This structure usually produces a coherent clip on the first or second attempt.

If you were searching for Google Omni or Veo Omni — this is the same model: Gemini Omni is available here. Other video models sit next to it in the Video section if you want to compare.

🇨🇳 中文版

这个模型有三个名字,你可能都见过:Gemini OmniGoogle OmniVeo Omni。有人用 Gemini 系列命名,有人用 Veo 视频产品线命名,还有人直接说「omni」——它们是同一个 AI 视频生成器。在 NeuralSpace 上,它运行在视频板块,无需订阅,按生成付费。

「Omni」到底是什么意思

典型的视频模型只接受文本或单张图片。这个模型接受混合输入:一段文本提示词加上最多七个图像、视频或音频作为额外上下文。想要一段受特定画面启发、带着特定音乐氛围的片段?把所有素材一起放进去——每个附加的源都会被考虑进去。

这改变了你构建任务的方式。不用写一大段文字描述「像这样的房子,那样的光线」,你直接展示房子的照片,用文字只描述动作。文本驱动情节,附件定义外观。

角色:每个片段中保持同一主角

普通生成器的痛点是主角在片段之间会变形。Gemini Omni 用专门的角色标签页解决了这个问题:你创建一次主角,它就进入你的素材库,之后只需一键点击就能把它附加到任何生成任务中。外观在每个视频中保持一致。

这就是系列片的制作方式——虚拟节目主持人、品牌吉祥物、儿童故事中的固定角色——无需重新上传参考图,也不用寄希望于模型记住那张脸。

混合输入:在一次生成中使用文本、图像和声音

语音:预设和自定义

片段可以从一开始就带声音输出。设置中提供了预设语音,男声女声都有,从柔和高音到低沉沙哑。选择一个声音,把台词放进提示词,角色就会在画面中说话。如果预设都不合适,音频标签页让你在基础声音之上构建自定义语音;它会加入你的素材库,像其他素材一样插入生成任务。对品牌来说,这意味着每个视频都有一个可识别的声音。

最高 4K、时长和画面格式

这是网站上少数支持 4K 输出的模型:可选 720p、1080p 和 4K。片段时长有 4、6、8 或 10 秒;画面是宽屏 16:9 或竖屏 9:16(适合社交媒体)。实用的工作流程:用 720p 迭代草稿,然后用 1080p 或 4K 重新跑一遍最终版本。

价格怎么算

价格取决于时长、质量以及是否输入视频,并且总是在表单中显示——按下按钮前你就能看到金额。没有订阅费:你从 NeuralSpace 余额中为具体的片段付费。四秒 720p 的草稿成本明显低于十秒 4K 渲染,所以测试创意比直接拍最终版便宜得多。

如何开始

  1. 打开模型页面,先只用文本生成第一个片段,感受它如何理解描述。
  2. 添加一张参考图:让文字承载动作,图片承载外观。
  3. 如果画面中有人说话,附加一个语音和台词。
  4. 当你需要用同一主角制作系列时,设置一个持久角色。

在场景描述中保持经典顺序:画面中有谁、他们在做什么、发生在哪里、镜头如何运动。把台词单独写成一句话。这种结构通常在第一次或第二次尝试就能生成连贯的片段。

如果你一直在搜索 Google Omni 或 Veo Omni——这就是同一个模型:Gemini Omni 可在这里使用。其他视频模型在视频板块旁边,如果你想对比的话。

Часто задаваемые вопросы (FAQ)

Вопрос: Как получить лучший результат от нейросети?
Ответ: Используйте подробные промпты (описания) на английском языке, задавайте стиль и детали сцены.

Вопрос: Можно ли использовать эти материалы в коммерческих целях?
Ответ: Да, сгенерированный контент полностью принадлежит вам.