AI Provider Models

July 26, 2026 · View on GitHub

Single source of truth for AI model information used across VibeFrame.


Agent LLM Providers (7)

Used for natural language processing in Agent mode (vibe command).

ProviderModelAPI Model IDEnv KeyCLI Option
OpenAIGPT-5-minigpt-5-miniOPENAI_API_KEY-p openai
ClaudeSonnet 4.6claude-sonnet-4-6ANTHROPIC_API_KEY-p claude
Gemini2.5 Flashgemini-2.5-flashGOOGLE_API_KEY-p gemini
xAIGrok 4.1 Fastgrok-4-1-fast-reasoningXAI_API_KEY-p xai
OpenRouterAuto (300+ models)openrouter/autoOPENROUTER_API_KEY-p openrouter
EvolinkGPT-5.2 (via unified API)gpt-5.2EVOLINK_API_KEY-p evolink
OllamaLocal modelsuser-configured--p ollama

OpenAI model options:

gpt-5-mini is the default — 10× cheaper input / 5× cheaper output than GPT-4o, with better performance. Ideal for agentic loops (20+ calls per task). You can override per-session:

Model IDVariantNotes
gpt-5-miniGPT-5 MiniDefault. Best cost-performance ratio. $0.25/M input, $2/M output
gpt-5.4GPT-5.4Frontier model, 1M context. $2.50/M input, $20/M output

gpt-5.4-pro is not available via Chat Completions (Responses API only) — not usable for Agent mode.

To use GPT-5.4 in agent mode: vibe agent -p openai --model gpt-5.4

Claude model options:

claude-sonnet-4-6 is the default — best balance of capability and cost for agentic loops. You can override per-session:

Model IDVariantNotes
claude-sonnet-4-6Sonnet 4.6Default. Best cost-performance for agent loops. $3/M input, $15/M output
claude-opus-4-7Opus 4.7Highest capability, step-change in agentic coding, 1M context. $5/M input, $25/M output
claude-haiku-4-5-20251001Haiku 4.5Fastest, lowest cost. $1/M input, $5/M output
claude-opus-4-6Opus 4.6 (legacy)Previous Opus tier — same price as 4.7. Still supported.

To use Opus in agent mode: vibe agent -p claude --model claude-opus-4-7

xAI model options:

grok-4-1-fast-reasoning is the default — optimized for tool calling with 2M context window, 15× cheaper input / 30× cheaper output than Grok 4. You can override per-session:

Model IDVariantNotes
grok-4-1-fast-reasoningGrok 4.1 Fast (reasoning)Default. Agent-optimized, 2M context. $0.20/M input, $0.50/M output
grok-4Grok 4 (flagship)Highest capability, 256K context. $3/M input, $15/M output
grok-4-1-fast-non-reasoningGrok 4.1 Fast (non-reasoning)Faster responses, no chain-of-thought. $0.20/M input, $0.50/M output

To use Grok 4 in agent mode: vibe agent -p xai --model grok-4

OpenRouter model options:

openrouter/auto is the default — automatically routes to the best available model. You can specify any model available on OpenRouter:

Model IDProviderNotes
openrouter/autoAutoDefault. Automatically selects best model
anthropic/claude-sonnet-4-6AnthropicClaude Sonnet via OpenRouter
openai/gpt-5-miniOpenAIGPT-5 Mini via OpenRouter
google/gemini-2.5-flashGoogleGemini Flash via OpenRouter
meta-llama/llama-4-scoutMetaLlama 4 Scout (open-weight)
deepseek/deepseek-r1DeepSeekDeepSeek R1 reasoning model

To use a specific model: vibe agent -p openrouter --model anthropic/claude-sonnet-4-6

See openrouter.ai/models for the full list of 300+ available models.

Evolink model options:

gpt-5.2 is the default — reliable, fast, and cost-effective for agentic loops. You can specify any model available on Evolink:

Model IDProviderNotes
gpt-5.2OpenAIDefault. GPT-5.2 via Evolink
evolink-autoAutoAuto-routing (may have spotty availability)
claudeAnthropicClaude via Evolink
gemini-2.5-proGoogleGemini 2.5 Pro via Evolink
deepseek-chatDeepSeekDeepSeek V3 via Evolink
doubao-seed-2.0-proByteDanceDoubao Seed 2.0 Pro via Evolink

To use a specific model: vibe agent -p evolink --model gpt-5.2

See docs.evolink.ai for the full model catalog.

Why Gemini 2.5 Flash for agent mode, not Gemini 3.5 Flash?

Agent mode runs an agentic loop — the LLM is called repeatedly (potentially dozens of times per task) to reason and call tools. For this use case:

  • Speed matters: Flash responds ~3–5× faster than Pro, keeping the interactive session snappy
  • Tool calling stability: gemini-2.5-flash has well-tested, stable function calling support; newer Gemini 3.x models may have stricter rate limits or different behavior in multi-turn tool calling loops
  • Cost: Flash is significantly cheaper per token — important when a single agent task may trigger 20+ LLM calls
  • Agent loop risk: newer frontier models can be better for one-shot reasoning, but agent mode values predictable repeated tool calls

For one-shot Gemini calls, VibeFrame now maps flash / latest to gemini-3.5-flash. That applies to media analysis, render review, storyboard generation, Gemini-backed silence-cut analysis, and Gemini composition. Agent mode keeps gemini-2.5-flash as its explicit default.

gemini-3.1-pro-preview remains available for motion graphics code generation (vibe generate motion -m gemini-3.1-pro) where its creative reasoning matters for a single generation call.

Gemini model options:

gemini-2.5-flash is the default — fastest and most cost-effective for agentic loops. You can override per-session:

Model IDVariantNotes
gemini-2.5-flash2.5 FlashDefault. Fast, stable tool calling. Free tier available
gemini-3.5-flash3.5 FlashOne-shot flash / latest default for analysis, review, storyboard, and Gemini composition
gemini-3-flash-preview3 Flash PreviewPreview model available via flash-3 or explicit model ID
gemini-2.5-pro2.5 ProHigher reasoning capability, slower. $1.25/M input, $10/M output
gemini-3.1-pro-preview3.1 Pro (preview)Latest, preview — may have unstable tool calling

To opt into Gemini 3.5 Flash in agent mode: vibe agent -p gemini --model gemini-3.5-flash


Motion Graphics LLM (vibe generate motion)

Used for Remotion component code generation (vibe generate motion).

AliasModelProviderEnv KeyCLI OptionNotes
sonnetclaude-sonnet-4-6ClaudeANTHROPIC_API_KEY-m sonnetDefault
opusclaude-opus-4-7ClaudeANTHROPIC_API_KEY-m opusBest quality (step-change agentic coding)
opus-4-6claude-opus-4-6ClaudeANTHROPIC_API_KEY-m opus-4-6Previous Opus tier (legacy)
geminigemini-3.5-flashGeminiGOOGLE_API_KEY-m geminiGemini 3.5 Flash one-shot default
gemini-2.5-progemini-2.5-proGeminiGOOGLE_API_KEY-m gemini-2.5-proPrevious Gemini motion alias target
gemini-3.1-progemini-3.1-pro-previewGeminiGOOGLE_API_KEY-m gemini-3.1-proGemini 3.1 Pro

Text-to-Image (3 providers, 7 models)

ProviderModelEnv KeyCLI OptionNotes
OpenAIgpt-image-2OPENAI_API_KEY-p openaiFlagship OpenAI image model
OpenAIgpt-image-1.5OPENAI_API_KEY-p openai -m 1.5Previous default, still strong on editing (#1 editing leaderboard). Quality tiers: low ($0.009), medium ($0.035), high ($0.133)
Geminigemini-2.5-flash-imageGOOGLE_API_KEY-p geminiNano Banana Flash - GA, fast. Auto-selected when only GOOGLE_API_KEY is set
Geminigemini-3.1-flash-image-previewGOOGLE_API_KEY-p gemini -m 3.1-flashNano Banana 2 - Image Search grounding, 512px
Geminigemini-3-pro-image-previewGOOGLE_API_KEY-p gemini -m proNano Banana Pro - higher quality, up to 4K
xAI Grokgrok-imagine-imageXAI_API_KEY-p grok$0.02/image, standard quality
xAI Grokgrok-imagine-image-proXAI_API_KEY-p grok -m pro$0.07/image, higher quality

Image Aspect Ratios (Gemini)

All Gemini image models support 14 aspect ratios: 1:1, 1:4, 1:8, 2:3, 3:2, 3:4, 4:1, 4:3, 4:5, 5:4, 8:1, 9:16, 16:9, 21:9

Image Aspect Ratios (Grok)

Grok Imagine supports 14 aspect ratios: 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 2:1, 1:2, 19.5:9, 9:19.5, 20:9, 9:20, auto

Image Editing (3 providers)

ProviderModelMax Input ImagesCLI OptionFeatures
GeminiFlash3-p gemini (default)Fast editing, 1K output
Gemini3.1 Flash3-p gemini -m 3.1-flashImage Search grounding, 512px-1K output
GeminiPro14-p gemini -m proMulti-image composition, up to 4K output
OpenAIgpt-image-1.516-p openaiInstruction-based editing, multipart upload
OpenAIgpt-image-216-p openai -m 2Flagship editor, 2026-04-21 GA
xAI Grokgrok-imagine-image1-p grokSingle image editing, $0.02/edit

Text-to-Video (5 stable + 1 experimental)

Models marked Audio: Yes generate synchronized sound (dialogue, SFX, ambient). Silent models need separate vibe generate speech / vibe generate sound-effect.

ProviderModelDurationAudioEnv KeyCLI OptionNotes
Seedance via fal.aiseedance-2.0 (ByteDance)4-15 secYesFAL_API_KEY-p seedanceByteDance Seedance through fal.ai
Seedance via fal.aiseedance-2.0-fast4-15 secYesFAL_API_KEY-p seedance --seedance-model fastLower-latency / lower-cost variant of Seedance 2.0
xAI Grokgrok-imagine-video1-15 secYesXAI_API_KEY-p grokFallback default when FAL_API_KEY is unset. Best lip-sync/native audio. $0.07/s (720p)
Klingkling-v2-5-turbo5-10 secNoKLING_API_KEY-p klingFast (~36s generation)
Klingkling-v2-65-10 secNoKLING_API_KEY-p kling -m v2.6High quality
Klingkling-v35-10 secNoKLING_API_KEY-p kling -m v3Higher quality, multi-shot, lip-sync
Klingkling-v3-omni3-15 secYesKLING_API_KEY-p kling -m v3-omniNative audio (multilingual), character consistency
Veoveo-3.1-fast-generate-preview4-8 secYesGOOGLE_API_KEY-p veoNative audio, fast
Veoveo-3.1-generate-preview4-8 secYesGOOGLE_API_KEY-p veo --veo-model 3.1Native audio, higher quality
Veoveo-3.0-generate-preview5-8 secYesGOOGLE_API_KEY-p veo --veo-model 3.0Native audio
Runwaygen4.52-10 secNoRUNWAY_API_SECRET-p runwayFlagship, text+image-to-video (12 credits/sec)
Runwaygen4_turbo5-10 secNoRUNWAY_API_SECRET-p runway --runway-model gen4_turboLegacy, image-to-video only
Gemini Omni ⚠️gemini-omni-flash-previewpreviewYesGOOGLE_API_KEY-p omniExperimental, opt-in only. New /v1beta/interactions endpoint. Never auto-selected. See below.

-p fal is a deprecated v0.x alias for -p seedance and will be removed at the 1.0 cut. Use -p seedance in new scripts.

⚠️ Seedance rejects image-to-video inputs showing a recognizable face. This is ByteDance's platform-wide likeness policy, not a fal.ai quirk: the API returns a deterministic HTTP 422 ("The images or videos provided may contain likenesses of real people") for keyframes where a person's face is clearly visible — including AI-generated photoreal faces. Hands-only or back-of-head shots pass. Retrying does not help. vibe build falls back to Runway automatically for such beats when RUNWAY_API_SECRET is configured; you can also pin a beat with a provider: runway cue, or run vibe generate video "<motion>" -p runway -i keyframe.png directly. Observed 2026-07-26 on seedance-2.0.

⚠️ Gemini Omni is experimental. It is not wired into default provider resolution — you must pass -p omni explicitly. The preview interactions schema may change; treat it as unstable.

Veo Advanced Options

OptionValuesDescription
--negative-prompttextWhat to avoid in the generated video
--resolution720p, 1080p, 4kVideo resolution
--last-frameimage pathFrame interpolation (first→last frame)
--ref-imagesimage paths (max 3)Character consistency (Veo 3.1 only)
--personallow_all, allow_adultPerson generation setting
veo-extendoperation-nameExtend a previously generated Veo video

Image-to-Video

All text-to-video providers also support image-to-video. Key differences per provider:

ProviderModelI2V SupportImage InputNotes
Seedance via fal.aiseedance-2.0YesURL onlyAuto-uploads via ImgBB (IMGBB_API_KEY) for local image paths.
xAI Grokgrok-imagine-videoYesURL or data URISame pricing as T2V
Klingall v2.5+ modelsYesURL onlyAuto-uploads via ImgBB (IMGBB_API_KEY)
Veoall modelsYesbase64 (first frame)Supports --last-frame for frame interpolation
Runwaygen4.5YesURL or data URIText+image-to-video
Runwaygen4_turboI2V onlyURL or data URICannot do text-only generation
Gemini Omni ⚠️gemini-omni-flash-previewYes (experimental)base64 (first frame)Sends video_config.task: image_to_video; opt-in -p omni only

Gemini Omni (experimental)

Google Gemini Omni (gemini-omni-flash-preview) is a preview video generation/editing model on the Generative Language API. VibeFrame ships an opt-in, experimental client for it — vibe generate video -p omni. It is not part of default provider resolution (Seedance / Veo / Kling / Runway / Grok remain the stable path), and the preview request/response schema may change.

Reference: https://ai.google.dev/gemini-api/docs/omni

PropertyValue
Model IDgemini-omni-flash-preview
EndpointPOST /v1beta/interactions (new stateful endpoint — not Veo's :predictLongRunning)
AuthGOOGLE_API_KEY (same key as Gemini / Veo — no new credential)
Taskstext_to_video, image_to_video, reference_to_video, edit via generation_config.video_config.task
Aspect ratios16:9, 9:16
WatermarkSynthID

Preview limits (per Google's docs, subject to change):

  • Audio-reference upload is not supported.
  • Video references are limited to ≤3 seconds.
  • Editing uploaded video is restricted in the EEA, Switzerland, and the UK.
  • English-tested only; no system-instruction or temperature controls.
  • Large (>4MB) videos may be returned via an async delivery: uri reference.

VibeFrame's Omni client (packages/ai-providers/src/gemini/gemini-omni.ts) parses the interactions response defensively for the video URL, since the preview schema is not yet stable.


Audio (5)

ProviderCapabilityEnv KeyNotes
ElevenLabsTTS, SFX, Music, Voice CloneELEVENLABS_API_KEYMusic: 3s-10min, model music_v1. TTS: eleven_v3
OpenAI TTSTTSOPENAI_API_KEYgpt-4o-mini-tts (~$0.015/min of audio); voices incl. marin, alloy, nova
KokoroTTS (local, free)Kokoro-82M (Apache 2.0); ~90MB model on first use; bundled in the Desktop extension
WhisperTranscriptionOPENAI_API_KEYOpenAI API
ReplicateMusic generationREPLICATE_API_TOKENMusicGen, max 30s

Quick Reference

Environment Variables

# LLM Providers
export OPENAI_API_KEY="sk-..."        # GPT, Whisper, GPT Image 1.5
export ANTHROPIC_API_KEY="sk-ant-..." # Claude
export GOOGLE_API_KEY="AIza..."       # Gemini (image, Veo video)
export XAI_API_KEY="xai-..."          # xAI Grok
export OPENROUTER_API_KEY="sk-or-..." # OpenRouter (300+ models)
export EVOLINK_API_KEY="el-..."          # Evolink (GPT-5, Claude, Gemini, DeepSeek & more)

# Media Providers
export ELEVENLABS_API_KEY="..."       # TTS, SFX
export RUNWAY_API_SECRET="..."        # Runway Gen-4 Turbo
export KLING_API_KEY="..."            # Kling v2.x/v3
export REPLICATE_API_TOKEN="..."      # Replicate (music)

API Keys by Command

CommandRequired API KeyModel
vibe (default)OPENAI_API_KEYGPT-5-mini (Agent LLM)
vibe -p claudeANTHROPIC_API_KEYClaude Sonnet 4.6 (Agent LLM)
vibe -p geminiGOOGLE_API_KEYGemini 2.5 Flash (Agent LLM)
vibe -p xaiXAI_API_KEYGrok 4.1 Fast (Agent LLM)
vibe -p openrouterOPENROUTER_API_KEYOpenRouter Auto (Agent LLM)
vibe -p evolinkEVOLINK_API_KEYGPT-5.2 via Evolink (Agent LLM)
vibe generate image -p openaiOPENAI_API_KEYOpenAI image generation
vibe generate image -p geminiGOOGLE_API_KEYGemini image generation
vibe edit imageGOOGLE_API_KEYGemini Nano Banana
vibe generate speechELEVENLABS_API_KEYElevenLabs
vibe generate musicELEVENLABS_API_KEYElevenLabs Music (default)
vibe generate music -p replicateREPLICATE_API_TOKENReplicate MusicGen
vibe generate video -p seedanceFAL_API_KEYSeedance via fal.ai
vibe generate video -p grokXAI_API_KEYGrok Imagine
vibe generate video -p klingKLING_API_KEYKling v2.5-turbo
vibe generate image -p grokXAI_API_KEYGrok Imagine
vibe generate video -p veoGOOGLE_API_KEYVeo 3.1
vibe generate video -p omniGOOGLE_API_KEYGemini Omni (experimental)

Provider Selection Notes

Provider defaults depend on which API keys are configured. For public docs and demos, prefer explicit provider flags so the required key is obvious:

vibe generate image "..." -p openai
vibe generate image "..." -p gemini
vibe generate video "..." -p seedance
vibe generate video "..." -p veo

Use command help as the runtime source of truth for supported flags:

vibe generate image --help
vibe generate video --help
vibe edit image --help