AI Models Reference

February 10, 2026 ยท View on GitHub

Complete reference for all 73 AI models available in the AI Content Generation Suite.

Overview

CategoryModel CountProviders
Text-to-Image8FAL AI, Replicate
Image-to-Image8FAL AI
Text-to-Video10FAL AI, Google, OpenAI, xAI
Image-to-Video15FAL AI, Google, OpenAI, xAI
Video-to-Video4FAL AI (Kuaishou)
Avatar Generation10FAL AI, VEED, Kuaishou, xAI
Image Understanding7Google Gemini
Prompt Generation5OpenRouter
Text-to-Speech3ElevenLabs
Speech-to-Text1ElevenLabs (via FAL)
Add Audio1FAL AI
Upscale Video1Topaz Labs (via FAL)
Total73Multiple

Text-to-Image Models (8)

Generate images from text descriptions.

Model KeyNameProviderCostBest For
nano_banana_proNano Banana ProFAL AI$0.002/imageFast & high-quality
gpt_image_1_5GPT Image 1.5OpenAI (via FAL)$0.003/imageGPT-powered generation
flux_devFLUX.1 DevBlack Forest Labs$0.003/imageHighest quality (12B params)
flux_schnellFLUX.1 SchnellBlack Forest Labs$0.001/imageFastest, best for testing
imagen4Google Imagen 4Google (via FAL)$0.004/imagePhotorealistic output
seedream_v3Seedream v3ByteDance$0.002/imageMultilingual support
seedream3Seedream-3ByteDance (via Replicate)$0.003/imageHigh resolution
gen4Runway Gen-4Runway (via Replicate)$0.08/imageMulti-reference guided
aicp generate-image --text "your prompt" --model nano_banana_pro

Image-to-Image Models (8)

Transform and edit existing images.

Model KeyNameProviderCostBest For
photonLuma Photon FlashLuma AI$0.02/imageFast creative modifications
photon_baseLuma Photon BaseLuma AI$0.03/imageHigh-quality transformations
kontextFLUX Kontext DevBlack Forest Labs$0.025/imageContextual editing
kontext_multiFLUX Kontext Max MultiBlack Forest Labs$0.04/imageMulti-image editing
seededitSeedEdit v3ByteDance$0.02/imagePrecise content-preserving edits
clarityClarity UpscalerFAL AI$0.05/imageResolution enhancement (up to 4x)
nano_banana_pro_editNano Banana Pro EditFAL AI$0.015/imageFast multi-image editing
gpt_image_1_5_editGPT Image 1.5 EditOpenAI (via FAL)$0.02/imageNatural language editing

Text-to-Video Models (10)

Generate videos directly from text prompts.

Model KeyNameProviderCostDurationFeatures
veo3Google Veo 3Google (via FAL)$0.50-0.75/s5-8sAudio generation, 720p
veo3_fastGoogle Veo 3 FastGoogle (via FAL)$0.25-0.40/s5-8sFast processing, audio
kling_3_proKling v3 ProKuaishou$0.224-0.392/s3-15sVoice control, multi-prompt
kling_3_standardKling v3 StandardKuaishou$0.168-0.308/s3-15sVoice control, multi-prompt
kling_2_6_proKling v2.6 ProKuaishou$0.07-0.14/s5-10sAudio, multilingual
kling_o3_pro_t2vKling O3 ProKuaishou$0.224-0.28/s3-15sElement consistency, @ syntax
sora_2Sora 2OpenAI (via FAL)$0.10/s4-12sOpenAI quality
sora_2_proSora 2 ProOpenAI (via FAL)$0.30-0.50/s4-12s1080p support
hailuo_proMiniMax Hailuo-02 ProMiniMax$0.08/video6sBudget-friendly, 1080p
grok_imagineGrok Imagine VideoxAI (via FAL)$0.30/6s1-15sNative audio, flexible duration
aicp create-video --text "cinematic sunset over mountains"

Image-to-Video Models (15)

Convert images into animated videos.

Model KeyNameProviderCostDurationFeatures
veo_3_1_fastVeo 3.1 FastGoogle (via FAL)~$1.204-8sAudio generation, fast
kling_3_pro_i2vKling v3 ProKuaishou$0.224-0.392/s5-12sVoice control, multi-prompt
kling_3_standard_i2vKling v3 StandardKuaishou$0.168-0.308/s5-12sVoice control, multi-prompt
kling_2_6_pro_i2vKling v2.6 ProKuaishou~$1.005-10sProfessional quality
kling_2_1Kling v2.1Kuaishou~$0.505-10sBudget Kling option
kling_o3_pro_i2vKling O3 ProKuaishou$0.224-0.28/s3-15sElement consistency
kling_o3_standard_i2vKling O3 StandardKuaishou$0.168-0.224/s3-15sElement consistency
kling_o3_pro_refKling O3 Pro RefKuaishou$0.224-0.28/s3-15s@ syntax, reference images
kling_o3_standard_refKling O3 Standard RefKuaishou$0.084-0.112/s3-15s@ syntax, budget O3
sora_2_i2vSora 2OpenAI (via FAL)~$0.404-12sOpenAI quality
sora_2_pro_i2vSora 2 ProOpenAI (via FAL)~$2.004-12s1080p support
seedance_1_5_proSeedance v1.5 ProByteDance~$0.805-10sMotion synthesis
hailuoMiniMax Hailuo-02MiniMax~$0.086-10sBudget option
wan_2_6Wan v2.6Wan~$0.505-15sMulti-shot, audio input
grok_imagine_i2vGrok Imagine VideoxAI (via FAL)~$0.301-15sNative audio, flexible

Video-to-Video Models (4)

Edit and transform existing videos.

Model KeyNameProviderCostDurationFeatures
kling_o3_pro_editKling O3 Pro EditKuaishou$0.336/s3-15sProfessional element replacement
kling_o3_standard_editKling O3 Standard EditKuaishou$0.252/s3-15sElement replacement, @ syntax
kling_o3_pro_v2v_refKling O3 Pro V2V RefKuaishou$0.336/s3-15sStyle transfer, audio preservation
kling_o3_standard_v2v_refKling O3 Standard V2V RefKuaishou$0.252/s3-15sStyle transfer, budget option

Avatar Generation Models (10)

Generate talking avatar videos with lip-sync, motion transfer, and video editing.

Model KeyNameProviderCostFeatures
omnihuman_v1_5OmniHuman v1.5ByteDance$0.16/sPremium audio-driven animation
fabric_1_0VEED Fabric 1.0VEED$0.08-0.15Cost-effective lip-sync
fabric_1_0_fastVEED Fabric 1.0 FastVEED$0.10-0.19Speed-optimized lip-sync
fabric_1_0_textVEED Fabric 1.0 TextVEED$0.08-0.15Text-to-speech + lip-sync
kling_ref_to_videoKling O1 Ref-to-VideoKuaishou$0.112/sCharacter consistency
kling_v2v_referenceKling O1 V2V ReferenceKuaishou$0.168/sStyle-guided transformation
kling_v2v_editKling O1 V2V EditKuaishou$0.168/sTargeted video editing
kling_motion_controlKling v2.6 Motion ControlKuaishou$0.06/sMotion transfer from video
multitalkAI Avatar MultiFAL AI$0.10-0.25Multi-person conversations
grok_video_editGrok Video EditxAI (via FAL)~$0.36AI-powered video editing
aicp generate-avatar --image-url "https://..." --audio-url "https://..."

Image Understanding Models (7)

Analyze and understand images using Google Gemini.

Model KeyNameCostUse Case
gemini_describeGemini Describe$0.001Basic image description
gemini_detailedGemini Detailed$0.002Comprehensive analysis
gemini_classifyGemini Classify$0.001Image classification
gemini_objectsGemini Objects$0.002Object detection
gemini_ocrGemini OCR$0.001Text extraction (OCR)
gemini_compositionGemini Composition$0.002Artistic composition analysis
gemini_qaGemini Q&A$0.001Interactive Q&A about images

Prompt Generation Models (5)

Optimize and enhance video prompts using OpenRouter.

Model KeyNameCostStyle
openrouter_video_promptVideo Prompt$0.002General
openrouter_video_cinematicVideo Cinematic$0.002Cinematic
openrouter_video_realisticVideo Realistic$0.002Realistic
openrouter_video_artisticVideo Artistic$0.002Artistic
openrouter_video_dramaticVideo Dramatic$0.002Dramatic

Text-to-Speech Models (3)

Convert text to natural speech using ElevenLabs.

Model KeyNameCostFeatures
elevenlabsElevenLabs TTS~$0.05High-quality, professional
elevenlabs_turboElevenLabs Turbo~$0.03Fast generation
elevenlabs_v3ElevenLabs v3~$0.08Latest generation

Speech-to-Text Models (1)

Transcribe audio with speaker identification.

Model KeyNameProviderCostFeatures
scribe_v2ElevenLabs Scribe v2ElevenLabs (via FAL)$0.008/min99 languages, speaker diarization, word timestamps
aicp transcribe --input audio.mp3
aicp transcribe --input meeting.mp3 --raw-json   # word-level timestamps
aicp transcribe --input podcast.mp3 --srt         # subtitle file

Add Audio Models (1)

Generate AI sound effects for videos.

Model KeyNameProviderCostFeatures
thinksoundThinkSoundFAL AI$0.001/sVideo context understanding, prompt guidance

Upscale Video Models (1)

Professional-grade video upscaling.

Model KeyNameProviderCostFeatures
topazTopaz Video UpscaleTopaz Labs (via FAL)~$1.50/videoUp to 4x upscaling, 120 FPS interpolation

Model Selection Guide

By Use Case

Use CaseRecommended ModelCost
Quick image testingflux_schnell$0.001
Production imagesnano_banana_pro$0.002
Budget videohailuo_pro$0.08
Quality video (t2v)kling_3_pro$0.50+
Premium video (t2v)veo3$2.50+
Quality video (i2v)kling_3_pro_i2v$0.50+
Premium video (i2v)veo_3_1_fast$1.20+
Avatar/lip-syncomnihuman_v1_5$0.16/s
Budget avatarfabric_1_0$0.08+
Image analysisgemini_describe$0.001
TTSelevenlabs$0.05
Transcriptionscribe_v2$0.008/min

By Budget

BudgetImage ModelVideo Model (t2v)Video Model (i2v)
Minimalflux_schnell ($0.001)hailuo_pro ($0.08)hailuo ($0.08)
Standardnano_banana_pro ($0.002)kling_2_6_pro ($0.35)kling_2_1 ($0.50)
Premiumimagen4 ($0.004)veo3 ($4.00)veo_3_1_fast ($1.20)