Vision and Multimodal Support
May 31, 2026 ยท View on GitHub
AgentForge supports image and multimodal prompts for APIs that implement vision capabilities.
VisionMixin
VisionMixinis a mixin class that adds image/multimodal support to API integrations.- Used by
GeminiVisionand can be used in custom APIs.
How to Use
- To use image/multimodal support, select a provider class that supports images, such as
GeminiVisionorLMStudioVision. - Pass images to the
generatemethod via theimagesargument.
Example
response = agent.model.generate(model_prompt, images=[image_data], **params)
Configuration Example
model_library:
gemini_api:
GeminiVision:
models:
gemini_vision:
identifier: gemini-3.5-flash
params:
temperature: 0.7
Notes
- Not all APIs support images. Check the API documentation for support.
- For custom APIs, inherit from
VisionMixinand implement required methods.