A family of multimodal autoregressive models for vision and language tasks, specializing in photorealistic image generation from text.
# See INSTALL.md for detailed instructions
git clone https://github.com/z3roai/VisionGPT.git
cd VisionGPT
pip install -e .cd vision_gpt
python demos/demo_image_generation.py \
--pretrained_path z3roai/VisionGPT-7B-768 \
--target_size 768from inference_solver import FlexARInferenceSolver
# Initialize model
solver = FlexARInferenceSolver(
model_path="z3roai/VisionGPT-7B-768",
precision="bf16",
target_size=768,
)
# Generate image from text
prompt = "Generate an image of a dog playing in water with a waterfall background."
generated = solver.generate(
images=[],
qas=[[prompt, None]],
max_gen_len=8192,
temperature=1.0,
)- Text-to-Image Generation: High-quality photorealistic image generation
- Image Understanding: Visual question answering and image description
- Multi-task Capability: Omni-SFT models support various vision tasks
- Flexible Resolution: Support for 512×512, 768×768, and 1024×1024 outputs