Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

41 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

VisionGPT

A family of multimodal autoregressive models for vision and language tasks, specializing in photorealistic image generation from text.

🚀 Quick Start

Installation

# See INSTALL.md for detailed instructions
git clone https://github.com/z3roai/VisionGPT.git
cd VisionGPT
pip install -e .

Image Generation Demo

cd vision_gpt
python demos/demo_image_generation.py \
  --pretrained_path z3roai/VisionGPT-7B-768 \
  --target_size 768

Simple Usage

from inference_solver import FlexARInferenceSolver

# Initialize model
solver = FlexARInferenceSolver(
    model_path="z3roai/VisionGPT-7B-768",
    precision="bf16",
    target_size=768,
)

# Generate image from text
prompt = "Generate an image of a dog playing in water with a waterfall background."
generated = solver.generate(
    images=[],
    qas=[[prompt, None]],
    max_gen_len=8192,
    temperature=1.0,
)

🎯 Features

  • Text-to-Image Generation: High-quality photorealistic image generation
  • Image Understanding: Visual question answering and image description
  • Multi-task Capability: Omni-SFT models support various vision tasks
  • Flexible Resolution: Support for 512×512, 768×768, and 1024×1024 outputs

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages