Modelos multimodales para análisis de imagen
Cada vez hay más modelos multimodales los cuales aceptan ambos textos e imágenes. Esto reduce la necesidad de tener vision pipelines separadas.
Foundry soporta el uso de modelos multimodales desde la web (Azure OpenAI API).
Azure OpenAI SDK (python)
Instalar el sdk
pip install openai
Ejemplo de código
import os
from openai import OpenAI
# Environment variables you set locally or in your app service:
FOUNDRY_KEY = "... your key ..."
ENDPOINT = "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME = "your-model-deployment-name" # e.g., "gpt-4.1-mini" deployed as "my-vision-deploy"
client = OpenAI(
api_key=os.getenv("FOUNDRY_KEY"),
base_url=os.getenv("ENDPOINT"),
)
image_url = ""
response = client.responses.create(
model=os.getenv("MODEL_NAME"), # your deployment name
input=[
{
"role": "user",
"content": [
{"type": "input_text", "text": "What is in this image? Provide 3 bullet points."},
{"type": "input_image", "image_url": image_url}
],
}
],
)
print(response.output_text)
Generación de imágenes
Foundry contiene modelos especiales para generación de imagen
- GPT-Image-1.5
- GPT-Image-1
- GPT-Image-1-Mini
Todos estos modelos se pueden usar desde Foundry o con el SDK
OpenAI SDK
Código App
import os
import base64
from openai import OpenAI
# Required environment variables (example names)
FOUNDRY_KEY="..."
ENDPOINT="https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME="your-gpt-image-deployment-name" # e.g., "gpt-image-1"
client = OpenAI(
api_key=os.environ["FOUNDRY_KEY"],
base_url=os.environ["ENDPOINT"],
)
prompt = "A modern flat illustration of a robot holding a potted plant, clean vector style, pastel colors."
response = client.responses.create(
model=os.environ["MODEL_NAME"], # your deployment name in Foundry
input=prompt,
tools=[{"type": "image_generation"}],
)
image_base64 = next(
item.result for item in response.output
if item.type == "image_generation_call"
)
with open("foundry_generated.png", "wb") as f:
f.write(base64.b64decode(image_base64))
print("Saved: foundry_generated.png")
Generación de videos
Foundry contiene modelos especiales para generación de imagen
- Sora 2
- Sora 1
REST interface
Se puede usar la REST interface para integrar el servicio de generación de videos con una aplicación
ejemplos curl
crear video
curl -X POST "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/videos" \
-H "Content-Type: application/json" \
-H "api-key: $AZURE_OPENAI_API_KEY" \
-d '{
"model": "sora-2",
"prompt": "A cinematic close-up of raindrops sliding down a neon-lit window at night.",
"size": "1280x720",
"seconds": "8"
}'
poll status
curl -X GET "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/videos/{video_id}" \
-H "api-key: $AZURE_OPENAI_API_KEY"
download video
curl -L "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/videos/{video_id}/content?variant=video" \
-H "api-key: $AZURE_OPENAI_API_KEY" \
--output output.mp4