Model Catalog

Approved foundation models available to OneMain teams across OpenAI, AWS Bedrock, and Google Gemini.

16 models

GPT Realtime 2

OpenAI

Approved GA
OpenAI

Reasoning model for realtime voice interactions with stronger instruction following and reliable tool use for voice-agent workflows.

Audio Text Image Multimodal
Premium 128K context

GPT Realtime 1.5

OpenAI

Approved GA
OpenAI

Default realtime voice model for natural two-way audio conversations, voice agents, and customer support.

Audio Text Image Multimodal
Standard 32K context

GPT Realtime Translate

OpenAI

Approved GA
OpenAI

Streaming speech-to-speech translation model for live multilingual audio, priced per minute of audio.

Audio Text
Standard 16K context

GPT Realtime Whisper

OpenAI

Approved GA
OpenAI

Streaming speech-to-text model for low-latency realtime transcription, priced per minute of audio.

Audio Text
Standard 16K context

GPT-4o Transcribe

OpenAI

Approved GA
OpenAI

Speech-to-text model powered by GPT-4o with improved word error rate and language recognition over original Whisper.

Audio Text
Standard 16K context

GPT-4o mini Transcribe

OpenAI

Approved GA
OpenAI

Lighter, lower-cost speech-to-text model for high-volume transcription.

Audio Text
Standard 16K context
a

Amazon Nova Sonic

Amazon

Approved GA
Bedrock

Amazon's speech-to-speech model enabling natural, real-time voice conversations with low latency and multilingual support.

Audio Multimodal
Premium N/A context

Gemini 3.1 Pro

Google

Under review Preview
Gemini

Google's most advanced reasoning model for complex problem-solving, deep reasoning, and frontier coding tasks.

Text Image Audio Video Code Multimodal
Enterprise 1M context

Gemini 3.5 Flash

Google

Approved GA
Gemini

Most intelligent flash-class model for sustained frontier performance at high volume.

Text Image Audio Video Code Multimodal
Premium 1M context

Gemini 3 Flash

Google

Under review Preview
Gemini

Frontier-class flash model delivering performance rivaling larger models at lower cost.

Text Image Audio Video Code Multimodal
Standard 1M context

Gemini 3.1 Flash Live

Google

Under review Preview
Gemini

High-quality, low-latency Live API model for real-time bidirectional voice and video dialogue.

Text Audio Image Video Multimodal
Premium 1M context

Gemini 2.5 Pro

Google

Approved GA
Gemini

Advanced reasoning and coding model with deep thinking capabilities for complex tasks.

Text Image Audio Video Code Multimodal
Premium 1M context

Gemini 2.5 Flash

Google

Approved GA
Gemini

Best price-performance model for low-latency, high-volume tasks with thinking support.

Text Image Audio Video Code Multimodal
Standard 1M context

Gemini 2.5 Flash-Lite

Google

Approved GA
Gemini

Fastest and most budget-friendly multimodal model for high-frequency, cost-sensitive tasks.

Text Image Audio Video Multimodal
Standard 1M context

Gemini 2.5 Flash Native Audio

Google

Under review Preview
Gemini

Native audio dialog model producing natural conversational speech from multimodal input.

Text Audio Video Multimodal
Premium 1M context

Gemini Embedding 2

Google

Approved GA
Gemini

Latest multimodal embedding model generating vectors from text, image, audio, and video inputs.

Text Image Audio Video Embedding Multimodal
Standard 8K context

Please confirm

Are you sure?