핵심 개념
프로바이더 & 모델
core registry에는 OpenAI OAuth/API, Grok OAuth/API, Gemini/Antigravity CLI, Gemini 직접 API, AtlasCloud, MiniMax, NovelAI, 등록된 ComfyUI 워크플로가 있습니다. Runway와 Higgsfield는 아래에서 따로 설명하는 MCP 연동입니다.
프로바이더 경로
provider: "oauth"— 서버가 ChatGPT 세션으로 ChatGPT의 Codex 백엔드를 직접 호출합니다. GPT-6 모델이 프롬프트를 기획하고gpt-image-2가 그립니다. 기본 경로이며 API key가 필요 없습니다.provider: "api"— 호스티드image_generation도구로 OpenAI Responses API를 호출합니다.OPENAI_API_KEY가 필요합니다.provider: "grok"—~/.progrok/auth.json의 xAI OAuth 세션으로api.x.ai를 직접 호출합니다. 필수 xAI Web Search와 planner pass(기본grok-4.3, 설정 또는--planner-model로 변경)를 거친 뒤 xAI Images API를 호출합니다. Grok 4.5·4.6도 고를 수 있습니다.provider: "grok-api"—grok과 같은 xAI pipeline을 직접XAI_API_KEY로 실행합니다.provider: "agy"— Antigravity CLI(agy -p)를 통해 Google Gemini(nano-banana-2)로 이미지를 생성합니다. 고정 1024×1024 JPEG 출력, 최대 3장 참조.provider: "gemini-api"— Google Generative Language API 또는 Vertex AI를 직접 호출합니다. 모델nano-banana-2(Gemini 3.1 Flash Image)와nano-banana-pro(Gemini 3 Pro Image) 지원. 가변 화면비와 해상도(512px–4K) 지원.GEMINI_API_KEY또는 Vertex AI 서비스 계정 JSON이 필요합니다.provider: "atlascloud"—ATLASCLOUD_API_KEY로 AtlasCloud GPT Image 2 생성·편집을 호출하며 참조는 최대 10장입니다.provider: "minimax"—MINIMAX_API_KEY로 MiniMaximage-01과image-01-live를 호출하며 참조는 1장입니다.provider: "nai"— 저장된 토큰으로 NovelAI를 호출합니다. 텍스트 생성 전용이며negativePrompt와 고유 샘플링 옵션을 제공합니다. 레퍼런스와 편집 요청은 다른 동작으로 바꾸지 않고 오류로 끝냅니다.provider: "comfy"— 등록된 ComfyUI 이미지 워크플로를 실행합니다. 워크플로 하나가 런타임 모델 하나로 등록됩니다.
core lane은 Classic, Node, Agent Mode를 지원합니다. Agent Mode는 웹 UI 전용이고, Classic과 Node는 CLI도 있습니다.
요청 단위 오버라이드
생성 명령은 아래 core lane ID를 명시합니다. 일부 명령이 받는 auto는 별도 프로바이더가 아니라 라우팅 모드입니다.
| 값 | 동작 |
|---|---|
auto | 지원 명령에서만 쓰는 routing mode이며 provider lane이 아닙니다. |
oauth | GPT OAuth 경로 강제. |
api | API key Responses 경로 강제; 설정된 key가 필요합니다. |
grok | api.x.ai로 가는 xAI OAuth 경로 강제. 최초 1회 ima2 grok login 또는 웹 UI 로그인으로 device code 인증을 진행합니다. |
grok-api | OAuth 세션 대신 xAI API key를 직접 사용. grok과 동일한 파이프라인(Web Search → planner → 이미지 생성). 웹 UI key 관리 또는 XAI_API_KEY env var 필요. 비디오 생성도 지원. |
agy | Antigravity CLI로 Gemini 이미지 생성. agy 바이너리 필요. 1024×1024 고정, JPEG, 최대 3장 참조, 품질/크기/마스크 미지원. |
gemini-api | Google Generative Language API 또는 Vertex AI 직접 호출. 모델 nano-banana-2/nano-banana-pro. 가변 화면비·해상도 지원. API key 또는 Vertex 서비스 계정 JSON 필요. |
atlascloud | AtlasCloud API 직접 호출. ATLASCLOUD_API_KEY 필요. |
minimax | MiniMax API 직접 호출. MINIMAX_API_KEY 필요. |
nai | NovelAI 텍스트 생성 전용 레인. NOVELAI_API_KEY가 필요하며 레퍼런스와 편집은 지원하지 않습니다. |
comfy | 등록된 ComfyUI 이미지 워크플로. 사용할 수 있는 모델은 런타임 워크플로 카탈로그에서 가져옵니다. |
Prompt Builder 백엔드
Prompt Builder의 라우팅은 현재 이미지 프로바이더와 별개입니다. Settings > Providers에서 자동
선택이나 GPT OAuth, OpenAI API, Grok, Grok API를 고르고, 그 백엔드가 지원하는 Builder model을
선택합니다. 자동 선택은 oauth → grok → api → grok-api 순서로 준비된 경로를 찾습니다.
백엔드를 직접 고르면 다른 경로로 넘어가지 않으며, 사용할 수 없을 때는 키 누락 같은 명시적인 오류를
돌려줍니다. 실제로 응답한 백엔드는 via <backend> 배지에서 확인할 수 있습니다.
모델
GPT OAuth 레인의 기본 모델은 gpt-6-luna이고, API 키 레인은 gpt-5.6-luna를 유지합니다. Prompt Builder는 별도 백엔드
설정을 따르며, GPT 백엔드를 쓸 때 Luna가 기본 Builder model입니다.
| 모델 | 용도 |
|---|---|
gpt-6-luna | GPT OAuth 기본값. Prompt Builder가 GPT OAuth를 쓸 때도 기본 모델입니다. |
gpt-6-sol | GPT OAuth의 또 다른 일상용 GPT-6 모델. |
gpt-6-astra | 가장 오래 추론하는 대신 가장 느립니다. OAuth·API 레인에서 고를 수 있습니다. |
gpt-5.6-luna / gpt-5.6-terra / gpt-5.6-sol | API 키 레인 모델(gpt-5.6-luna가 기본값). GPT OAuth에서는 gpt-6-sol(sol) 또는 gpt-6-luna로 바뀝니다. |
gpt-5.5 / gpt-5.4 / gpt-5.4-mini | API 키 레인 호환 모델. GPT OAuth에서는 gpt-6-luna로 실행됩니다. |
grok-imagine-image | 빠른 호환 Grok 이미지 모델. |
grok-imagine-image-quality | 최고 품질 Grok 이미지 모델. |
grok-imagine-image-2.0 | 새 세션의 기본 Grok 이미지 모델. |
grok-imagine-video | Ref2V·edit·extension 호환 경로용 모델. |
grok-imagine-video-1.5 | 기본 Grok 비디오 모델. 프롬프트 전용 T2V, 단일 이미지/프레임 I2V와 지원 시 1080p에 사용합니다. |
nano-banana-2 | Gemini 이미지 모델(Flash). agy 경로는 1024×1024 고정. gemini-api 경로는 512px–4K·가변 화면비 지원. |
nano-banana-pro | Gemini Pro 이미지 모델. gemini-api 전용. 1K–4K 해상도, 10개 화면비 지원. |
앱은 품질(low, medium, high)과 moderation(auto,
low) 컨트롤도 제공합니다. reasoning effort는 none, low, medium, high, xhigh를 받습니다.
ima2 defaults set model gpt-5.5와
ima2 defaults set reasoning high는 OAuth와 API 프로바이더 기본 키를 모두 기록해,
"기본 모델"이 두 경로에서 하나의 개념으로 유지됩니다.
Grok 파이프라인
Grok Classic, Node, Agent 요청은 세 단계로 동작합니다: 필수 xAI Web Search,
planner pass(기본 grok-4.3, IMA2_GROK_PLANNER_MODEL·설정 UI·비디오
CLI의 --planner-model로 변경)로 영어 최종 이미지 프롬프트를 만든 뒤, xAI 이미지를 생성합니다. Grok 4.5·4.6도 고를 수 있습니다.
텍스트만 있는 요청은 /v1/images/generations를 쓰고, 레퍼런스 이미지·Node 부모 이미지·Agent 현재 이미지가 있으면
image-to-image 문맥을 유지하기 위해 /v1/images/edits를 씁니다. 이 경로의 입력 이미지는 총 세 장까지입니다.
ima2는 OpenAI식 size를 xAI aspect_ratio와 resolution 컨트롤로 매핑합니다.
Grok mask edit은 이번 릴리스에 연결되지 않았고 GROK_MASK_UNSUPPORTED를 반환합니다.
Grok 비디오
Grok 비디오 생성 기본값은 정식 grok-imagine-video-1.5입니다.
grok-imagine-video는 Ref2V·edit·extension 호환 경로에서 계속 사용합니다. 기존
grok-imagine-video-1.5-preview 값은 호환 alias로만 받습니다. 세 가지 모드가 레퍼런스 수에서 자동
감지됩니다: text-to-video (0개), image-to-video (1개), reference-to-video (2–14개; 1.5는 최대 15초, base는 10초).
컨트롤: 길이(1–15초), 해상도(480p, 720p, 1.5 단일 이미지/프레임 I2V의 1080p), 화면비.
1.5는 Ref2V, V2V edit, extension 지원을 추가하지 않으므로 해당 경로는 기본 모델만 사용합니다.
비디오 설정 또는 CLI
--planner-model로 플래너 모델을 고를 수 있습니다. 엔드포인트
POST /api/video/generate는 SSE 이벤트를 스트리밍합니다: planning → submitted →
progress → done. CLI: ima2 video "prompt" --model grok/grok-imagine-video-1.5 --duration 5 --resolution 720p
(한 번만 ima2 defaults set video grok/grok-imagine-video-1.5로 기본값을 잡아두면 이후엔 생략 가능).
MCP 레인 (Runway, Higgsfield)
3.0.0부터 CLI는 원격 MCP 프로바이더 두 레인을 추가로 라우팅합니다:
runway(Gen-4/4.5, Veo 3.1, Seedance 2, Kling — 이미지·비디오)와
higgsfield(유료 플랜 전까지 카탈로그 전용). ima2 models로 레인 상태와
모델별 capability를 확인한 뒤 다른 레인처럼 지정하면 됩니다:
ima2 video "prompt" --model runway/veo-3.1 --duration 8. MCP 작업은 비동기라서
CLI가 POST /api/mcp/generate로 제출하고 공용 SSE 이벤트 스트림에서 완료를 기다린 뒤
갤러리에 파일이 저장됩니다.
Grok 청구 & 계정 전환
설정의 QuotaCard에서 Grok 청구 현황($used/$limit)과 월간 사용량 바를 확인할 수 있습니다.
Switch Account 버튼을 누르면 server-side device-code 흐름으로 xAI OAuth 재인증이
시작됩니다 — 새 탭이 열리고, 표시된 device code를 확인한 뒤 서버가 폴링해 자동 완료합니다.
Codex(GPT OAuth) 계정도 동일한 흐름으로 전환할 수 있습니다.
Gemini API (직접)
provider: "gemini-api"는 Google Generative Language API 또는 Vertex AI를 직접 호출합니다.
- 모델:
nano-banana-2(Gemini 3.1 Flash Image) 또는nano-banana-pro(Gemini 3 Pro Image). UI의 2열 모델 선택기로 전환합니다. - 화면비: 1:1·2:3·3:2·3:4·4:3·4:5·5:4·9:16·16:9·21:9 — 10개 버튼.
- 해상도(imageSize): 512px·1K·2K·4K — 화면비와 조합해 정확한 픽셀 크기로 매핑됩니다.
- 비용 예상: Flash(
nano-banana-2): 512px=$0.045, 1K=$0.067, 2K=$0.101, 4K=$0.151. Pro(nano-banana-pro): 1K/2K=$0.134, 4K=$0.240 (이미지당). - 인증: API key(
GEMINI_API_KEY또는 웹 UI) 또는 Vertex AI 서비스 계정 JSON. 둘 다 설정된 경우 Vertex AI가 우선합니다. 인증 모드는 마지막으로 저장한 설정이 영속됩니다. - Vertex AI 제한: Vertex 경로(
aiplatform.googleapis.com)는response_format필드를 지원하지 않아 화면비·해상도 요청이 무시됩니다 — 출력은 기본 1K/1:1로 고정됩니다. 직접 API 경로는 화면비·해상도를 모두 반영합니다.
API 프로바이더 기본값
API 경로를 명시적 옵션 없이 사용하면 다음 기본값이 적용됩니다:
| 변수 | 기본값 |
|---|---|
IMA2_API_IMAGE_MODEL_DEFAULT | gpt-5.6-luna |
IMA2_API_REASONING_EFFORT | low |
IMA2_API_IMAGE_SIZE | 1024x1024 |
IMA2_API_ALLOW_WEB_SEARCH | true |
전체 환경 변수 표는 설정을 보세요.