핵심 개념

프로바이더 & 모델

core registry에는 OpenAI OAuth/API, Grok OAuth/API, Gemini/Antigravity CLI, Gemini 직접 API, AtlasCloud, MiniMax, NovelAI, 등록된 ComfyUI 워크플로가 있습니다. Runway와 Higgsfield는 아래에서 따로 설명하는 MCP 연동입니다.

프로바이더 경로

  • provider: "oauth" — 서버가 ChatGPT 세션으로 ChatGPT의 Codex 백엔드를 직접 호출합니다. GPT-6 모델이 프롬프트를 기획하고 gpt-image-2가 그립니다. 기본 경로이며 API key가 필요 없습니다.
  • provider: "api" — 호스티드 image_generation 도구로 OpenAI Responses API를 호출합니다. OPENAI_API_KEY가 필요합니다.
  • provider: "grok" — ~/.progrok/auth.json의 xAI OAuth 세션으로 api.x.ai를 직접 호출합니다. 필수 xAI Web Search와 planner pass(기본 grok-4.3, 설정 또는 --planner-model로 변경)를 거친 뒤 xAI Images API를 호출합니다. Grok 4.5·4.6도 고를 수 있습니다.
  • provider: "grok-api" — grok과 같은 xAI pipeline을 직접 XAI_API_KEY로 실행합니다.
  • provider: "agy" — Antigravity CLI(agy -p)를 통해 Google Gemini(nano-banana-2)로 이미지를 생성합니다. 고정 1024×1024 JPEG 출력, 최대 3장 참조.
  • provider: "gemini-api" — Google Generative Language API 또는 Vertex AI를 직접 호출합니다. 모델 nano-banana-2(Gemini 3.1 Flash Image)와 nano-banana-pro(Gemini 3 Pro Image) 지원. 가변 화면비와 해상도(512px–4K) 지원. GEMINI_API_KEY 또는 Vertex AI 서비스 계정 JSON이 필요합니다.
  • provider: "atlascloud" — ATLASCLOUD_API_KEY로 AtlasCloud GPT Image 2 생성·편집을 호출하며 참조는 최대 10장입니다.
  • provider: "minimax" — MINIMAX_API_KEY로 MiniMax image-01과 image-01-live를 호출하며 참조는 1장입니다.
  • provider: "nai" — 저장된 토큰으로 NovelAI를 호출합니다. 텍스트 생성 전용이며 negativePrompt와 고유 샘플링 옵션을 제공합니다. 레퍼런스와 편집 요청은 다른 동작으로 바꾸지 않고 오류로 끝냅니다.
  • provider: "comfy" — 등록된 ComfyUI 이미지 워크플로를 실행합니다. 워크플로 하나가 런타임 모델 하나로 등록됩니다.

core lane은 Classic, Node, Agent Mode를 지원합니다. Agent Mode는 웹 UI 전용이고, Classic과 Node는 CLI도 있습니다.

요청 단위 오버라이드

생성 명령은 아래 core lane ID를 명시합니다. 일부 명령이 받는 auto는 별도 프로바이더가 아니라 라우팅 모드입니다.

값동작
auto지원 명령에서만 쓰는 routing mode이며 provider lane이 아닙니다.
oauthGPT OAuth 경로 강제.
apiAPI key Responses 경로 강제; 설정된 key가 필요합니다.
grokapi.x.ai로 가는 xAI OAuth 경로 강제. 최초 1회 ima2 grok login 또는 웹 UI 로그인으로 device code 인증을 진행합니다.
grok-apiOAuth 세션 대신 xAI API key를 직접 사용. grok과 동일한 파이프라인(Web Search → planner → 이미지 생성). 웹 UI key 관리 또는 XAI_API_KEY env var 필요. 비디오 생성도 지원.
agyAntigravity CLI로 Gemini 이미지 생성. agy 바이너리 필요. 1024×1024 고정, JPEG, 최대 3장 참조, 품질/크기/마스크 미지원.
gemini-apiGoogle Generative Language API 또는 Vertex AI 직접 호출. 모델 nano-banana-2/nano-banana-pro. 가변 화면비·해상도 지원. API key 또는 Vertex 서비스 계정 JSON 필요.
atlascloudAtlasCloud API 직접 호출. ATLASCLOUD_API_KEY 필요.
minimaxMiniMax API 직접 호출. MINIMAX_API_KEY 필요.
naiNovelAI 텍스트 생성 전용 레인. NOVELAI_API_KEY가 필요하며 레퍼런스와 편집은 지원하지 않습니다.
comfy등록된 ComfyUI 이미지 워크플로. 사용할 수 있는 모델은 런타임 워크플로 카탈로그에서 가져옵니다.

Prompt Builder 백엔드

Prompt Builder의 라우팅은 현재 이미지 프로바이더와 별개입니다. Settings > Providers에서 자동 선택이나 GPT OAuth, OpenAI API, Grok, Grok API를 고르고, 그 백엔드가 지원하는 Builder model을 선택합니다. 자동 선택은 oauth → grok → api → grok-api 순서로 준비된 경로를 찾습니다. 백엔드를 직접 고르면 다른 경로로 넘어가지 않으며, 사용할 수 없을 때는 키 누락 같은 명시적인 오류를 돌려줍니다. 실제로 응답한 백엔드는 via <backend> 배지에서 확인할 수 있습니다.

모델

GPT OAuth 레인의 기본 모델은 gpt-6-luna이고, API 키 레인은 gpt-5.6-luna를 유지합니다. Prompt Builder는 별도 백엔드 설정을 따르며, GPT 백엔드를 쓸 때 Luna가 기본 Builder model입니다.

모델용도
gpt-6-lunaGPT OAuth 기본값. Prompt Builder가 GPT OAuth를 쓸 때도 기본 모델입니다.
gpt-6-solGPT OAuth의 또 다른 일상용 GPT-6 모델.
gpt-6-astra가장 오래 추론하는 대신 가장 느립니다. OAuth·API 레인에서 고를 수 있습니다.
gpt-5.6-luna / gpt-5.6-terra / gpt-5.6-solAPI 키 레인 모델(gpt-5.6-luna가 기본값). GPT OAuth에서는 gpt-6-sol(sol) 또는 gpt-6-luna로 바뀝니다.
gpt-5.5 / gpt-5.4 / gpt-5.4-miniAPI 키 레인 호환 모델. GPT OAuth에서는 gpt-6-luna로 실행됩니다.
grok-imagine-image빠른 호환 Grok 이미지 모델.
grok-imagine-image-quality최고 품질 Grok 이미지 모델.
grok-imagine-image-2.0새 세션의 기본 Grok 이미지 모델.
grok-imagine-videoRef2V·edit·extension 호환 경로용 모델.
grok-imagine-video-1.5기본 Grok 비디오 모델. 프롬프트 전용 T2V, 단일 이미지/프레임 I2V와 지원 시 1080p에 사용합니다.
nano-banana-2Gemini 이미지 모델(Flash). agy 경로는 1024×1024 고정. gemini-api 경로는 512px–4K·가변 화면비 지원.
nano-banana-proGemini Pro 이미지 모델. gemini-api 전용. 1K–4K 해상도, 10개 화면비 지원.

앱은 품질(low, medium, high)과 moderation(auto, low) 컨트롤도 제공합니다. reasoning effort는 none, low, medium, high, xhigh를 받습니다.

영속 기본값. ima2 defaults set model gpt-5.5와 ima2 defaults set reasoning high는 OAuth와 API 프로바이더 기본 키를 모두 기록해, "기본 모델"이 두 경로에서 하나의 개념으로 유지됩니다.

Grok 파이프라인

Grok Classic, Node, Agent 요청은 세 단계로 동작합니다: 필수 xAI Web Search, planner pass(기본 grok-4.3, IMA2_GROK_PLANNER_MODEL·설정 UI·비디오 CLI의 --planner-model로 변경)로 영어 최종 이미지 프롬프트를 만든 뒤, xAI 이미지를 생성합니다. Grok 4.5·4.6도 고를 수 있습니다. 텍스트만 있는 요청은 /v1/images/generations를 쓰고, 레퍼런스 이미지·Node 부모 이미지·Agent 현재 이미지가 있으면 image-to-image 문맥을 유지하기 위해 /v1/images/edits를 씁니다. 이 경로의 입력 이미지는 총 세 장까지입니다.

ima2는 OpenAI식 size를 xAI aspect_ratio와 resolution 컨트롤로 매핑합니다. Grok mask edit은 이번 릴리스에 연결되지 않았고 GROK_MASK_UNSUPPORTED를 반환합니다.

Grok 비디오

Grok 비디오 생성 기본값은 정식 grok-imagine-video-1.5입니다. grok-imagine-video는 Ref2V·edit·extension 호환 경로에서 계속 사용합니다. 기존 grok-imagine-video-1.5-preview 값은 호환 alias로만 받습니다. 세 가지 모드가 레퍼런스 수에서 자동 감지됩니다: text-to-video (0개), image-to-video (1개), reference-to-video (2–14개; 1.5는 최대 15초, base는 10초). 컨트롤: 길이(1–15초), 해상도(480p, 720p, 1.5 단일 이미지/프레임 I2V의 1080p), 화면비. 1.5는 Ref2V, V2V edit, extension 지원을 추가하지 않으므로 해당 경로는 기본 모델만 사용합니다. 비디오 설정 또는 CLI --planner-model로 플래너 모델을 고를 수 있습니다. 엔드포인트 POST /api/video/generate는 SSE 이벤트를 스트리밍합니다: planning → submitted → progress → done. CLI: ima2 video "prompt" --model grok/grok-imagine-video-1.5 --duration 5 --resolution 720p (한 번만 ima2 defaults set video grok/grok-imagine-video-1.5로 기본값을 잡아두면 이후엔 생략 가능).

MCP 레인 (Runway, Higgsfield)

3.0.0부터 CLI는 원격 MCP 프로바이더 두 레인을 추가로 라우팅합니다: runway(Gen-4/4.5, Veo 3.1, Seedance 2, Kling — 이미지·비디오)와 higgsfield(유료 플랜 전까지 카탈로그 전용). ima2 models로 레인 상태와 모델별 capability를 확인한 뒤 다른 레인처럼 지정하면 됩니다: ima2 video "prompt" --model runway/veo-3.1 --duration 8. MCP 작업은 비동기라서 CLI가 POST /api/mcp/generate로 제출하고 공용 SSE 이벤트 스트림에서 완료를 기다린 뒤 갤러리에 파일이 저장됩니다.

Grok 청구 & 계정 전환

설정의 QuotaCard에서 Grok 청구 현황($used/$limit)과 월간 사용량 바를 확인할 수 있습니다. Switch Account 버튼을 누르면 server-side device-code 흐름으로 xAI OAuth 재인증이 시작됩니다 — 새 탭이 열리고, 표시된 device code를 확인한 뒤 서버가 폴링해 자동 완료합니다. Codex(GPT OAuth) 계정도 동일한 흐름으로 전환할 수 있습니다.

Gemini API (직접)

provider: "gemini-api"는 Google Generative Language API 또는 Vertex AI를 직접 호출합니다.

  • 모델: nano-banana-2(Gemini 3.1 Flash Image) 또는 nano-banana-pro(Gemini 3 Pro Image). UI의 2열 모델 선택기로 전환합니다.
  • 화면비: 1:1·2:3·3:2·3:4·4:3·4:5·5:4·9:16·16:9·21:9 — 10개 버튼.
  • 해상도(imageSize): 512px·1K·2K·4K — 화면비와 조합해 정확한 픽셀 크기로 매핑됩니다.
  • 비용 예상: Flash(nano-banana-2): 512px=$0.045, 1K=$0.067, 2K=$0.101, 4K=$0.151. Pro(nano-banana-pro): 1K/2K=$0.134, 4K=$0.240 (이미지당).
  • 인증: API key(GEMINI_API_KEY 또는 웹 UI) 또는 Vertex AI 서비스 계정 JSON. 둘 다 설정된 경우 Vertex AI가 우선합니다. 인증 모드는 마지막으로 저장한 설정이 영속됩니다.
  • Vertex AI 제한: Vertex 경로(aiplatform.googleapis.com)는 response_format 필드를 지원하지 않아 화면비·해상도 요청이 무시됩니다 — 출력은 기본 1K/1:1로 고정됩니다. 직접 API 경로는 화면비·해상도를 모두 반영합니다.

API 프로바이더 기본값

API 경로를 명시적 옵션 없이 사용하면 다음 기본값이 적용됩니다:

변수기본값
IMA2_API_IMAGE_MODEL_DEFAULTgpt-5.6-luna
IMA2_API_REASONING_EFFORTlow
IMA2_API_IMAGE_SIZE1024x1024
IMA2_API_ALLOW_WEB_SEARCHtrue

전체 환경 변수 표는 설정을 보세요.