[Hacker News 요약] 코드로 AI 그림 그리기: 강화학습 기반 창작 도구 개발
3
설명
AI 이미지 생성 모델의 한계는 프롬프트 기반 상호작용에 국한된다는 점입니다. 이 프로젝트는 언어 모델이 코드를 작성하여 이미지를 생성하도록 강화학습으로 훈련하는 새로운 접근 방식을 제시합니다. 이를 통해 사용자는 프롬프트 재입력 없이 코드 수준에서 이미지 편집이 가능해집니다.
### 배경 설명
기존의 AI 이미지 생성 방식은 사용자가 텍스트 프롬프트만을 통해 결과물을 제어할 수 있다는 명확한 한계를 지닙니다. 사용자가 이미지의 특정 부분을 수정하거나 세밀한 조정을 원할 경우, 모델로 돌아가 프롬프트를 다시 작성해야 하는 번거로움이 따릅니다. 이러한 제약은 창의적이고 디자인 중심적인 작업에서 AI의 활용성을 제한하는 요인으로 작용합니다. 본 프로젝트는 이러한 문제점을 해결하기 위해, AI 모델이 직접 코드를 작성하여 이미지를 생성하도록 훈련하는 방식을 탐구합니다. 여기서 생성된 코드는 단순한 결과물이 아닌, 사용자가 직접 수정하고 제어할 수 있는 '아티팩트'가 됩니다. 이는 이미지 생성 과정에 대한 사용자의 참여도를 높이고, 보다 세밀하고 직관적인 편집 경험을 제공할 잠재력을 지닙니다. 특히, 창의적이고 디자인 관련 작업에 강화학습을 적용하는 것은 '검증 가능한 보상'이라는 강화학습의 근본적인 원칙과 충돌하는 지점이 있습니다. 수학 문제의 정답 여부나 게임의 승패와 달리, 미적 품질이나 디자인의 우수성은 객관적인 판단이 어렵기 때문입니다. 따라서 본 연구는 이러한 주관적인 영역에서 어떻게 효과적인 보상 함수를 설계하고, 모델이 일반화된 미적 기준을 학습하도록 유도할 수 있는지에 대한 근본적인 질문을 던집니다.
### 프로젝트 개요 및 기여
본 프로젝트는 Surya Narreddi가 친구 Cameron과 함께 진행했으며, 디자인, 개발, 강화학습, 연구 등 다양한 분야의 기여가 포함되었습니다. 프로젝트의 핵심 아이디어는 AI가 텍스트 프롬프트 대신 p5.brush JavaScript 코드를 작성하여 이미지를 생성하도록 훈련하는 것입니다. 이 코드는 수정 가능하며, 이를 통해 사용자는 프롬프트 재작성 없이도 이미지의 세부 사항을 직접 제어할 수 있습니다. 이는 AI 이미지 생성 과정에서 사용자의 능동적인 참여를 가능하게 하는 중요한 발전입니다.
### 작동 방식: 4단계 훈련 루프
시스템은 '프롬프트 입력 → 코드 생성 → 이미지 렌더링 → 보상 평가 및 업데이트'의 4단계 루프로 구성됩니다. 모델은 '수채화 스타일의 복숭아 히비스커스 꽃을 그려줘'와 같은 프롬프트를 받아 p5.brush JavaScript 코드를 생성합니다. 생성된 코드는 샌드박스 환경에서 렌더링되어 PNG 이미지로 변환됩니다. 이 이미지는 미리 평가된 참조 이미지 풀과 비교되어, 더 나은 수채화 품질을 가진 이미지가 선택됩니다. 이 평가 결과는 강화학습(GRPO)을 통해 모델 업데이트에 사용되며, 이 과정이 수천 번 반복됩니다. 특히, 어떤 기준을 평가하고, 어떻게 평가하며, 참조 풀에 무엇을 포함할지, 시스템 프롬프트를 어떻게 작성할지가 중요한 설계 요소입니다.
### 보상 함수 설계의 진화
초기 보상 함수는 9가지 신호(컴파일 성공, p5.brush 사용 여부, 코드 길이, 인간 선호도 모델(HPSv3), GPT-5.4 및 Gemini를 통한 프롬프트 준수 평가, 4가지 품질 평가 등)를 포함했으나, 모델은 0.65 보상 수준에서 정체되었습니다. 진단 결과, 여러 평가 지표가 서로 높은 상관관계를 보여 동일한 것을 반복 측정하고 있었고, 코드 길이 보상은 조기에 포화되었습니다. 이를 해결하기 위해 '절대 점수 평가'에서 '쌍대 비교 평가'로 전환하고, 1,664개의 수동 평가 이미지를 포함한 참조 풀을 구축했습니다. 새로운 루브릭은 컴파일/p5.brush 사용(0.05), 코드 길이(0.05), HPSv3(0.30), 쌍대 비교 평가(0.60)로 단순화되었습니다. 이 변경 후 모델은 이전 정체 구간을 세 배 빠르게 돌파하고, 코드 길이를 13,500 토큰에서 2,000 토큰 미만으로 압축하는 등 효율성을 크게 향상시켰습니다.
### 참조 풀 구축 및 시스템 프롬프트 최적화
참조 풀은 581개의 수동 평가 이미지를 포함하며, 이 중 117개는 'love' 등급을 받았습니다. 이 이미지들은 AI 모델이 생성한 결과물이며, 충분한 인간 제작 예시를 확보하기 어려웠기 때문입니다. 참조 이미지 생성에는 AutoResearch(Opus 4.6, GPT-5.4, Gemini 3.1 Pro 사용)와 Gemini 3.1 Pro를 활용한 대규모 배치 작업이 사용되었습니다. 시스템 프롬프트 역시 GEPA(Prompt Optimization Library)를 사용하여 200번의 반복 최적화를 거쳤습니다. 초기에는 400줄의 API 참조가 포함되었으나, 모델이 존재하지 않는 API를 생성하는 문제를 야기했습니다. 최적화 결과, 8개의 브러시 메서드만 허용하는 짧고 명확한 프롬프트가 효과적인 것으로 나타났습니다.
### 가치와 인사이트
이 프로젝트는 AI 이미지 생성 분야에서 프롬프트 엔지니어링의 한계를 극복하고, 코드 기반의 직접적인 편집 가능성을 제시한다는 점에서 큰 가치를 지닙니다. 특히, 주관적인 영역인 창의적 작업에 강화학습을 적용하기 위한 보상 함수 설계의 중요성과 그 방법론을 구체적으로 보여줍니다. 쌍대 비교 평가와 잘 구축된 참조 풀은 모델이 일반화된 미적 기준을 학습하도록 돕는 효과적인 전략입니다. 이는 디자이너, 개발자 등 창작 활동을 하는 사람들에게 AI를 더욱 유연하고 강력한 도구로 활용할 수 있는 새로운 가능성을 열어줍니다. 또한, AI 모델이 단순히 결과물을 생성하는 것을 넘어, 사용자가 이해하고 수정할 수 있는 '코드'라는 형태로 결과물을 산출한다는 점에서 AI의 투명성과 제어 가능성을 높입니다.
### 기술·메타
- p5.brush
- JavaScript
- Reinforcement Learning (GRPO)
- Puppeteer
- GPT-5.4
- Gemini 3.1 Pro
- HPSv3
- GEPA (Prompt Optimization Library)
### 향후 전망
본 프로젝트는 현재 진행 중이며, 발견된 문제점을 개선하기 위한 최종 훈련이 계획되어 있습니다. 2026년 6월에는 전체 기술 보고서가 발표될 예정입니다. 향후에는 '진정한 RLHF(Reinforcement Learning from Human Feedback)'를 위해 평가 등급을 기반으로 작은 보상 모델을 훈련하는 단계로 나아갈 수 있습니다. 이를 통해 참조 풀과의 비교 없이도 모델 스스로 '좋음'의 기준을 적용할 수 있게 될 것입니다. 또한, 이 기술이 다른 창의적 분야, 예를 들어 음악 작곡이나 3D 모델링 등에 어떻게 확장될 수 있을지에 대한 연구도 기대됩니다. 경쟁 환경에서는 기존의 프롬프트 기반 모델들과의 차별화된 강점을 바탕으로, 보다 세밀한 제어를 원하는 사용자층을 확보할 수 있을 것입니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49411800)
- 원문: [링크 열기](https://surya.website/rling-qwen-to-paint-with-code)
---
출처: Hacker News · [원문 링크](https://surya.website/rling-qwen-to-paint-with-code)
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.