[Lobsters 요약] AI 제품의 진정한 실용성을 위한 필수 기능 제안
29
설명
현재 시중에 나와 있는 많은 AI 도구들은 실제 업무에 필요한 핵심 기능을 누락하고 있습니다.
이 글은 2026년 9월 27일 기준으로, 연구 및 소프트웨어 개발 분야에서 AI가 진정으로 유용함을 입증하기 위해 갖춰야 할 구체적인 기능들을 제시합니다.
이는 단순한 챗봇을 넘어, 신뢰할 수 있는 문제 해결 도구로서 AI의 가능성을 탐색합니다.
### 배경 설명
현재 AI 제품들은 종종 그 자체의 전제를 진지하게 받아들이지 않는다는 비판에 직면해 있습니다. 많은 챗봇들이 문제 해결 도구를 표방하지만, 실제 사용 경험은 기대에 미치지 못합니다. 특히 프론티어 랩(frontier labs)의 최첨단 모델들은 물론, Ollama와 같은 오픈소스 도구에서도 이러한 한계가 두드러집니다. 이러한 제품들은 사용자가 AI의 실제 능력 이상으로 과대평가하도록 유도하며, 이는 일종의 '기만' 또는 '사기'로 느껴질 수 있습니다. 이러한 문제의 근본적인 원인은 AI가 제공하는 정보의 신뢰성 부족과 사용자가 이를 검증할 도구가 부족하다는 점입니다. 특히 연구나 소프트웨어 개발과 같이 정확성과 신뢰성이 중요한 분야에서는 이러한 결함이 치명적일 수 있습니다. 따라서 AI 제품이 진정으로 유용함을 입증하기 위해서는 이러한 근본적인 문제들을 해결하기 위한 구체적인 기능 개선이 필요합니다. 이 글은 이러한 개선 방향을 제시하며, AI 기술의 실질적인 적용 가능성을 높이는 데 기여하고자 합니다.
### 실수 검증 기능의 최우선화
AI가 제공하는 정보의 신뢰성 문제는 가장 큰 과제이며, 이 글을 쓰게 된 주된 동기입니다. 모든 AI 챗봇은 사용자 인터페이스의 일부로 'AI는 실수를 할 수 있으므로 응답을 다시 확인하라'는 면책 조항을 명시하고 있습니다. 예를 들어, Gemini는 'AI는 실수를 할 수 있으니 응답을 다시 확인하세요'라고, Claude는 'Claude는 AI이며 실수를 할 수 있습니다. 응답을 다시 확인해주세요.'라고, ChatGPT는 'ChatGPT는 실수를 할 수 있습니다. 중요한 정보는 확인하세요.'라고 안내합니다. 이러한 경고는 사용자의 책임을 전가하기 위한 법적 장치로 보이며, 실제적인 도움과는 거리가 멉니다. AI의 출력물을 검증하는 과정은 사용자가 절대 건너뛸 수 없으며, 위험을 초래할 수 있습니다. 그러나 현재의 AI 제품들은 이러한 검증 과정을 쉽게 생략하도록 유도합니다. 진지한 AI 제품이라면, 이러한 약점을 심각하게 고려하여 출력물 옆에 검증 체크박스를 제공해야 합니다. 이는 LLM 출력과 인간의 검증 노트를 2열로 구성하고, 검증이 완료되면 체크하는 방식이 될 수 있습니다. 코딩 보조 도구 역시 유사한 기능을 갖춰야 하며, 현재는 코드 리뷰에 의존하고 있어 '작성자'가 검토자에게 책임을 전가하는 패턴을 보입니다. 2026년 현재, 토큰 사용 비용뿐만 아니라 AI에 소모되는 컴퓨팅 자원도 상당합니다. 테스트 컴퓨팅 클러스터를 불필요하게 소모하기 전에 변경 사항을 확인할 수 있는 기능은 유용할 것입니다. 만약 제품이 실수를 인정하고 사용자가 이를 검증해야 한다고 말하면서도, 검증을 위한 도구를 제공하지 않는다면, 사용자는 이를 진지하게 받아들이기 어렵습니다.
### 더 많은 인용 및 상세 정보 제공
대부분의 챗봇은 답변을 제공하는 데 집중하며, 인용을 소홀히 합니다. 명확한 출처가 표시된 인용 목록을 요청하면, AI는 중간에 '지루해져서' 인용을 중단하는 경향이 있습니다. 인용을 포함하더라도, 검색 결과의 도메인 이름만 표시하거나 매우 작은 글씨와 16픽셀 미만의 아이콘으로 표시하는 경우가 많습니다. 이는 잘못된 방식입니다. 이러한 인용은 RAG(Retrieval-Augmented Generation) 파이프라인의 실제 구조를 참조하지만, 사용자에게는 명확하게 제시되지 않습니다. LLM은 근본적으로 권위 있는 결과를 제공할 수 없으며, RAG 결과를 왜곡할 가능성도 있습니다. 따라서 AI는 결과를 권위 있게 제시해서는 안 됩니다. 연구 쿼리의 경우, 모든 결과는 인용 목록으로 제시되어야 하며, 각 인용은 출판 날짜, 저자 이름 등 명확한 메타데이터와 함께 큰 객체로 표시되어야 합니다. RAG 결과나 요약이 아닌, 원문 그대로의 인용이 AI 생성 텍스트보다 우선시되어야 합니다. AI가 편집하거나 요약하는 텍스트는 검증된 후에 작게 표시되어야 합니다. 만약 제품이 인용을 왜곡하거나 누락할 수 있다고 명시하면서도, 원문을 추적하거나 읽었는지 확인할 도구를 제공하지 않는다면, 사용자는 이를 진지하게 받아들이기 어렵습니다.
### 1인칭 표현 및 사과 금지
소프트웨어 개발 또는 연구 도구가 1인칭 표현을 사용할 이유는 전혀 없습니다. 또한, AI는 절대 사과해서는 안 됩니다. 이는 AI와 사용자 모두에게 시간 낭비입니다. 2026년에도 여전히 많은 AI 도구들이 비기능적인 '가드레일'을 포함하고 있으며, 이는 쉽게 우회될 수 있습니다. 생산성 향상을 진지하게 고려하는 제품이라면, 이러한 불필요한 표현을 제거하고 작업에 집중해야 합니다. LLM 기술 자체의 개선이 어렵더라도, AI 모델 자체에 대한 제어가 가능하다면, 덜 장황한 모델을 구축해야 합니다. AI가 실수를 인정하고 사용자가 이를 검증해야 한다고 말하면서도, 검증을 위한 도구를 제공하지 않는다면, 사용자는 이를 진지하게 받아들이기 어렵습니다.
### 더 많은 비자연어 인터페이스
자연어는 강력한 인터페이스가 될 수 있지만, LLM 기반 자연어 인터페이스는 종종 부정확하고 반복적이며 '모범 사례'로 위장된 미신으로 가득합니다. 입력과 결과 모두 혼란스럽습니다. 이러한 문제를 해결하기 위해 챗봇이 사용자 입력에 직접 반응하도록 하거나 '도구'를 제공하는 방식이 사용됩니다. 그러나 이는 근본적인 해결책이 아닙니다. 사용자의 의도를 명확하게 표현할 수 없다면, 시스템이 파괴적이거나 해로운 행동을 대신하도록 신뢰하는 것은 위험합니다. 특정 작업을 수행하는 데 도움이 되는 제품이라면, 해당 작업에 특화된 사용자 인터페이스를 제공해야 합니다. 예를 들어, 보안 스캐너 기능이 있다면 해당 기능을 위한 버튼을 제공해야 합니다. 이는 핵심 모델에 직접 통합되거나, 더 효과적인 소형 모델을 사용하여 구현될 수 있습니다. 현재 일부 스타트업이 이러한 기능을 제공하지만, 이는 메인 모델 제공업체의 API에 부착된 형태이며, 제품의 핵심에 통합되지 않았습니다. 2026년 현재, AI 제품은 사용자의 의도를 명확히 파악하고 특정 작업에 최적화된 인터페이스를 제공해야 합니다.
### 강력한 데이터 출처 표시
챗봇은 웹사이트, API, 도구 또는 사용자 입력 요약을 통해 데이터를 수집하고 테이블 형태로 제공합니다. 매끄러운 인터페이스를 위해 데이터 출처와 관계없이 인라인으로 표시되지만, API 호출이나 웹사이트 쿼리와 같은 기계적인 방식으로 생성된 데이터와 AI가 생성한 데이터 사이에는 큰 차이가 있습니다. 정확하고 경험적으로 검증된 데이터 기반 의사 결정을 돕는 제품이라면, 데이터 출처는 매우 중요합니다. '실수 검증' 및 '인용 검증' 워크플로우와 통합되어, 출력물의 일부를 스프레드시트처럼 취급하여 컴퓨터 산술 연산으로 검증하고 사용된 방식을 보여주는 기능이 필요합니다. 2026년 현재, AI는 데이터의 출처를 명확히 밝히고 검증 가능한 형태로 제공해야 합니다.
### 재현성 제어 강화
LLM의 '온도(temperature)' 매개변수는 출력의 무작위성을 제어하지만, 대부분의 사용자는 이를 알지 못합니다. 이는 사용자가 AI의 '권위 있는' 답변을 받았다고 느끼게 합니다. 온도 설정을 0으로 고정해도 유용한 결과를 얻을 수 없다는 점을 인지해야 합니다. 그러나 사용자가 특정 문제를 반복적으로 해결하려 할 때, LLM과 관련 없는 결정론적 데이터 처리 도구와 같은 계산 도구를 사용할 경우, 비결정론적 부분을 고정하고 업데이트된 정보로 특정 데이터 프레임을 다시 채운 후 대화를 이어갈 수 있는 기능이 필요합니다. 현재의 평면적인 채팅 인터페이스는 사용자가 이전 위젯과 상호작용하는 것을 제한하며, 이는 '사이트 체류 시간'을 늘리려는 소셜 미디어 방식의 최적화처럼 느껴집니다. 2026년 현재, 사용자는 AI 출력의 재현성을 제어하고 예측 가능한 결과를 얻을 수 있어야 합니다.
### 컨텍스트 가시성 및 관리
LLM 컨텍스트 관리는 '에이전트' 워크플로우를 사용하는 조직의 지속적인 과제입니다. 컨텍스트에 너무 많은 정보가 포함되면 문제가 발생합니다. 고급 사용자는 긴 프롬프트를 '스킬'로 분할하고, '도구'를 통해 긴 정보에 접근하며, '하위 에이전트'에 하위 문제를 위임해야 합니다. 그러나 LLM 컨텍스트는 지식 작업 문제의 폭과 깊이에 비해 상당히 작습니다. 대부분의 제품은 기본적으로 컨텍스트를 사용자에게 보여주지 않습니다. 컨텍스트 확장 도구는 종종 맹목적으로 작동하며, 사용자는 필요한 상태를 추측해야 합니다. 심지어 컨텍스트 압축 관리도 API 기반 워크플로우로 처리됩니다. 사용자를 돕는 진지한 제품이라면, '사용 가능한 컨텍스트'를 보여줄 뿐만 아니라, 컨텍스트 압축의 영향을 설명하고, 하네스 생성 프롬프트를 쉽게 볼 수 있도록 해야 합니다. 이는 재현성/재생 도구와 결합하여 사용자가 컨텍스트 창을 효과적으로 활용하는 방법을 실험하고 이해할 수 있도록 합니다. 2026년 현재, AI 제품은 컨텍스트 정보를 투명하게 공개하고 사용자가 이를 효과적으로 관리할 수 있도록 지원해야 합니다.
### 실질적인 샌드박스 환경
챗봇 인터페이스는 즉각적으로 눈에 띄는 문제이지만, 코딩에 사용되는 '에이전트 루프' 도구 역시 위험합니다. 코딩 도구는 수년간 데이터를 파괴해 왔습니다. 이러한 치명적인 사고는 상대적으로 드물지만, 유일한 샌드박스 위반은 아닙니다. 코딩 모델은 시스템 테스트 코드가 아닌 테스트 코드를 편집하는 경우가 많아, 에이전트에게 속이지 말라고 요청하는 '팁' 기사가 웹에 널려 있습니다. 사고 발생 시 '도커 컨테이너 사용'과 같은 피상적인 조언이 제공되지만, 이는 운영 체제를 삭제하는 것을 막을 수는 있어도 코드베이스의 로컬 작업을 파괴하는 것을 막지는 못합니다. 정보 보안 분야에서는 이러한 코딩 하네스가 남긴 격차를 메우기 위한 활동이 활발하지만, 최선의 경우에도 이러한 완화책과 프록시는 사용자를 자동 승인 자동 장치로 만들 뿐입니다. 2026년 현재, '에이전트 코딩'은 안전하지 않은 기본 기술로, 적절한 통제 없이 배포되고 있습니다. 안전이 내장된 도구를 제공해야 합니다. 파일 시스템 작업 샌드박싱, 삭제 범위 엄격 제한, 모든 작업 시 리포 스냅샷, '자동 모드' 제거, 그리고 사용자에게 구조화된 계획을 제시하는 방식 등이 필요합니다. 연구 기반 작업과 마찬가지로, 에이전트 기반 작업도 모의 서비스에 대해 실행될 수 있어야 하며, 프론트엔드와 백엔드 모두에서 검증이 가능해야 합니다. 그러나 현재 프론티어 랩은 즉시 사용 가능한 재앙적인 제품을 제공하고, 사용자가 자체적으로 복잡하고 오류가 발생하기 쉬운 보안 경계를 구축하도록 합니다. 결국 '운영자 오류'를 탓합니다. 이러한 설계 선택이 생산성 향상을 목표로 한다고 믿기 어렵습니다.
### 가치와 인사이트
이 글은 현재 AI 제품들이 실제 업무 환경에서 겪는 근본적인 한계점을 지적하며, 2026년 현재 시점에서 AI가 진정한 '제품'으로 인정받기 위해 필수적으로 갖춰야 할 기능들을 구체적으로 제시합니다. 특히, AI의 부정확성, 정보의 출처 불분명성, 사용자 인터페이스의 비효율성, 그리고 안전 문제 등은 AI 기술의 실질적인 가치를 저해하는 요소로 분석됩니다. '실수 검증 기능 최우선화', '명확한 인용 및 상세 정보 제공', '비자연어 인터페이스 활용', '데이터 출처 명확화', '재현성 제어 강화', '컨텍스트 가시성 확보', 그리고 '안전한 샌드박스 환경 구축'과 같은 제안은 AI 개발자 및 제품 기획자들에게 실질적인 방향을 제시합니다. 또한, AI 도입 조직의 프로세스 개선, 즉 '교대 근무를 통한 경계심 유지', '기술 연습을 통한 숙련도 유지', '정신 건강 자원 확보'의 중요성을 강조하며, 기술적 측면뿐만 아니라 조직 문화 및 인적 관리 측면에서의 고려 사항도 포함합니다. 이는 AI가 단순한 기술 시연을 넘어, 실제 생산성 향상과 신뢰성 있는 문제 해결 도구로 발전하기 위한 로드맵을 제공합니다.
### 향후 전망
현재 AI 제품들은 단기적인 데모에 초점을 맞춘 설계 철학을 가지고 있으며, 실제 생산성 향상 방안에 대한 고려가 부족하다는 비판이 제기됩니다. 수년간 수십억 달러의 투자가 이루어졌음에도 불구하고, 안전하고 유용한 기능을 갖춘 제품이 출시되지 않는다면, 이는 AI 기술이 실제 생산성 향상에 기여하지 못한다는 것을 시사합니다. 만약 AI 도구가 사용자가 실제로 달성하려는 작업에 대한 효과를 측정하는 도구를 제공한다면, 이는 AI 작업이 성공적이지 못하다는 것을 보여줄 수 있습니다. 현재로서는 AI 도구가 전반적으로 제로 가치를 제공하며, 빈번한 실수와 통제하기 어려운 외부 효과로 인해 조직에 제공하는 이점을 상쇄한다는 가설이 유력합니다. 만약 AI 기술이 더 안전하고 유용해진다면, 이는 AI 기술의 발전에 긍정적인 신호가 될 것입니다. 2026년 이후, AI 제품들은 이러한 비판에 대한 응답으로 안전성과 실용성을 강화하는 방향으로 발전할 가능성이 높습니다. 특히, 경쟁사들이 안전 기능을 도입하고 긍정적인 결과를 보여준다면, 이는 업계 전반의 표준으로 자리 잡을 수 있습니다. 반대로, 이러한 개선이 이루어지지 않는다면, AI 기술의 신뢰성에 대한 의문은 더욱 커질 것입니다. 커뮤니티의 피드백과 지속적인 연구 개발을 통해 AI 제품의 미래는 결정될 것입니다.
📝 원문 및 참고
- Source: Lobsters
- 토론(Lobsters): [lobste.rs](https://lobste.rs/s/q2rymh/what_would_serious_ai_product_look_like)
- 원문: [링크 열기](https://blog.glyph.im/2026/09/serious-ai-product.html)
---
출처: Lobsters · [원문 링크](https://blog.glyph.im/2026/09/serious-ai-product.html)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.