고성능 모델이 한도를 너무 빨리 소진
해외에서는 Fable Max 요금제의 일주일치 사용량이 하루 만에 소진돼 추가 구매를 고민하는 반응이 나왔다. 국내에서는 Astra를 울트라나 고난도 설정으로 돌리면 짧은 작업에도 한도가 크게 줄어든다며, 결과는 좋지만 비용 때문에 하위 모델이나 낮은 사고 수준을 선택한다는 이야기가 이어졌다.
서비스 장애와 초기화 시점이 불안정
Hacker News에서는 Claude가 당일 이상이 있는지 묻는 글이 올라왔고, 국내에서는 GPT·Codex·Telegram이 멈추거나 초기화되지 않는다는 문의가 반복됐다. 사용자들은 초기화 직후 작업을 몰아 하거나, Telegram 장애 때 터미널·Slack·웹페이지를 대체 창구로 찾았다.
AI를 업무 시스템처럼 연결해 둔 사용자는 모델 성능보다 접속 가능성과 복구 예측 가능성에 더 민감하다. 장애 시 자동으로 다른 모델이나 채널로 넘기는 백업 설계가 개인 사용자에게도 필요해지고 있다.
Cursor 업데이트와 사용량 변화가 예측 불가
한 사용자는 평소와 같은 프로젝트와 프롬프트를 썼는데도 며칠 사이 Cursor 사용량이 급증했다고 했다. 또 다른 사용자는 업데이트 후 기본 모델이 Grok으로 바뀌면서 답변이 옆길로 새고 품질이 떨어졌다고 했으며, 큰 사양과 스크린샷을 매 대화마다 다시 올리며 컨텍스트를 관리하는 불편도 제기됐다.
모델 기본값과 과금·컨텍스트 동작이 사용자에게 충분히 설명되지 않으면 제품 업데이트가 곧 품질 저하로 체감된다. 모델 선택, 사용량 원인, 반복 자료 재사용을 더 투명하게 보여줄 필요가 있다.
에이전트는 자율적이지만 진행 상황이 안 보임
해외에서는 Astra를 Claude Code의 주 모델로 쓰며 작업 방향을 잘 유지하고 리디렉션도 잘 따른다는 평가가 있었고, 여러 에이전트를 Slack과 Mac mini에 나눠 운영하는 사례도 공유됐다. 국내 사용자들은 Claude·Codex가 복잡한 작업에서 서브에이전트를 알아서 만들지만 어디서 무엇이 진행되는지 시각적으로 잘 보이지 않아 답답하다고 했다.
자율성이 높아질수록 사용자는 직접 조작보다 감독을 원한다. 에이전트별 작업 상태, 모델 배정, 진행 로그와 실패 지점을 한 화면에서 확인하는 운영 기능이 신뢰를 좌우할 가능성이 크다.
컴퓨터 사용 자동화가 편리함과 병목을 함께 만듦
국내 사용자는 문서를 내려받아 요약하는 과정이 가장 큰 병목이고, Claude Code가 화면 좌표 기반 computer use로 처리해 답답하다고 했다. 다른 사용자는 Codex가 카카오톡 화면을 실시간 기록하고 있어 듀얼 모니터가 버벅였지만, 원인을 해결한 뒤에는 문제가 사라졌다고 공유했다.
화면을 직접 조작하는 자동화는 파일 접근과 프로그램 제어를 크게 단순화하지만, 재현성·성능 저하·백그라운드 동작 파악이 어렵다. 자동화가 어떤 화면과 자원을 사용 중인지 표시하고, 로컬·확장 프로그램 기반의 더 안정적인 경로를 제공해야 한다.
법률 문서 처리는 비용과 개인정보가 충돌
법률 문서의 추출·요약·초안 작성에 Haiku와 Sonnet API를 쓰는 사용자는 테스트만 해도 1~3달러가 나간다고 호소했다. 대안으로 로컬 Gemma, Gemini, 무료 GPT Luna가 언급됐고, 개인정보 때문에 일반 채팅을 피한다는 의견에 학습 설정을 끄거나 프로젝트 전용 메모리를 쓰자는 조언이 나왔지만 결론은 나지 않았다.
민감한 문서 사용자는 저렴한 모델보다 데이터 처리 방식과 비용 통제를 동시에 요구한다. 캐싱·배치 처리·단계별 모델 분리 같은 비용 절감 기능과 개인정보 보호 설정을 사용자가 쉽게 검증할 수 있어야 도입 장벽이 낮아진다.
이미지 생성 품질은 올랐지만 비교와 일관성이 관건
긱뉴스에서는 Images 2.5가 참조 사진 재현과 편집 정확도를 높이고 생성 지연을 줄였다는 소식이 공유됐다. 국내 사용자는 나노바나나나 이전 GPT 이미지 모델보다 간단한 이미지에서 대상의 일관성을 더 잘 유지하는 것 같다며 직접 비교해보겠다고 했다.
사용자는 단순히 예쁜 결과보다 참조 대상과 캐릭터가 반복 생성에서도 유지되는지를 중요하게 본다. 이미지 모델의 체감 개선은 분명하지만, 복잡한 장면과 장기 프로젝트에서의 일관성 검증이 다음 평가 기준이 되고 있다.
만들기는 쉬워졌지만 완성과 검증은 여전히 어려움
국내 사용자는 Astra가 작곡 프로그램을 조작하고 멜로디를 수정하는 과정을 보고 30분 만에 결과를 만든 점을 신기해했지만, 크레딧이 빠르게 소진돼 작업을 제한해야 한다고 했다. 영상 제작에서는 여러 시리즈를 동시에 만들다 보니 60% 정도만 완성된 영상이 쌓이고, 과학 프로젝트에서는 많은 토큰을 썼는데도 예측 모델의 정확도가 4%에 그쳤다는 경험이 나왔다.
생성 속도와 조작 능력이 높아져도 사용자는 결과물을 끝까지 완성하고 검증하는 단계에서 다시 막힌다. 긴 작업을 무조건 이어가기보다 중간 평가, 실패 감지, 완성도 기준과 중단 권고를 제공하는 기능이 필요하다.
최상위 모델의 품질이 구매 의사를 자극하지만, 사용량 예측이 어려워 실제 업무에 상시 투입하기는 부담스럽다. 사용자는 모델 품질뿐 아니라 작업별 비용 통제와 잔여 한도 가시성을 핵심 사용성으로 보고 있다.