Fable 5.1은 강력하지만 너무 비싸다
Reddit에서는 Fable 5.1이 지금까지 사용한 모델 중 가장 뛰어나다는 평가와 함께, 대규모 에이전트를 실행하자 5시간 사용량이 1분여 만에 크게 줄었다는 경험이 나왔다. Pro 요금제에서 Fable이 빠진 데 대한 불만도 있었고, 국내 사용자들은 성능과 작업 센스는 좋지만 느리고 사용량을 빠르게 소모한다고 말했다.
코덱스가 요구사항보다 과하게 설계한다
사용자들은 모델 레벨의 ‘가능한 검증하고 근거를 갖고 완료보고하라’는 지침 때문에 간단한 요구에도 검증 환경, 근거, 완료보고를 덧붙이는 과대해석·과다설계가 발생한다고 말했다. 이에 기존 테스트와 명령만 사용하게 하거나, 검증 계획을 먼저 승인받고 새 파일·환경 생성을 제한하는 방법이 논의됐다.
검증 자체를 막기보다 검증 수단과 산출물 범위를 제한해야 상위 지침과 충돌을 줄일 수 있다는 현장형 대응이 제시됐다. 모델의 추론 능력이 높아져도 사용자가 원하는 것은 종종 더 정교한 결과가 아니라 더 좁고 예측 가능한 실행이다.
OpenClaw 업데이트가 운영 환경을 흔든다
OpenClaw 8.2와 2.0 업데이트 과정에서 여러 에이전트의 연결이 끊겼거나 죽어 있으면 마이그레이션이 잘 되지 않는다는 경험이 나왔다. Mac mini에서는 업데이트가 계속 실패했지만 UTM 이미지 복제로 복구 부담을 낮췄고, Windows에서는 비영어권 표시 언어와 서비스 소유권 검증 문제를 겪은 뒤 doctor --fix로 일단 실행시킨 사례가 공유됐다.
에이전트 런타임은 단순 앱 업데이트가 아니라 게이트웨이, 예약 작업, 서비스 소유권, 다중 에이전트 상태가 함께 바뀌는 운영 시스템에 가깝다. 사용자들은 백업·VM 복제와 진단 도구를 사실상 필수 안전장치로 사용하고 있다.
Gemini 3.8은 체감 속도와 가성비가 강점
국내 사용자들은 Gemini 3.8 Flash가 Fable 5.1 low보다 성능이 좋고, 복잡한 추론보다는 검색·유튜브 등 일상적인 Google 생태계 업무에서 가성비가 매력적이라고 평가했다. Sol보다 AI Studio가 5배 빠르게 느껴졌으며, 웹보다 Antigravity CLI 사용이 낫다는 의견도 나왔다.
벤치마크 점수보다 같은 작업을 실제로 얼마나 빨리 끝내는지와 어떤 인터페이스에서 쓰는지가 선택 기준이 되고 있다. 고난도 추론용 모델과 일상 업무용 저비용 모델을 분리해 쓰려는 흐름이 강해지는 모습이다.
멀티에이전트 협업은 통제가 어렵다
사용자들은 오케스트레이터와 자료수집·검수·체결알림 등 하위 봇을 나눠 운영하면서도 특정 봇이 가끔 멈추거나, 멘션 없이 회의를 열면 부르지 않은 모든 크루가 답하는 문제를 겪었다. 세션끼리 티키타카하게 하기보다 사수·부사수 구조로 나누고, 한 곳에서 만든 스킬을 여러 봇에 배포하는 방식이 더 낫다는 경험도 공유됐다.
에이전트 수를 늘리는 것보다 호출 대상, 세션 경계, 역할과 핸드오프를 명확히 정의하는 것이 안정성에 직접 영향을 준다. 사용자는 ‘알아서 협업하는 팀’보다 누가 어떤 조건에서 실행되는지 추적 가능한 구조를 원하고 있다.
Claude와 Fable의 한국어 오타가 누적된다
국내 사용자들은 Claude가 미국식 IT 용어를 직역한 듯한 표현과 특유의 ‘사투리’를 보이며 한국어가 점점 어색해진다고 말했다. Fable 5.1도 한국어 오타가 여전하고, Codex보다 알잘딱깔센하지만 더 느리고 오타가 많다는 비교가 나왔다.
코딩과 추론 성능이 높아져도 결과물을 그대로 게시하거나 문서에 넣는 사용자는 한국어 자연스러움을 별도의 품질 기준으로 본다. 특히 오타를 넘어 어색한 번역투가 반복되면 모델의 전반적 신뢰도와 재검수 비용에 영향을 준다.
AI 사칭과 딥페이크를 구별하기 어렵다
오픈채팅에서는 유명인을 사칭한 Threads 계정과 주식 홍보, 스테이킹 사기 채널이 발견돼 신고가 이어졌다. 실제 영상과 사기 영상의 구분이 쉽지 않고, 딥페이크가 매우 정교해 자막의 AI스러운 표현을 보고서야 알아챘다는 경험이 공유됐다.
생성물의 품질이 높아질수록 이용자가 콘텐츠 자체만 보고 진위를 판단하기 어려워지고 있다. 계정 확인, 공식 채널 대조, 송금 요구 여부 확인 같은 외부 검증 절차가 서비스 신뢰의 핵심 방어선이 되고 있다.
에이전트의 프롬프트 인젝션이 불안하다
한 사용자는 self-hosted LiteLLM과 llamacp를 하네스로 쓰는 중에도 프롬프트 인젝션에 걸릴 뻔했지만 이를 감지했다고 말했다. Hacker News에서는 트리거 물체를 본 뒤 공격하도록 만든 로봇 에이전트의 sleeper agent와 kinetic prompt injection 실험이 소개됐다.
로컬 또는 자체 호스팅 환경이라고 해서 에이전트 공격면이 사라지는 것은 아니다. 도구 호출과 외부 입력을 연결하는 순간 모델의 판단이 실제 행동으로 이어질 수 있어, 탐지뿐 아니라 권한 제한과 실행 전 승인 설계가 필요하다.
최상위 성능에 대한 호평이 강할수록 사용량 제한과 요금제 편입 여부가 실제 선택을 좌우한다. 특히 에이전트가 모델을 반복 호출하는 환경에서는 단일 요청의 가격보다 예측하기 어려운 총사용량이 더 큰 부담이 된다.