2026년 9월 24일 AI 뉴스 — 클로드 오퍼스 5.5, GPT-6 솔·루나, 프롬프트 캐싱
앤트로픽 클로드 오퍼스 5.5 출시, 오픈AI GPT-6 솔·루나 공개와 프롬프트 캐싱 개선, 클로드 코드 AGENTS.md 버그, 스트라이프 사내 AI 플랫폼, 오픈클로 보안 감사, 스트랜즈 하네스 SDK, 케브 결정 모델까지 오늘의 AI 뉴스 8건.
오늘은 프론티어 모델 두 개가 같은 주에 나왔습니다. 앤트로픽의 클로드 오퍼스 5.5와 오픈AI의 GPT-6 솔·루나입니다. 여기에 GPT-6 프롬프트 캐싱 개선, 클로드 코드의 AGENTS.md 버그, 스트라이프 사내 AI 플랫폼, 오픈클로 보안 감사, 에이전트 하네스 SDK, 오픈소스 결정 모델까지 정리했습니다.
오퍼스 5.5 출시, 40% 저렴
앤트로픽이 클로드 5.5 패밀리의 첫 모델인 클로드 오퍼스 5.5를 공개했습니다. 대부분의 작업에서 클로드 페이블 5.1 수준의 성능을 낸다고 밝혔고, 자체 행동 감사(behavioral audit)에서는 역대 모델 중 최고 점수를 기록했습니다. 에이전틱 코딩 벤치마크인 Terminal-Bench 4.0에서 66.4%로 오퍼스 5의 52.3%를 크게 앞섰고, FrontierCode v1.1은 54.4%, CursorBench 4.0은 57.8%, OSWorld 2.0 컴퓨터 사용은 81.8%를 기록했습니다.
가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 오퍼스 5보다 20% 내렸고, 캐시 읽기는 0.50달러에서 0.20달러로 60% 낮아졌습니다. 일반적인 워크로드 기준으로 총 비용은 40% 줄고 출력 속도는 30% 이상 빨라졌다는 설명입니다. 입력 8달러, 출력 40달러에 최대 2.5배 속도를 내는 패스트 모드도 함께 나왔습니다.
안전 측면에서는 되돌리기 어려운 행동을 덜 하고 프롬프트 인젝션에 더 강해졌다고 밝혔습니다. 8월 31일 이후 생성된 API 계정에는 증류 방지용 "preserved thinking"이 기본 적용되고, EU AI 법 대응 워터마킹도 들어갔습니다. 모델 ID는 claude-opus-5-5이며 AWS, 구글 클라우드, 애저에서 바로 쓸 수 있습니다.
원문: https://www.anthropic.com/claude-opus-5-5
오픈AI, GPT-6 솔·루나 출시
오픈AI가 9월 22일 GPT-6 솔(Sol)과 루나(Luna)를 공개했습니다. 이달 초 나온 GPT-6 아스트라의 학습 방법을 적용해 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬 전반을 끌어올린 중저가 라인업입니다. 솔은 일상 업무용으로 추론 능력이 더 강하고, 루나는 빠른 응답과 대량 처리에 맞춘 더 저렴한 모델입니다.
가격은 솔이 입력 100만 토큰당 2달러, 출력 10달러이고, 루나는 입력 0.10달러, 출력 0.50달러입니다. 오픈AI는 GPT-6 솔이 GPT-5.6 솔보다 실수를 절반 정도로 줄였다고 밝혔습니다. 언론에서는 API 비용이 50% 이상 내려갔다는 점을 주로 다뤘습니다.
두 모델은 ChatGPT Work와 코덱스, API에서 바로 쓸 수 있고, 루나는 데스크톱 앱과 무료·Go 사용자에게도 열립니다. 깃허브 코파일럿에도 같은 날 추가됐습니다. 오퍼스 5.5와 같은 주에 나오면서 가격 대비 성능 경쟁이 한 단계 더 내려온 셈입니다.
원문: https://openai.com/index/introducing-gpt-6-sol-and-luna
GPT-6 프롬프트 캐싱 개선
오픈AI가 GPT-6의 프롬프트 캐싱을 손봤습니다. 기본 캐시 적중률이 높아졌고, 동일한 접두사를 30분 안에 다시 쓰면 캐시 할인이 적용됩니다. 여기에 캐시가 왜 빗나갔는지 진단할 수 있는 도구와, 프롬프트의 어느 부분까지 캐시할지 직접 지정하는 명시적 브레이크포인트(explicit breakpoint)가 추가됐습니다.
브레이크포인트는 잘 안 바뀌는 시스템 프롬프트나 도구 정의는 캐시에 고정하고, 매번 바뀌는 내용은 프롬프트 끝에 두는 식으로 설계하는 데 쓰입니다. 오픈AI가 공개한 사례에서는 캐시 적중률이 83%에서 91%로 올랐고, 캐시 쓰기는 3분의 2가 줄었으며 추론 비용은 36% 내려갔습니다. 에이전트 스타트업 마누스(Manus)는 85%에서 90% 이상으로 올랐다고 밝혔습니다.
비용 구조는 캐시 쓰기가 일반 입력 토큰의 1.25배, 캐시 읽기는 0.1배입니다. 긴 컨텍스트를 반복해서 쓰는 에이전트라면 브레이크포인트 위치만 잘 잡아도 비용이 눈에 띄게 달라질 수 있습니다.
원문: https://openai.com/index/better-prompt-caching-for-gpt-6
클로드 코드 AGENTS.md 버그
클로드 코드 2.1.277에 AGENTS.md 지원이 들어갔는데, 텔레메트리를 끄면 이 파일을 조용히 건너뛴다는 분석이 올라왔습니다. 글쓴이는 AGENTS.md에 "PERIWINKLE" 같은 카나리 단어를 넣고 모델이 이를 인식하는지로 실험했고, DISABLE_TELEMETRY=1이나 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1을 설정하면 기능이 아예 꺼지는 것을 확인했습니다.
원인은 agents-md 플러그인이 기본 비활성 상태이고, 원격 기능 플래그(tengu_agents_md_mod)로 켜지는 구조라는 점입니다. 텔레메트리를 끄면 플래그를 받아올 수 없어 기능이 안 켜지는데, 그 어떤 경고도 출력되지 않습니다. 프라이버시 설정이 무관한 로컬 기능을 몰래 꺼버린다는 게 글쓴이의 핵심 비판입니다.
우회법은 간단합니다. CLAUDE.md 파일에 @AGENTS.md 한 줄을 넣어 임포트하면 기능 플래그와 무관하게 지침이 읽힙니다. 관련 깃허브 이슈는 #95690이며, 글 작성 시점까지 앤트로픽의 공식 답변은 없었습니다.
원문: https://blog.szypowi.cz/p/claude-code-reads-agents.md-only-when-telemetry-is-on/
스트라이프, 사내 AI 플랫폼 공개
스트라이프가 사내 지식 업무용 AI 에이전트 플랫폼 "Kai"를 어떻게 만들었는지 공개했습니다. 리서치, 데이터 분석, 컴플라이언스 검토 같은 비코딩 업무를 겨냥한 플랫폼으로, 올해 4월 출시 후 2주 만에 주간 활성 사용률 83%를 찍었고 영업, 재무, 엔지니어링, 운영 부서의 1,000명 이상이 쓰고 있습니다.
구조는 세 겹입니다. 웹, 슬랙, 크롬 확장 어디서든 같은 에이전트를 부르는 표면 무관 API, 각 도메인 팀이 직접 에이전트와 스킬을 만들고 모니터링하는 에이전트 스튜디오, 그리고 쿠버네티스 기반 하네스와 세션별 샌드박스, 멀티테넌트 가상 파일시스템으로 이뤄진 실행 환경입니다. 랭체인의 deepagents를 써서 한 세션이 932턴까지 이어진 사례도 있습니다. 연결된 스킬과 도구는 1,000개가 넘고, 스킬 선택은 RAG와 LLM을 섞어 처리합니다.
효과도 숫자로 제시했습니다. Kai를 쓰는 영업 담당자는 활동량이 2배 늘고 계약 성사가 39% 많았으며, 연간 25,000시간이 관리 업무에서 매출 업무로 옮겨갔다고 합니다. 스트라이프는 전문성을 중앙에 모으지 말고 도메인 팀에 분산할 것, 새 앱을 강요하지 말고 기존 워크플로 안에서 만날 것, 접근 제어 너머의 암묵적 가드레일을 둘 것을 교훈으로 꼽았습니다.
원문: https://stripe.dev/blog/meet-stripes-knowledge-ai-platform
오픈클로, 보안 감사 통과
오픈클로가 오픈AI의 패치 더 플래닛(Patch the Planet) 프로그램을 통해 트레일 오브 비츠(Trail of Bits)의 보안 감사를 마쳤습니다. AI 보조 보안 리서치와 사람 검토를 결합한 프로그램으로, 오픈클로 코어의 권한 체계와 데이터 처리 전반을 살폈습니다.
감사에서 반복적으로 드러난 패턴은 네 가지였습니다. 요청이 후속 작업을 낳을 때 권한이 그대로 따라가지 않는 권한 드리프트, 보안 검사와 실제 시스템이 서로 다른 식별자를 참조하는 이름 불일치, 승인 시점과 실제 자원 접근 시점이 달라 그 사이에 바뀔 수 있는 승인-사용 간극, 그리고 시작할 때만 권한을 확인하고 실행 중에는 다시 보지 않아 이미 도는 작업에는 권한 해제가 먹지 않는 문제입니다.
총 27건의 권고 중 치명(Critical)은 0건, 높음 2건, 중간 16건, 낮음 6건이었고 심각도 없는 심층 방어 항목이 3건 더 있었습니다. 조치 가능한 항목은 모두 메인 브랜치에 반영됐고 안정 버전 2026.8.1과 2026.7.33 LTS에 포함됐습니다. 오픈클로를 쓰고 있다면 이 버전 이상으로 올리면 됩니다.
원문: https://openclaw.ai/blog/openclaw-trail-of-bits-engagement-recap
스트랜즈, 하네스 SDK 공개
스트랜즈 에이전트(Strands Agents)가 하네스 SDK를 공개했습니다. 여기서 하네스는 모델, 도구, 메모리, 세션, 컨텍스트 관리를 벤치마크로 검증한 기본값으로 미리 조립해 둔 프로덕션용 에이전트를 뜻합니다. 파이썬 기준으로 create_harness() 한 줄이면 "이 저장소에서 가장 느린 테스트를 찾아 이유를 설명해 줘" 같은 요청을 바로 던질 수 있습니다.
턴 제한, 토큰 예산, 취소, 중단 사유 같은 라이프사이클 제어와 구조화 출력, MCP 지원, 멀티 에이전트 패턴, 스트리밍, 가드레일, 트레이싱, 평가 프레임워크가 들어 있습니다. 파이썬 3.10 이상과 타입스크립트(Node.js 22 이상)를 지원하고, 모델 제공자는 아마존 베드록, 앤트로픽, 오픈AI, 제미나이, 올라마를 포함합니다. 호스팅된 컨트롤 플레인 없이 로컬에서 돌아가며 특정 클라우드에 묶이지 않습니다.
기존 스트랜즈 에이전트 SDK가 루프, 도구, 모델 제공자, 메모리, 훅을 하나하나 제어하는 저수준 도구라면, 하네스 SDK는 그 위에 완성형 기본값을 얹은 배터리 포함 버전입니다. 아파치 2.0 라이선스입니다.
원문: https://github.com/strands-agents/harness-sdk
케브, 오픈소스 Jev식 결정 모델
케브(Kev)는 Qwen3.5 위에 만든 작은 결정 모델 패밀리입니다. 챗봇처럼 문장을 생성하는 게 아니라 고객 지원 티켓 라우팅 같은 업무 질문에 예/아니오, 선택, 점수로만 답하는 구조입니다. 0.8B, 4B, 9B 세 가지 크기가 있고, 랭크 16 LoRA 어댑터와 답변 선택지에 점수를 매기는 포인터 헤드를 얹었습니다. 여러 질문이 같은 입력 텍스트를 공유하면서도 서로의 답을 보지 못하게 병렬로 처리할 수 있습니다.
성능은 Kev-9B가 분포 밖 테스트에서 정확도 0.852, 브라이어 점수 0.237을 기록했습니다. 개발 세트에서는 상용 Jev보다 약 3.5포인트 낮은 0.822(Jev 0.857)이지만 보정(calibration)이 좋다는 점을 강조합니다. 4B가 실용적인 균형점이라는 설명도 있습니다.
Jev의 출력을 학습에 쓴 게 아니라 공개 문서를 바탕으로 아키텍처를 재구현했다는 점이 특징이고, 아파치 2.0 라이선스라 자체 데이터로 파인튜닝해 로컬에서 돌릴 수 있습니다. 파이썬 3.12 이상과 uv만 있으면 클론 후 몇 분 안에 서빙까지 됩니다.
원문: https://github.com/jaredpalmer/kev/tree/main
마치며
오퍼스 5.5와 GPT-6 솔·루나가 같은 주에 나오면서 가격 대비 성능 경쟁이 한 단계 더 내려왔고, 프롬프트 캐싱 같은 인프라 개선까지 겹치면서 에이전트 운영 비용을 다시 계산해 볼 시점입니다. 나무숲은 매일 아침 AI 뉴스를 골라 카카오톡 오픈채팅 "매일 AI News"와 Discord로 보내드립니다. 어제 놓친 소식은 블로그에서 확인하세요.