블로그로 돌아가기
Tech Insight2026년 9월 21일197

2026년 9월 21일 AI 뉴스 — Step 5 프리뷰 600B, 큐원 이미지 2.1, 앤트로픽 외부 평가

스텝펀 Step 5 프리뷰 600B를 100만 토큰당 1달러에, 큐원 이미지 2.1 생성·편집 통합, 스테이지핸드 v4, 라야 33ms 결정엔진, 앤트로픽 생명과학 인증제와 액센츄어 상주 평가까지.

오늘은 새 모델 공개 두 건과 에이전트 도구 쪽 소식이 함께 나왔습니다. 스텝펀이 600B 규모의 플래그십 Step 5 프리뷰를 백만 토큰당 1달러라는 가격표와 함께 내놓았고, 큐원은 이미지 생성과 편집을 7B 한 모델로 묶었습니다. 도구 쪽에서는 브라우저 자동화, 생성형 UI, 경량 결정 엔진이 나란히 업데이트됐고, 앤트로픽은 규제 산업과 외부 감사를 겨냥한 프로그램 두 개를 발표했습니다.

스텝펀, 플래그십 Step 5 공개

중국 AI 스타트업 스텝펀(StepFun)이 9월 20일 차세대 플래그십 모델 Step 5 프리뷰를 공개했습니다. 전체 6000억 파라미터에 토큰당 270억 개만 활성화되는 희소 MoE 구조로, 컨텍스트는 100만 토큰이고 이미지 입력을 네이티브로 받습니다. 회사는 에이전트 작업을 겨냥한 모델이라고 소개하면서 소프트웨어 엔지니어링과 전문 지식 업무, 특히 금융 쪽 성능을 강조했습니다.

이번 발표의 핵심은 가격입니다. API 가격은 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.7달러로 책정됐습니다. Artificial Analysis 인텔리전스 인덱스에서 44점을 받았고, 벤치마크 스위트 기준 과제 하나를 끝내는 데 든 실측 비용은 0.71달러였습니다. 파레토 프런티어를 밀어올렸다는 회사의 주장은 절대 성능이 아니라 이 비용 대비 성능 축을 가리킵니다.

오픈 웨이트는 10월 15일 공개 예정입니다. 프런티어급 성능을 이 가격대에서 쓸 수 있게 되면 비용 때문에 에이전트 파이프라인을 줄여놓았던 팀들이 계산을 다시 해볼 만합니다.

https://www.stepfun.com/step-5-preview

큐원 이미지 2.1, 더 가볍게

알리바바 큐원 팀이 이미지 모델 Qwen-Image-2.1을 오픈 웨이트로 공개했습니다. 생성 파트가 7B에 불과한 경량 구조인데, 텍스트-이미지 생성과 이미지 편집을 하나의 모델에서 처리합니다. 텍스트 인코더로 Qwen3-VL 8B를 쓰고, 16배 공간 압축의 64채널 RGBA 오토인코더를 붙여 투명 배경 이미지를 네이티브로 생성하고 편집할 수 있게 했습니다.

혼합 입도 어텐션과 프리픽스 KV 캐시 재사용으로 연산 비용을 낮췄고, 참조 이미지를 최대 10장까지 받습니다. 인물과 제품 이미지의 동일성을 유지하면서 국소 편집을 거는 것도 지원합니다. 9월 20일 기준으로 vLLM-Omni와 SGLang 양쪽이 네이티브 지원을 붙였습니다.

생성과 편집 모델을 따로 띄워두던 파이프라인이라면 모델 하나로 합치면서 GPU 메모리와 운영 부담을 같이 줄일 수 있습니다. 투명 배경을 직접 뽑을 수 있다는 점은 제품 이미지나 에셋 작업에서 후처리 단계를 통째로 덜어내는 효과가 있습니다.

https://qwen.ai/blog?id=qwen-image-2.1

스테이지핸드 v4, 토큰 80% 절감

브라우저베이스(Browserbase)의 브라우저 자동화 SDK 스테이지핸드가 v4로 올라왔습니다. goto, click, locator, screenshot 같은 플레이라이트 스타일 API를 그대로 쓰면서, 자연어로 지시하는 act(), 화면을 읽는 observe(), 데이터를 뽑는 extract()를 얹은 구조입니다. 타입스크립트, 파이썬, Go를 지원합니다.

v4에서 달라진 부분은 세 가지입니다. 접근성 트리를 하이브리드 방식으로 잘라내 모델에 넘기는 토큰량을 줄였고, 브라우저 확장 아키텍처로 실행 속도를 올렸으며, 사이트가 개편돼 셀렉터가 깨져도 스스로 복구합니다. WebMCP 연동, 클립보드 조작, 배치 커맨드, 중첩 iframe과 섀도 DOM까지 파고드는 deep locator도 새로 들어왔습니다.

브라우저베이스에 올려 쓰면 서버 사이드 캐싱이 붙어 플레이라이트 클라우드 대비 2배 빠르다는 것이 회사 주장입니다. 에이전트에 웹 조작을 맡기면서 토큰 청구서가 부담스러웠다면 확인해볼 지점입니다.

https://github.com/browserbase/stagehand

라야, 오픈소스 33ms 결정엔진

라야(Laya)는 4억 2100만 파라미터짜리 시스템 1 결정 엔진입니다. GPU 한 장에서 32.8밀리초 만에 확률 예측을 내놓고, 분류 선택·서열 점수·참거짓 판정 세 가지 작업만 다룹니다. 100개 이상 언어를 지원하며, 수학적으로 캘리브레이션된 신뢰도 점수를 함께 반환합니다.

비교 대상은 타입세이프의 Jev입니다. 라야 쪽 주장으로는 지연시간 7.8배 빠르고 캘리브레이션은 3배 정확하며, 미터링 API인 Jev와 달리 아파치 2.0으로 직접 돌리면 비용이 0입니다. 생성형 LLM이 구조화된 분류 작업에서 내는 환각을 구조적으로 없앤다는 점을 내세웁니다.

이메일 분류, 라우팅, 모더레이션, LLM 가드레일처럼 대형 모델을 쓰기엔 과한 판정 작업이 주 타깃입니다. 이 구간을 프런티어 모델에 맡기고 있었다면 지연시간과 비용을 동시에 줄일 여지가 큽니다.

https://laya.convaiinnovations.com/

버셀, 생성형 UI 프레임워크 공개

버셀 랩스가 json-render를 공개했습니다. 모델이 자연어 요청을 받아 UI를 만들되, 출력 범위를 개발자가 미리 정의한 컴포넌트와 액션 안으로 제한하는 생성형 UI 프레임워크입니다. JSON 출력이 스키마에 항상 맞도록 강제하는 것이 설계의 축입니다.

컴포넌트 카탈로그 하나를 정의해두면 리액트, 뷰, 스벨트, 리액트 네이티브로 동시에 내보낼 수 있고, shadcn/ui 컴포넌트 36종이 미리 들어 있습니다. 응답을 점진적으로 스트리밍해 화면이 빨리 뜨고, 동적 props와 상태 관리, 조건부 노출도 지원합니다.

LLM 응답을 텍스트가 아니라 화면 요소로 받아야 하는 제품에서는 이 변환 계층을 각자 만들어 쓰는 경우가 많았습니다. 예측 가능성을 포기하지 않으면서 UI를 모델에 맡기는 방법을 프레임워크로 정리한 셈입니다.

https://github.com/vercel-labs/json-render

LLM 19종 스타크래프트 대결

LLM 설정 19종을 스타크래프트: 브루드워에 붙여 겨뤄본 벤치마크 결과가 나왔습니다. 코덱스 아스트라가 승률 100%로 1위를 차지했고, 클로드 계열(페이블, 오퍼스 5, 소넷, 하이쿠)이 뒤를 이었으며, 그록 4.6은 11% 아래에 머물렀습니다.

다만 저자가 덧붙인 결론이 순위보다 중요합니다. 아스트라와 페이블조차 복잡한 병력 구성을 못 했고, 단순한 공격도 막지 못했으며, 일관된 전략을 들고 가지 못했다는 것입니다. 어떤 모델도 초보자 수준을 넘지 못했다는 이야기입니다.

실시간 전략 게임은 긴 호흡의 계획과 즉각적인 반응을 동시에 요구합니다. 벤치마크 점수가 포화되는 영역들과 달리, 이쪽은 아직 바닥이 훤히 보이는 상태입니다. 저자도 앞으로 배울 여지가 많이 남은 벤치마크라고 평가했습니다.

https://bw.swerdlow.dev/report

앤트로픽, 생명과학 인증제 시작

앤트로픽이 라이프 사이언스 검증 프로그램(LSVP)을 발표했습니다. 검증을 통과한 생명과학 조직은 Mythos, Opus, Sonnet을 생물학 관련 작업에 한해 완화된 안전장치로 쓸 수 있습니다. 검증 과정에서는 연구 자격, 보안 수준, 윤리 감독 체계를 함께 살펴봅니다.

통과한 팀은 일상 연구용 표준 사용 권한을 받고, 민감한 특정 프로젝트에 대해서는 고위험 사용 권한을 따로 신청할 수 있습니다. 가장 큰 변화는 요청을 실시간으로 차단하던 방식에서 사용 패턴을 신고된 용도와 대조하는 오프라인 모니터링으로 옮겨간 점입니다. 사이버보안 분류기 같은 다른 보호 장치는 그대로 유지됩니다.

신약 개발이나 임상, 제조 과정에서 기존 안전 필터가 정상적인 연구까지 막던 문제를 조직 단위 검증으로 푸는 접근입니다. 앤트로픽은 이를 책임 분담이라고 표현했습니다. 규제 산업에서 프런티어 모델을 쓰려는 곳이라면 참고할 만한 구조입니다.

https://www.anthropic.com/news/life-sciences-verification-program

앤트로픽, 액센츄어에 평가 맡긴다

앤트로픽이 액센츄어 패컬티(Accenture Faculty)와 임베디드 평가 파트너십을 맺었습니다. 액센츄어 소속 독립 평가자들이 앤트로픽 내부에 상주하면서 직원에 준하는 접근 권한을 받습니다. 모델 개발 과정을 직접 관찰하고, 얼라인먼트 작업을 평가하고, 레드팀 활동과 안전장치 테스트를 수행합니다.

양사는 평가 역량 구축에 5년간 최소 10억 달러를 투입할 계획입니다. 독점 계약은 아니며, 임베디드 평가의 표준과 장기 재원 조달 방식은 아직 만들어가는 단계라고 밝혔습니다.

모델 평가를 만든 회사가 직접 한다는 구조적 한계는 계속 지적돼온 문제입니다. 외부 감사를 문서 심사가 아니라 상주 인력으로 돌리는 방식은 그 한계를 푸는 한 가지 시도로 볼 수 있습니다. 실제로 독립성이 유지되는지는 시간이 지나야 판단할 수 있겠지만, 투입 규모만 놓고 보면 진지한 쪽에 가깝습니다.

https://www.anthropic.com/news/accenture-embedded-evaluation

마치며

오늘 소식을 관통하는 축은 효율입니다. Step 5는 600B 모델을 100만 토큰당 1달러에 열었고, 큐원 이미지 2.1은 생성과 편집을 7B 하나로 묶었습니다. 스테이지핸드와 라야는 아예 토큰과 지연시간을 줄이는 것 자체를 제품의 핵심으로 내세웁니다. 모델을 더 크게 키우는 경쟁 옆에서, 같은 결과를 더 싸게 내는 경쟁이 별도의 트랙으로 자리를 잡아가는 중입니다.

반대편에는 브루드워 벤치마크가 있습니다. 가격이 내려가고 벤치마크 점수가 올라가는 동안에도, 긴 호흡의 계획이 필요한 영역에서는 최상위 모델조차 초보자 수준이라는 결과가 함께 나왔습니다. 두 소식을 나란히 놓고 보는 편이 지금 상황을 더 정확하게 읽는 방법일 것입니다.

나무숲에서는 이런 흐름을 매일 정리해 전하고 있습니다. AI 뉴스를 매일 아침 받아보고 싶다면 구독해두시면 됩니다.

관련 서비스: 기술 의사결정, 같이 짚어드립니다