2026년 9월 26일 AI 뉴스 — 클로드 효소 발견, 챗GPT 프로맥스, 에이전트 메모리
클로드가 CRISPR 유사 반복 서열의 새 효소 시스템을 발견, 오픈AI는 정신건강 벤치마크와 월 500달러 프로맥스 요금제 준비. claude.ai 3배 고속화, 설계 캔버스 Whiteboard, 에이전트 메모리 Hindsight, 오피스 하네스 Univer.
오늘은 클로드가 박테리오파지에서 CRISPR를 닮은 새 효소 시스템을 찾아낸 소식과 오픈AI의 정신건강 벤치마크, 챗GPT 월 500달러 요금제 준비 소식이 눈에 띕니다. 개발 도구 쪽에서는 에이전트와 함께 설계하는 캔버스 앱, 학습하는 에이전트 메모리, 에이전트용 오피스 하네스가 나란히 올라왔습니다.
클로드, 신종 효소 시스템 발견
앤트로픽이 클로드 에이전트들이 박테리오파지에서 이전에 알려지지 않은 효소 시스템을 찾아냈다고 발표했습니다. 팀이 "배열 연관 역전사효소(ART)"라고 이름 붙인 이 시스템은 역전사효소, 인접한 파트너 유전자, 그리고 일정한 간격으로 반복되는 DNA 서열 배열 세 부분으로 이뤄져 있습니다. 반복 배열의 구조가 CRISPR 배열과 닮았고, 초기 실험에서 이 배열이 짧은 RNA 조각을 만들어내는 것이 확인돼 프로그래밍 가능한 기능을 가졌을 가능성이 제기됐습니다.
과정이 흥미롭습니다. 앤트로픽은 올봄 생명과학 연구 그룹을 꾸렸고, 약 950개의 클로드 에이전트가 21시간 동안 2억 1천만 토큰을 쓰며 20만 개가 넘는 역전사효소를 훑었습니다. 그중 한 에이전트가 특이한 역전사효소 유전자 옆의 반복 패턴을 짚어냈고, 문헌 검토와 기존 결과 재현, 가설 작성까지 초기 프롬프트 이후 과학자 개입이 거의 없이 진행됐습니다. CRISPR 개척자인 MIT의 펑 장 교수는 "AI 에이전트가 생물학 발견에 기여할 수 있음을 보여주는 흥미로운 사례"라고 평했습니다.
다만 이 시스템의 실제 기능은 아직 모릅니다. 앤트로픽도 유전자 편집 능력이 확인된 것은 아니라고 선을 그었고, 일부 CRISPR 연구자들은 이런 게놈 마이닝은 이미 흔한 작업이라고 지적합니다. 그럼에도 에이전트가 대규모 데이터에서 스스로 가설을 만들어내는 흐름은 한 단계 앞으로 나간 셈입니다.
원문: https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
오픈AI, 정신건강 벤치마크 공개
오픈AI가 정신건강 대화에서 AI 응답의 품질을 재는 MentalHealthBench를 공개했습니다. 22개국 80여 명의 임상심리학자와 정신과 의사가 참여해 1,215개의 합성 대화와 5,262개의 평가 기준을 만들었습니다. 일상적인 웰빙 상담부터 긴급 위기 상황까지 폭이 넓고, 성인과 13~17세 청소년, 보호자, 임상가 네 가지 사용자 유형을 다룹니다.
측정 항목은 임상적 정확성, 맥락 파악, 사용자 자율성 존중, 실행 가능한 안내, 공감, 긴급성 인식, 피해 회피입니다. 공개된 점수는 GPT-6 아스트라 57.3%, GPT-6 솔 53.9%, 클로드 오퍼스 5.5 52.4%, GPT-6 루나 50.2% 순이고, GPT-4o는 32.1%, 제미나이 2.5 프로는 29.5%에 그쳤습니다. 최신 모델도 60%를 못 넘긴다는 점이 오히려 이 영역의 어려움을 보여줍니다.
벤치마크 자체는 오픈소스로 풀렸습니다. 다른 연구자가 방법론을 검증하고 자체 평가를 돌릴 수 있게 한 것으로, 챗봇을 정신건강 관련 서비스에 붙이려는 팀이라면 먼저 돌려볼 만합니다.
원문: https://openai.com/index/introducing-mentalhealthbench
챗GPT 월 500달러 요금제 온다
테스팅카탈로그가 오픈AI의 미공개 구독 설정에서 월 500달러짜리 "챗GPT 프로 맥스" 요금제를 찾아냈습니다. 기존 프로(월 200달러)와의 차이는 "가장 빠른 Work와 코덱스" 접근으로 설명돼 있고, 사용량 한도 상향도 포함될 가능성이 있지만 확인되지는 않았습니다.
문구로 보면 일반 사용자보다는 장시간 에이전트 작업을 돌리는 개발자와 연구자를 겨냥한 것으로 보입니다. Work는 긴 작업용이고 코덱스는 몇 시간에서 며칠씩 이어지는 코딩 작업을 처리하기 때문에 추론 속도의 가치가 큽니다. 오픈AI가 이미 GPT-5.6 솔 울트라패스트에 세레브라스 인프라를 쓰고 있어, "가장 빠른" 등급도 세레브라스 용량을 얹은 것이라는 추측이 나옵니다.
시점도 눈여겨볼 만합니다. 오픈AI 데브데이가 9월 29일이고, 최근 시스템 부하를 이유로 200달러 프로 신규 구매를 잠시 막은 상태입니다. 코덱스 커뮤니티에서는 한도 축소 불만이 커지던 터라 반응이 엇갈리고 있습니다.
원문: https://www.testingcatalog.com/openai-prepares-new-500-month-pro-max-plan-for-chatgpt/
클로드 웹앱, 2주 만에 3배 빨라져
앤트로픽 엔지니어링 팀이 8월 2주짜리 스프린트로 claude.ai와 데스크톱 앱의 핵심 사용 경험을 약 3배 빠르게 만든 과정을 공개했습니다. 사용자 활동의 95%를 차지하는 네 가지 경로에 집중했고, p75 기준으로 첫 로드 후 입력 가능해지기까지 걸리는 시간이 3.1초에서 0.55초로, 클로드 코드 세션 시작은 0.8초에서 0.3초로, 코워크 클라우드 세션 로딩은 2.6초에서 0.73초로 줄었습니다. 메시지 전송의 클라이언트 처리 시간은 코워크에서 19배 빨라졌습니다.
방식이 흥미롭습니다. 슬랙 채널 하나에서 모든 작업을 굴리되 스레드마다 클로드를 붙여 두고, 측정할 수 있는 것을 계속 찾아 하나씩 힐클라이밍했습니다. 글의 소제목이 "무엇이든 힐클라이밍할 수 있다", "8밀리초 예산", "가드레일", "조향"인데, 사람은 방향을 정하고 클로드가 측정과 수정을 반복하는 구조입니다. "클로드가 측정할 수 있으면 더 빠르게 만들 수 있다"는 원칙이 글 전체를 관통합니다.
매일 수만 사용자 시간을 절약한다는 추산은 차치하더라도, 성능 최적화라는 전통적인 엔지니어링 작업을 에이전트 루프로 돌린 실전 사례라는 점에서 읽어볼 가치가 있습니다.
원문: https://claude.dev/blog/how-we-made-claude-ai-faster/
AI와 함께 설계하는 캔버스 앱
Whiteboard는 사람과 코딩 에이전트가 같은 작업 공간에서 소프트웨어를 설계하는 오픈소스 데스크톱 앱입니다. 클로드 코드, 코덱스 같은 기존 도구에 바로 붙고, 에이전트가 앱 내 캔버스에 다이어그램을 그려 자기 작업을 설명할 수 있도록 SDK를 제공합니다. 8월 중순에 만들어진 프로젝트인데 벌써 1,200개가 넘는 스타를 모았고 긱뉴스에도 올라왔습니다.
퀵스타트는 세 줄입니다. 앱을 내려받고, 환영 화면에서 코딩 에이전트를 연결하고, 현재 브랜치를 최신 메인과 비교해 리뷰하라고 시키면 결과가 시퀀스 다이어그램과 함께 Whiteboard에 열립니다. 팀은 GPT-6 솔과 클로드 오퍼스 5.5 조합이 지능, 비용, 속도 균형에서 가장 잘 맞는다고 안내합니다.
AI가 만든 코드가 늘수록 텍스트 diff만으로는 구조를 따라가기 어려워집니다. 리뷰를 다이어그램 단위로 받아보고 싶은 팀에게 맞는 도구입니다. 맥과 페도라용 빌드가 나와 있습니다.
원문: https://github.com/devdotfast/whiteboard
학습하는 에이전트 메모리, 힌드사이트
Hindsight는 "기억하는 게 아니라 학습하는" 에이전트 메모리 시스템을 표방하는 오픈소스 프로젝트로, 깃허브 트렌딩에서 3만 스타에 가까워졌습니다. 대부분의 에이전트 메모리가 대화 기록 회상에 집중하는 반면, Hindsight는 retain, recall, reflect 세 가지 연산으로 관찰과 멘탈 모델, 지식 페이지를 쌓아 나갑니다.
장기 기억 벤치마크인 LongMemEval에서 최고 성능을 기록했고, 이 결과는 버지니아공대 산가니 센터와 워싱턴포스트 연구진이 독립적으로 재현했다고 합니다. 도커 한 줄로 서버를 띄우고, LLM 래퍼 두 줄로 기존 에이전트에 붙일 수 있으며, MCP 서버와 코딩 에이전트 통합도 제공합니다. 포춘 500 기업에서 이미 프로덕션으로 쓰고 있다는 설명입니다.
장기 실행 에이전트를 만들면서 메모리 계층을 직접 짜고 있다면, RAG나 지식그래프와 비교해 볼 만한 선택지입니다.
원문: https://github.com/vectorize-io/hindsight
에이전트용 오피스 하네스, 유니버
Univer가 스스로를 "AI 에이전트를 위한 오피스 하네스"로 다시 정의했습니다. 스프레드시트, 문서, 프레젠테이션, 베이스, 보드를 하나의 런타임에서 다루는 오픈소스 SDK이고 PDF도 곧 추가됩니다. 2022년부터 이어온 프로젝트인데 1만 8천 스타를 넘기며 다시 트렌딩에 올랐습니다.
플러그인 구조와 캔버스 렌더링, 수식 엔진 위에 브라우저와 Node.js에서 똑같이 동작하는 파사드 API 하나를 얹었습니다. 에이전트 입장에서는 엑셀이나 파워포인트 파일을 흉내 내는 대신, 프로그래밍 가능한 문서 객체를 직접 조작할 수 있다는 뜻입니다.
에이전트가 사람 대신 보고서와 표를 만들고 고치게 하려면 결국 이런 계층이 필요합니다. 임베더블 오피스 UI가 필요한 제품에도 쓸 수 있습니다.
원문: https://github.com/dream-num/univer
API 예산별 최고 LLM 한눈에
Artificial Analysis 인텔리전스 지수에 오른 모든 모델을 혼합 API 가격(입력 3 대 출력 1, 로그 스케일) 대비 성능으로 찍어 놓은 시각화 페이지입니다. "더 싼데 더 똑똑한 모델이 없는" 모델만 골라 가치 프론티어 선으로 잇고, 나머지는 가격과 성능 모두에서 밀리는 모델로 표시합니다. 긱뉴스에서 소개되며 관심을 모았습니다.
프론티어를 예산별 조회표로도 보여줍니다. 100만 토큰당 예산 구간을 찾으면 그 가격에서 가장 점수가 높은 모델과 차순위 모델이 나옵니다. 지능, 코딩, 수학 지수를 골라 볼 수 있고, 매일 데이터를 다시 받아 새로 추가되거나 가격이 바뀐 모델의 차이도 기록합니다.
모델이 워낙 많아진 지금, 예산 구간을 먼저 정하고 그 안에서 최고 성능을 고르는 접근이 실무에서는 더 현실적입니다.
원문: https://bestmodelforyourbudget.terrydjony.com/
마치며
오늘은 AI가 과학 발견과 성능 최적화에서 실질적인 결과를 내는 사례와, 에이전트를 위한 인프라 계층(메모리, 오피스, 설계 캔버스)이 동시에 두꺼워지는 흐름이 보입니다. 나무숲은 이런 도구들을 실제 업무 흐름에 어떻게 녹일지 매일 실험하고 있습니다.
내일도 새로운 소식으로 찾아오겠습니다.