본문 바로가기

728x90

Codex

(39)
AI의 반복 실수, 지침보다 코드로 막아야 하는 이유 AI의 반복 실수, 지침보다 코드로 막아야 하는 이유AI 뉴스 썸네일같은 요청을 받은 AI가 매번 같은 답을 내놓지는 않아요. 중요한 규칙을 여러 번 알려줘도 어느 순간 어길 수 있어요. Melody Koh는 이런 반복 실수를 줄이려면 규칙 일부를 문서가 아닌 코드로 옮겨야 한다고 설명해요. 1핵심 요약구분핵심실무에서 볼 점반복 오류문서에 적힌 규칙은 AI가 다른 정보와 함께 판단해요반드시 지켜야 할 조건은 독립된 코드 검사로 막아야 해요보장 범위통과와 실패를 코드로 가를 수 있는 조건만 확실히 고정할 수 있어요명령 차단, 파일 형식, 테스트 결과처럼 판정 기준이 분명한 작업부터 적용해요판단 영역분석의 미묘한 오류는 고정 규칙만으로 잡기 어려워요코드 검사와 사람의 검토가 맡을 범위를 나눠야 해요제품 경쟁..
Codex 서브에이전트 암호화, 왜 실행 기록을 읽기 어려워졌나 Codex 서브에이전트 암호화, 왜 실행 기록을 읽기 어려워졌나AI 뉴스 썸네일Codex CLI의 다중 에이전트 기능에서 위임 메시지를 암호화한 뒤, 사용자가 로컬 실행 기록을 읽기 어려워졌다는 버그가 보고됐어요. 암호화 자체보다 전달용 암호문과 사람이 확인할 감사 기록을 분리하지 않은 구조가 문제로 지목돼요. 1핵심 요약구분확인된 내용개발자가 볼 지점변경 범위MultiAgentV2의 `spawn_agent`, `send_message`, `followup_task`가 암호화된 메시지를 다뤄요다중 에이전트 기능을 쓸 때 위임 내용이 기록에 남는지 확인해야 해요현재 문제평문 `content`는 비고 `encrypted_content`만 저장되는 경로가 있어요부모 실행 이력과 통신 로그에서 작업 지시를 읽기..
코딩 에이전트 기록을 한곳에서 찾는 AgentsView, 비용과 변경 파일까지 보여줘요 코딩 에이전트 기록을 한곳에서 찾는 AgentsView, 비용과 변경 파일까지 보여줘요AI 뉴스 썸네일Claude Code에서 시작한 작업을 Codex로 이어가고 Cursor도 함께 쓰면 대화 기록과 비용이 여러 폴더에 흩어져요. AgentsView는 각 도구의 로컬 세션을 한곳에 색인해 검색하고, 어떤 모델에 토큰을 얼마나 썼는지 보여주는 오픈소스 도구예요. 1핵심 요약구분핵심왜 볼 만한가요통합 검색여러 코딩 에이전트의 로컬 세션을 SQLite에 모아 검색해요도구를 바꿔도 과거 대화와 작업 맥락을 다시 찾기 쉬워요사용량 분석에이전트·날짜·모델별 토큰과 예상 비용을 집계해요팀과 개인이 AI 코딩 비용이 늘어난 원인을 확인할 수 있어요변경 추적최근 수정 파일을 프로젝트별로 모으고 관련 대화까지 연결해요코드..
LLM 번아웃, AI가 빨라질수록 검토하는 사람이 지쳐요 LLM 번아웃, AI가 빨라질수록 검토하는 사람이 지쳐요AI 뉴스 썸네일AI 코딩 도구를 쓰면 더 많은 일을 더 빨리 할 수 있다는 말은 익숙해졌어요. 그런데 최근 개발자 사이에서는 반대쪽 피로도 같이 나오고 있어요. AI가 만든 코드를 읽고, 틀린 가정을 걷어내고, 같은 문체를 계속 상대하는 일이 새로운 업무 부담이 되고 있어요.핵심 요약구분핵심왜 볼 만한가요개발 흐름직접 구현하던 시간이 AI 출력 검토와 수정으로 많이 옮겨가요생산성 도구가 실제로는 검토 업무를 늘릴 수 있다는 점을 보여줘요피로 원인환각, 허위 가정, 짧고 단정적인 문장, 이모지 같은 패턴이 반복돼요한 번의 오류보다 같은 종류의 오류를 계속 보는 일이 더 지치게 해요업무 문화AI가 만든 결과물이 많아질수록 사람이 최종 병목이 돼요팀의 ..
ChatGPT Work 공개, AI가 채팅창 밖 업무 흐름까지 들어와요 ChatGPT Work 공개, AI가 채팅창 밖 업무 흐름까지 들어와요AI 뉴스 썸네일OpenAI가 ChatGPT Work를 공개했어요. 이번 발표의 핵심은 더 똑똑한 답변보다, ChatGPT가 파일과 앱, 브라우저를 오가며 실제 업무 결과물을 만드는 방향으로 이동했다는 점이에요.핵심 요약구분핵심왜 볼 만한가요업무 에이전트ChatGPT가 문서, 시트, 슬라이드, 웹 앱 같은 결과물을 만들 수 있어요대화형 AI가 업무 실행 도구로 넘어가는 흐름을 보여줘요앱 연결Google Drive, Microsoft 365, 이메일, 캘린더, CRM 같은 도구를 연결해요회사 안에 흩어진 업무 맥락을 한 대화 안으로 끌어오는 방식이에요데스크톱 앱새 ChatGPT 데스크톱 앱에 Codex와 Work가 합쳐져요개발자용 코딩 ..
GPT-5.6 정식 공개, 성능보다 비용 구조가 더 크게 바뀌었어요 GPT-5.6 정식 공개, 성능보다 비용 구조가 더 크게 바뀌었어요AI 뉴스 썸네일OpenAI가 GPT-5.6 패밀리를 정식 공개했어요. 이름만 보면 또 하나의 고성능 모델처럼 보이지만, 이번 발표에서 더 눈에 띄는 건 성능을 올리면서도 토큰 사용량과 작업당 비용을 줄이려는 방향이에요.핵심 요약구분핵심왜 볼 만한가요모델 구성Sol, Terra, Luna 3개 티어로 나뉘어요최고 성능 모델 하나가 아니라 작업 난도와 비용에 맞춰 고르는 구조예요코딩Sol은 Artificial Analysis Coding Agent Index 80점을 기록했다고 공개됐어요에이전트 코딩 도구가 성능 경쟁에서 비용 경쟁으로 넘어가는 흐름이 보여요비용API 가격은 Sol 기준 입력 100만 토큰당 5달러, 출력 100만 토큰당 3..
AI 개발 도구의 모델 선택을 자동화하는 Weave Router AI 개발 도구의 모델 선택을 자동화하는 Weave RouterAI 뉴스 썸네일AI 코딩 도구를 여러 개 쓰다 보면 모델 선택이 곧 비용 관리가 돼요. Weave Router는 Claude Code, Codex, opencode, Cursor 같은 개발 환경 앞단에 서서 요청마다 알맞은 모델을 고르는 라우터예요. Anthropic, OpenAI, Gemini를 한 엔드포인트로 묶고, 필요하면 OpenRouter를 통해 DeepSeek, Qwen, Llama 계열 모델까지 연결해요. 1핵심 요약구분핵심왜 볼 만한가요모델 라우팅여러 공급자의 모델을 한 주소 뒤에 묶어요도구별 설정을 크게 바꾸지 않고 모델 선택 방식을 바꿀 수 있어요비용 관리요청마다 모델을 고르는 구조로 40~70% 비용 절감을 내세워요고성능..
GLM 5.2가 AI 추론 가격을 흔들 수 있을까요 GLM 5.2가 AI 추론 가격을 흔들 수 있을까요AI 뉴스 썸네일AI 모델 경쟁이 학습비에서 추론비로 옮겨가고 있어요. GLM 5.2는 오픈 가중치 모델이 프런티어 모델의 에이전트 작업 영역까지 들어올 때 가격표가 어떻게 흔들릴 수 있는지 보여주는 사례예요.핵심 요약구분핵심왜 볼 만한가요모델 경쟁GLM 5.2는 Opus·GPT 계열 모델에 가까운 코딩 에이전트 경험을 낮은 API 가격으로 내세워요모델 품질 격차가 줄면 기업과 개발자는 비싼 기본 모델만 고집할 이유가 줄어요비용 구조논점은 학습비보다 사용량에 따라 계속 늘어나는 추론비예요API 매출총이익이 높을수록 싼 대체 모델이 들어올 공간도 커져요약점비전 미지원, 느린 체감 속도, 웹 검색 품질은 아직 걸림돌이에요에이전트 작업은 텍스트 답변만 잘해서 ..
GPT-5.6 Sol Ultra가 Codex에 들어오면 달라지는 것 GPT-5.6 Sol Ultra가 Codex에 들어오면 달라지는 것AI 뉴스 썸네일AI 코딩 도구 경쟁이 다시 구독 상품과 사용량 한도로 옮겨가고 있어요. Codex 담당자로 알려진 Tibo가 X 답글에서 “Ultra will be in codex”라고 말하면서, GPT-5.6 Sol Ultra가 Codex에 들어올 가능성이 커졌어요. 아직 제품 공지처럼 정리된 발표는 아니지만, 개발자들이 어떤 도구에 돈을 낼지 판단하는 기준에는 바로 영향을 줄 수 있어요. 1핵심 요약구분핵심왜 볼 만한가요모델 접근성GPT-5.6 Sol Ultra가 Codex에 들어올 것이라는 언급이 나왔어요고성능 모델이 별도 고가 상품에만 묶일지, 개발 도구 구독 안으로 들어올지 보는 단서예요사용량 경쟁Codex의 높은 사용량 한도와..

728x90