본문 바로가기

728x90

sram

(2)
GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간 GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간GPT-5.6 Sol Ultrafast 썸네일GPT-5.6 Sol이 Cerebras 인프라에서 초당 최대 750개 출력 토큰을 내는 Ultrafast Mode로 제공돼요. OpenAI API의 새 서비스 계층으로 일부 고객에게 먼저 열렸어요. 빠른 출력이 실제 작업 시간까지 얼마나 줄이는지는 모델 밖의 도구와 시스템 속도에 따라 달라져요. 1핵심 요약구분확인된 내용실제로 볼 부분제공 방식OpenAI API에서 제한 공개됐어요용량이 늘면 접근 대상도 넓어질 예정이에요출력 속도초당 최대 750개 출력 토큰을 제시했어요최대치와 실제 요청의 지속 속도는 구분해서 봐야 해요HLE 평가2,500문항을 11시간 11분에 처리했어요Cerebr..
8달러 ESP32에 2,890만 매개변수 LLM을 넣은 방법 8달러 ESP32에 2,890만 매개변수 LLM을 넣은 방법AI 뉴스 썸네일512KB SRAM을 가진 ESP32-S3에서 2,890만 매개변수 언어 모델이 돌아갔어요. 모델 전체를 빠른 메모리에 올리는 대신, 토큰마다 필요한 데이터만 플래시에서 읽는 구조로 약 초당 9.5토큰을 만들었어요. 다만 이 모델은 질문에 답하는 챗봇이 아니라 짧은 이야기를 생성하는 실험용 모델이에요. 1핵심 요약구분확인된 내용눈여겨볼 점하드웨어약 8달러인 ESP32-S3 N16R8 한 개를 사용해요서버 없이 기기 안에서 추론해요모델4비트 기준 14.9MB, 저장 매개변수 2,890만 개예요매개변수 수와 추론 능력을 같은 뜻으로 보면 안 돼요메모리512KB SRAM, 8MB PSRAM, 16MB 플래시를 나눠 써요2,500만 매개..

728x90