본문 바로가기

728x90

sre

(6)
47일 TLS 인증서 시대, 갱신보다 배포 자동화가 먼저예요 47일 TLS 인증서 시대, 갱신보다 배포 자동화가 먼저예요IT & AI 뉴스 썸네일웹 서버 인증서를 1년에 한 번 갈아 끼우던 운영 방식은 곧 버티기 어려워져요. 인증서 최대 유효기간이 단계적으로 짧아지면 발급뿐 아니라 배포, 서비스 재적용, 만료 감시까지 자동화해야 해요. Todd Gardner의 NDC Toronto 2026 발표는 SSL에서 TLS 1.3과 단기 인증서로 이어진 변화를 운영자의 시선으로 설명해요. 1핵심 요약구분달라진 점운영팀이 확인할 것인증서 수명최대 유효기간이 2026년 200일, 2027년 100일, 2029년 47일로 줄어드는 일정이 소개됐어요수동 갱신 작업량과 담당자를 계산해요키 교환TLS 1.3은 완전 순방향 비밀성을 기본 전제로 삼아요오래된 TLS 버전과 RSA 키 교..
Tailscale이 19번의 DB 손상 끝에 찾아낸 SQLite의 16년 된 버그 Tailscale이 19번의 DB 손상 끝에 찾아낸 SQLite의 16년 된 버그IT & AI 뉴스 썸네일Tailscale은 6개월 동안 SQLite 데이터베이스 손상을 19번 겪었어요. 재현 조건조차 잡히지 않던 문제를 운영 환경의 트랜잭션 로그와 VFS 추적으로 좁혔고, 끝내 SQLite의 16년 된 WAL-Reset 버그를 찾아냈어요. 1잘 알려진 데이터베이스를 단일 작성자 구조로 썼는데도 장애가 반복됐다는 점이 눈에 띄어요. 원인은 SQLite 자체의 희귀한 경쟁 조건과 Tailscale의 공격적인 수동 체크포인트 운용이 맞물린 데 있었어요. 2핵심 요약구분내용발생 규모6개월 동안 서로 다른 데이터베이스 손상 사고가 19번 발생했어요.직접 원인체크포인트와 쓰기 트랜잭션이 겹칠 때 WAL 페이지가 ..
Slack은 왜 EC2를 고치지 않고 통째로 바꾸기 시작했을까요 Slack은 왜 EC2를 고치지 않고 통째로 바꾸기 시작했을까요Slack Shipyard EC2 플랫폼 썸네일수만 대의 EC2를 오래 켜 둔 채 설정을 계속 덧대면 서버마다 상태가 달라져요. Slack은 이 문제를 줄이려고 실행 중인 서버를 고치는 방식에서 새 AMI로 서버를 교체하는 방식으로 옮겼어요. Shipyard는 컨테이너로 옮기기 어려운 워크로드에도 불변 인프라와 단계적 배포를 적용한 플랫폼이에요. 1 2핵심 요약구분Slack이 택한 방식운영에서 얻는 효과서버 상태실행 중인 EC2를 반복 수정하지 않고 새 AMI로 교체해요서버마다 설정이 달라지는 구성 드리프트를 줄여요이미지 구조공통 기반 이미지 `slack-zero` 위에 서비스별 이미지를 쌓아요보안·관측·네트워크 기준을 공통으로 유지해요배포G..
AI 제품의 경쟁력은 사용 데이터에서 갈려요 AI 제품의 경쟁력은 사용 데이터에서 갈려요AI 뉴스 썸네일좋은 AI 모델을 연결하는 것만으로는 제품의 경쟁력을 오래 지키기 어려워요. Frontier AI의 Vikram Sreekanti와 Joseph E. Gonzalez는 문제의 복잡성과 도입 난이도를 함께 보고, 사용 과정에서 쌓이는 데이터가 어떤 차이를 만드는지 분석했어요. 같은 모델을 써도 피드백의 빈도와 고객 업무에 대한 이해가 다르면 제품 개선 속도와 교체 비용이 달라져요. 1핵심 요약구분데이터가 쌓이는 방식사업에서 확인할 점도입과 해결이 모두 쉬운 제품많은 사용자가 빠르게 유입돼 대규모 사용 기록이 생겨요모델 제공업체도 같은 데이터를 더 큰 규모로 모을 수 있어요도입은 쉽고 해결은 어려운 제품수락·거절처럼 잦고 세밀한 피드백이 제품 개선에..
PostgreSQL을 일부러 망가뜨려 보는 도구, noisia PostgreSQL을 일부러 망가뜨려 보는 도구, noisiaIT & AI 뉴스 썸네일운영 중에는 만나고 싶지 않은 PostgreSQL 장애를 테스트 환경에서 미리 일으켜 볼 수 있어요. noisia는 연결 고갈, 잠금 대기, 교착 상태, 메모리 부족, WAL 증가, 디스크 부족을 재현하는 오픈소스 도구예요. 장애가 난 뒤 알람과 복구 절차가 제대로 움직이는지 확인할 때 쓸 수 있지만, 일부 워크로드는 데이터베이스 전체를 재시작시킬 만큼 위험해요. 1핵심 요약구분핵심왜 볼 만한가요목적PostgreSQL에 의도적으로 유해한 워크로드를 만들어요장애 대응 절차를 실제 증상에 가깝게 점검할 수 있어요범위연결, 잠금, 메모리, WAL, 스토리지 문제를 다뤄요단순 쿼리 부하보다 다양한 실패 경로를 확인할 수 있어요..
텔레그램 t.me 링크가 멈춘 이유, 서버가 아닌 도메인 정지였어요 텔레그램 t.me 링크가 멈춘 이유, 서버가 아닌 도메인 정지였어요AI 뉴스 썸네일텔레그램 단축 링크에 쓰이는 `t.me`가 DNS에서 조회되지 않으면서 채널과 사용자 링크가 열리지 않고 있어요. 텔레그램 앱 전체가 멈춘 장애와는 다르고, 도메인 등록 상태에 `serverHold`가 걸린 일이 원인이에요. 1핵심 요약구분확인된 내용운영자가 볼 부분장애 지점`t.me` 도메인이 DNS에서 해석되지 않아요웹 서버보다 도메인 상태를 먼저 확인해야 해요등록 상태WHOIS와 RDAP에 `serverHold`가 표시돼요레지스트리 수준의 제한은 DNS 위임을 멈출 수 있어요만료 여부만료 예정일은 2035년 5월 20일이에요단순한 갱신 누락으로 보기 어려워요영향 범위`https://t.me/...` 링크가 열리지 않아..

728x90