가시성 팀을 위한 현대적인 알림 시스템 설계
경보 시스템은 소음을 위한 것이 아니라 대응을 위한 것입니다.
경보(Alerting)는 너무 자주 단순한 모니터링 기능으로 설명됩니다. 그런 설명은 편리하지만, 실제 문제를 가려버립니다.
경보 시스템은 소음을 위한 것이 아니라 대응을 위한 것입니다.
경보(Alerting)는 너무 자주 단순한 모니터링 기능으로 설명됩니다. 그런 설명은 편리하지만, 실제 문제를 가려버립니다.
시스템용 제어 평면으로서의 채팅 플랫폼
채팅 플랫폼은 단순한 메시징 도구를 넘어 크게 진화했습니다. 현대 시스템에서는 자동화된 프로세스와 인간의 의사 결정 사이를 잇는 인터페이스로 작동합니다.
디스코드를 안전하고 상호작용 가능한 알림 버스(Alert Bus)로 만드세요.
Discord 는 이를 하나의 시스템으로 대할 때 진정한 통합 표면이 됩니다: 시스템이 이벤트를 게시하고, 인간이 결정을 내리며, 자동화가 워크플로우를 이어가는 곳입니다.
Slack 는 워크플로우 UI 와 알림 전송 레이어입니다.
Slack 통합은 하나의 HTTP 호출로 메시지를 게시할 수 있기 때문에 속임수처럼 보일 정도로 간단해 보입니다. 하지만 Slack 을 상호작용적이고 신뢰할 수 있는 시스템으로 만들려고 할 때 흥미로운 부분이 시작됩니다.
통합, 코드 구조, 데이터 접근을 위한 패턴.
모든 앱 아키텍처 조언은 적용하기 너무 추상적이거나 확장하기에는 너무 제한적인 경우가 많습니다. 이 페이지에서는 통합, 코드 구조, 데이터 액세스에 걸쳐 프로덕션 시스템에 적용할 수 있는 실용적인 트레이드오프를 다룹니다.
클로드 구독은 더 이상 에이전트를 구동하지 않습니다
에이전트 실험의 물결을 이끈 조용한 루트가 이제 막혔습니다.
로컬 LLM을 활용한 자체 호스팅 AI 검색
Vane은 “인용과 함께 하는 AI 검색” 분야에서 가장 실용적인 선택지 중 하나입니다. 이는 라이브 웹 검색과 로컬 또는 클라우드 LLM을 결합하는 자체 호스팅형 답변 엔진으로, 전체 스택을 사용자의 통제 아래에 두는 것이 특징입니다.
로컬 모델 백엔드를 갖춘 에이전틱 코딩
Claude Code는 마케팅만 뛰어난 자동 완성 도구가 아닙니다. 이것은 에이전트 기반 코딩 도구입니다. 코드베이스를 읽고, 파일을 편집하며, 명령을 실행하고, 개발 도구와 통합됩니다.
개발자를 위한 Hermes Agent 설치 및 빠른 시작
Hermes Agent는 로컬 머신 또는 저비용 VPS에서 실행되는 셀프 호스팅, 모델 비의존형 AI 어시스턴트로, 터미널 및 메시징 인터페이스를 통해 작동하며 반복적인 작업을 재사용 가능한 스킬로 전환함으로써 시간이 지남에 따라 성능이 향상됩니다.
TGI 를 설치하고 빠르게 배포하며 더 빠르게 디버깅하세요.
Text Generation Inference(TGI) 는 매우 특유의 에너지를 지니고 있습니다. 추론 분야에서 가장 새로운 기술은 아니지만, 이미 프로덕션 환경에서 발생하는 문제를 잘 이해하고 있습니다.
16GB VRAM에서 llama.cpp의 토큰 처리 속도(테이블)
여기서는 16GB VRAM을 갖춘 GPU에서 구동되는 여러 LLM의 속도를 비교하고, 자가 호스팅에 가장 적합한 모델을 선택하는 과정을 다루고 있습니다.
호주에서는 RTX 5090 가 품귀 현상을 보이고 가격이 비쌉니다.
호주에 RTX 5090 재고가 있습니다. 마침내. 하지만 하나를 찾아도 현실과 동떨어진 프리미엄 가격을 지불해야 합니다.
공용 포트를 사용하지 않는 원격 Ollama 접근
Ollama 는 로컬 데몬 (daemon) 으로 취급될 때 가장 행복해합니다: CLI 와 애플리케이션이 루프백 HTTP API 와 통신하며, 나머지 네트워크는 Ollama 의 존재를 전혀 알지 못합니다.
추적 정보와 연결된 쿼리 가능한 JSON 로그
로그는 시스템이 파국적인 상황에 처해 있을 때에도 여전히 사용할 수 있는 디버깅 인터페이스입니다. 문제는 평문(plain text) 로그는 시간이 지나면 관리하기 어렵다는 점입니다. 필터링, 집계, 알림이 필요해지자마자 문장을 파싱하기 시작하게 됩니다.
GPU 및 영구 저장 기능을 갖춘 Compose 우선 Ollama 서버
Ollama는 베어 메탈(bare metal) 환경에서도 훌륭하게 작동합니다. 서비스처럼 다룰 때 더 재미가 생깁니다: 안정적인 엔드포인트, 고정된 버전, 영속적 저장소, 그리고 사용 가능하거나 불가능한 GPU.
스트리밍 응답을 깨뜨리지 않고 HTTPS를 사용한 Ollama
리버스 프록시 뒤에 Ollama 를 실행하는 것은 HTTPS, 선택적 접근 제어, 예측 가능한 스트리밍 동작을 얻는 가장 간단한 방법입니다.
시스템, 인프라, AI 엔지니어링에 관한 새 글을 받아보세요.