Confident AI 체인지로그

Confident AI 체인지로그 (Product Changelogs)

Confident AI가 매주 배포하는 기능 업데이트를 날짜별로 정리한 문서예요. 매주 금요일에 주간 단위로 발표되며, 출시 주간(Launch Week)을 제외하고는 매주 꾸준히 나와요. 이 체인지로그는 관측성, 평가, 레드팀, 거버넌스, 통합, 품질 개선 등 플랫폼 전체의 변화를 한눈에 볼 수 있게 해줘요.

출처: 문서

본문

배포는 매주 금요일에, 일주일에 한 번씩 진행돼요 — 출시 주간(Launch Week)만 빼고요.

September 18, 2026

  • Observability · Human Feedback · Evals · Integrations · Quality of Life

Search and Rescue — 이번 주에는 트레이스와 스팬에 진짜 검색창이 생겼어요. 필터는 계속 있었지만, 특정 실행을 좁히려면 조건을 하나하나 클릭해서 쿼리를 만들어야 했죠. 이제 기억나는 문구만 타이핑하면 트레이스가 돌아와요. 클릭이 줄고 찾기가 빨라졌어요.

Added

  • Search for Traces & Spans — 필터는 필드별로 질문을 만들게 하지만, 검색은 티켓에서 문구만 가져와요. 건초더미는 줄지 않았지만 바늘은 부르면 답해요.
  • Annotation-Triggered Workflows — 워크플로가 이제 트레이스가 도착할 때뿐 아니라 리뷰어가 어노테이션할 때도 발동해요. 항목에 라벨을 붙이면 지표를 돌려 심사자가 얼마나 정확했는지 볼 수 있어요.
  • Item Status on Annotation Queues — 큐 항목이 이제 완료(completed), 대기(pending), 보류(deferred)로 구분돼요. 애매한 항목은 추측 대신 대기시켜 둘 수 있어요.
  • V2 API with 200+ Endpoints — 200개가 넘는 엔드포인트가 UI가 할 수 있는 거의 모든 것을 다뤄요. 대시보드가 더 이상 유일한 입구가 아니에요.
  • Live Threads with Configurable Idle Time — 스레드가 발생하는 대로 스트리밍되고, 완료로 판정할 유휴 시간 창을 정할 수 있어요. 빠른 챗봇과 느린 에이전트는 "완료"의 기준이 달라질 수 있으니까요.
  • Latency Scatterplot — 지연 시간을 산점도로 보여줘서 평균이 숨겼던 꼬리가 클릭 가능한 점이 돼요. 느린 것들부터 고쳐 나가면 돼요.
  • Export Schedules for Annotations & Test Runs — 어노테이션과 테스트 실행 내보내기가 주기적으로 실행될 수 있어요. "내보내기" 알림 달력을 이제 은퇴시켜도 돼요.
  • AI-Generated Dashboard Widgets — 위젯을 설명하면 AI가 쿼리와 차트까지 만들어 줘요. 설정 패널이 필요 없어요.

이번 주 배포는 여기까지. 다음 주는 Launch Week니까 캘린더에 미리 자리를 비워 두세요.

September 11, 2026

  • Observability · Evals · Integrations · Human Feedback · Self-Hosting

Bye Bye DeepEval, Hello OTel — DeepEval이 사라지나요? 아니요! 하지만 두 줄의 코드로 25개 이상 통합을 트레이싱하고, 첫 스팬부터 OTel 네이티브인 걸 출시했어요 — 바로 Confident Trace예요.

Added

  • Confident Trace — AI 시스템용 오픈소스 OTel 우선 트레이싱 SDK. 두 줄의 코드로 Python과 TypeScript에서 25개 이상의 에이전트 프레임워크, 모델 제공자, LLM 게이트웨이에 걸친 자동 계측을 열어요. 에이전트 실행, 모델 호출, 도구, 검색, 애플리케이션 코드를 다루고, 표준 OTLP로 Confident AI나 자체 OpenTelemetry Collector로 내보내요.
  • Native GenAI & GCP OpenTelemetry Ingestion — 새로운 OTel 서버가 OpenTelemetry GenAI 네임스페이스와 GCP 시맨틱 컨벤션 네임스페이스를 네이티브로 수집해요. 기존 계측에서 표준 기반 텔레메트리를 바로 보낼 수 있어요.
  • Confident Tracing & Confident OTel Skills — 코딩 에이전트가 전용 confident-tracing·confident-otel 스킬로 앱을 계측하고 exporter를 구성하며 텔레메트리를 트러블슈팅할 수 있어요.
  • Code Scanning for GitHub & GitLab Eval Gates — Eval Gate가 평가 워크플로의 일부로 GitHub와 GitLab의 코드 변경을 스캔해요. diff에서 시작한 AI 품질 회귀를 프로덕션에 닿기 전에 잡아요.
  • Flaky Metric Detection — 지표를 flaky로 식별할 수 있게 되어 불안정한 평가 동작이 테스트 실행을 동전 던지기로 만들지 않아요. 실제 회귀와 불안정한 심사자를 분리해요.
  • Multi-Reviewer Custom Form Responses — 어노테이션 큐 커스텀 폼이 같은 항목에 대해 여러 사용자의 응답을 받아요. 리뷰어가 서로 덮어쓰지 않고 독립적인 판단을 모아요.
  • Metric Alignment in Annotate — Annotate 아래 지표 정렬이 일급 워크플로가 돼요. 어노테이션이 일어나는 곳에서 자동 지표 판단과 인간 피드백을 비교할 수 있어요.
  • Error Analysis in Annotate — Annotate 아래 오류 분석이 일급 워크플로가 되고, 모든 이전 실행의 히스토리 뷰가 포함돼요.
  • Bring Your Own SMTP for On-Prem — 엔터프라이즈 자체 호스팅 배포가 플랫폼 이메일용 자체 SMTP 서버를 연결할 수 있어요.

September 4, 2026

  • Evals · Observability · Security · Integrations · Quality of Life

By the Book — 헤드라이너: 거버넌스 폴리시가 이제 이미 작성한 문서에서 스스로 생성돼요. 기존 컴플라이언스 자료(PDF, Word, 텍스트, Markdown)를 업로드하면 Confident가 읽고 컨트롤을 포함한 폴리시 초안을 만들어 줘요. 그 외에도 Eval Gate가 단일 저장소 관계를 벗어났고, 스레드가 자체 토큰·비용을 합산하며, 내보내기가 비동기가 되어 알림이 붙고, 이메일 검증과 더 깔끔한 SSO 계정 연결이 추가됐어요.

Added

  • Governance Policies from Your Documents — 보유한 컴플라이언스 자료(PDF, Word, 텍스트, Markdown)를 업로드하면 Confident가 거버넌스 폴리시 초안을 바로 만들어 줘요.
  • Multi-Repository Eval Gate — Eval Gate가 프로젝트의 모든 저장소를 지켜요. 각 저장소는 자체 고정 데이터셋, 지표 컬렉션, 회귀 허용치를 갖고 자체 실행 이력을 유지해요.
  • Thread Token & Cost Totals — 스레드가 대화 전체의 입력·출력 토큰과 입력·출력 비용을 합산해요. 스팬별로 엑셀을 조립하지 않아도 실제 지출이 스레드 개요에 하나의 숫자로 나와요.
  • Async Exports with Notifications — 모든 내보내기가 백그라운드 잡으로 실행되고 완료(또는 실패) 시 앱에서 알려줘요. 원하는 트레이스·스레드만 골라 내보낼 수도 있어요.
  • Email Verification & SSO Account Linking — 이메일 검증이 추가되었고, 만료 링크가 바로 로그인시켜 줘요. SSO 프로비저닝 사용자는 이미 검증된 상태로 도착해요.
  • Native Streaming for Experiments, Arena & Test-Run Summaries — 실험, 아레나 실행, AI 테스트 실행 요약이 네이티브로 스트리밍돼요. 요약은 토픽 그룹화와 점진적 개요 통찰도 얻었어요.

Changed

  • Provider Validation on Credential Save — 자격 증명 저장과 모델 선택 시 제공자 통합이 검증돼서, 잘못된 키나 잘못 구성된 제공자를 평가 중간이 아니라 즉시 알 수 있어요.

August 28, 2026

  • Evals · Prompts · Red Teaming · Integrations

Reporting for Duty — 리포트가 뇌 이식을 받았어요. 단일 프롬프트가 한 번에 최선을 다하는 대신, 리포트 생성이 이제 도구를 쓰는 완전한 에이전트 루프로 실행돼요. 그 외에 Eval Gate가 위험 평가를 게이팅하고, AI 연결이 전체 프롬프트 데이터 모델을 지원하며, 시뮬레이션 모델에 신뢰성 벤치마크가 생기고, MCP 서버가 75개에서 219개 도구로 늘었어요.

Added

  • Agentic Report Generation — 리포트가 단일 프롬프트 대신 에이전트로 작성돼요. 적절한 에이전트 루프를 돌리고, 추측 대신 도구로 숫자를 가져오며, 작성 중 실시간으로 문서를 스트리밍해요.
  • Risk Assessments in the Eval Gate — Eval Gate가 평가 테스트 실행뿐 아니라 레드팀 위험 평가도 게이팅해요. "좋은가"가 막던 것과 같은 방식으로 "안전한가"가 병합을 막아요.
  • Full Prompt Support for AI Connections — AI 연결이 전체 프롬프트 데이터 모델(버전, 커밋, 브랜치, 라벨)을 말해요. 라벨을 가리키면 프롬프트가 어디로 이동해도 평가가 따라가요.
  • Simulation Model Reliability Benchmarks — 모델 설정 페이지가 모든 시뮬레이션 모델의 신뢰성 벤치마크를 보여줘서 선택이 동전 던지기가 아니에요.
  • Simulation Models on Red Teaming Test Cases — 레드팀 테스트 케이스가 어떤 시뮬레이션 모델이 공격을 실행했는지 기록해요.
  • From 75 to 219 MCP Tools — MCP 서버와 공개 API가 거의 세 배로 늘었어요. 리포트·템플릿, AI 연결·지표 컬렉션, 데이터셋 평가 시작, 워크플로, 알림, 페르소나, 거버넌스 등을 다뤄요.

August 21, 2026

  • Evals · Datasets · Security · Integrations

Test Runs: Brand New Page — 테스트 실행이 드디어 전용 페이지를 얻었어요. 새 개요는 실패 주제를 드러내고, 공통 문제를 지목하며, 지표 점수를 집계해서 나쁜 실행을 직접 진단하게 해줘요. 그 외에 페르소나가 베타에 들어오고, 감사 로그가 전체 이력을 내보내며, AI 연결이 MCP 서버 컨텍스트를 담을 수 있고, 모델 카탈로그가 커졌어요.

Added

  • Test Runs Overview Page — 테스트 실행에 실패 주제, 공통 문제, 지표 점수 집계를 보여주는 전용 개요가 생겼어요.
  • Public Model Configuration Routes — 평가, 플랫폼, 시뮬레이션 모델에 공개 라우트가 생겼어요. 설정을 프로그래매틱하게 구성할 수 있어요.
  • Personas (Beta) — 사용자를 한 번 정의(톤, 성향)하고 다중 턴 골든에 걸쳐 재사용할 수 있어요.
  • Full Audit Log Export — 감사 로그의 전체 이력을 한 번에 내보낼 수 있고, 공개 API도 지원해요.
  • MCP Context on AI Connections — AI 연결이 MCP 서버 컨텍스트를 담고, 에이전트 엔드포인트가 MCP 서버를 직접 호출할 수 있어요.
  • Hyperparameter Keys in AI Connection Payloads — AI 연결 페이로드에서 하이퍼파라미터 키가 일급으로 다뤄져요. JSON에서 hyperparameter.key 토큰을 참조하면 런타임에 저장 값이 채워져요.

Changed

  • Latest Models on Bedrock & Vertex — Bedrock이 Mantle을 통해 최신 OpenAI 모델을 제공하고, Vertex AI가 마침내 모든 지역에서 Claude를 실행해요.

August 14, 2026

  • Evals · Red Teaming · Security · Integrations · Quality of Life

Heat of the Moment — 레드팀에 워룸이 생겼어요. 새 Attack Heatmap은 모든 취약점을 모든 공격 방법에 대고 그려주고, Refusal Decay 그래프는 다중 턴 공격이 지속되는 동안 모델이 얼마나 오래 거부를 유지하는지 보여줘요. 그 외에 테스트 실행이 커스텀 대시보드에 들어오고, Bedrock이 IAM 역할 접근을 배우고, 거버넌스 폴리시가 상속될 수 있으며, ⌘K가 어디서나 검색창을 불러와요.

Added

  • Attack Heatmap — 위험 평가에 취약점과 공격 방법을 실패율 색상으로 대고 그린 히트맵이 포함돼요. 셀을 클릭하면 뒤의 테스트 케이스로 드릴다운해요.
  • Refusal Decay Graph — 위험 평가의 새 탭이 턴 대 공격을 계단형 생존 곡선으로 그려, 다중 턴 공격이 모델을 지치게 하기까지 얼마나 오래 거부하는지 보여줘요.
  • Test Runs in Custom Dashboards — 커스텀 대시보드가 테스트 실행 데이터 모델을 말하고, 위젯이 지표별로 세그먼트할 수 있어요.
  • Saved Views on Test Runs — 테스트 실행 페이지가 저장 뷰를 지원해요. 매일 재구성하던 필터 조합을 한 번 저장하고 영원히 다시 열 수 있어요.
  • Governance Policy Inheritance — 거버넌스 폴리시가 기본 폴리시에서 상속할 수 있고, 기본 폴리시의 컨트롤이 모든 하위에 실시간 적용돼요.
  • Control Resource Filters — 컨트롤 필터가 조직에 실제로 존재하는 리소스와 각각을 가진 프로젝트 수를 보여줘요.
  • IAM Role Access for Bedrock — Bedrock 통합이 IAM 역할 기반 접근을 지원해요. CloudFormation 템플릿으로 역할을 만들고 조직별 external ID로 assume해요 — 장기 AWS 키를 붙여넣지 않아요.
  • Simulation Model Settings — 조직 또는 프로젝트 수준에서 대화 시뮬레이션과 레드팀 공격 시뮬레이션을 구동하는 모델을 고를 수 있어요.
  • Command-K Search — 플랫폼 어디서나 ⌘K를 누르면 검색창이 떠서 원하는 곳으로 바로 이동해요.
  • Guided Tutorials — 모든 플랫폼 페이지에 가이드 투토리얼이 함께 제공돼요.
  • Metric DAG Builder — 지표를 DAG로 구성할 수 있어요. 시각적 빌더에서 단계를 연결하고 검증·버전 관리·API를 지원해요.
  • MCP Server for On-Prem — 자체 호스팅 배포에 MCP 서버가 포함돼요.
  • OAuth for MCP — MCP로 코딩 에이전트를 연결할 때 프로젝트 발견이 내장된 올바른 OAuth 동의 흐름을 거쳐요.
  • SSE Payload Types for AI Connections — AI 연결 스트리밍 이벤트를 페이로드 유형으로 매칭할 수 있어요.

Changed

  • Vertex AI Global & Anthropic Support — Vertex AI가 글로벌·멀티 리전 엔드포인트 위치를 지원하고, Anthropic 모델이 올바른 publisher로 라우팅돼요.
  • Graph Tooltips Behave — 테스트 실행 그래프 카드의 툴팁이 옆 카드에 잘리지 않고 위에 렌더링돼요.

August 7, 2026

  • Observability · Security · Red Teaming · Integrations · Quality of Life

Don't Cry Wolf — 모든 핑이 페이지를 받을 필요는 없어요. 알림에 이제 우선순위(critical, warning, error, info)가 생겼고 통합이 이로 필터링할 수 있어요. 그 외에 MCP에 도구가 늘고, 리포트 템플릿이 베타를 졸업하며, 레드팀이 코드 취약점 스캔을 하며, 조직이 모델 제공자를 잠글 수 있고, 트레이스가 JSONL로 내보내집니다.

Added

  • Alert Priorities & Priority Filtering — 알림이 critical, warning, error, info 네 가지로 나뉘고, 통합을 필터링해서 중요한 것만 적절한 채널에 보낼 수 있어요.
  • More MCP Tools — 코딩 에이전트가 채팅을 떠나지 않고 커스텀 대시보드를 만들고, MCP로 어노테이션하고, 위험 평가를 시작하고, 지표 컬렉션을 관리할 수 있어요.
  • Code Vulnerability Scanning (Beta) — 플랫폼에서 바로 코드 취약점을 스캔할 수 있어요.
  • Model Providers Policy — 조직 관리자가 모든 프로젝트에서 모델 제공자를 비활성화할 수 있어요(예: Bedrock만, 전역 적용).
  • LLM Span Endpoints — LLM 스팬이 호출한 엔드포인트를 기록해요.
  • Trace Export as JSONL — 트레이스 내보내기에 JSONL 형식이 추가됐어요.

Changed

  • Report Templates Out of Beta — 리포트 템플릿이 일급, 베타 졸업 기능으로 승격됐어요.

July 31, 2026

  • Observability · Security · Integrations · Quality of Life

Cost and Effect — 헤드라이너: Data Usage의 Cost Insights 탭인 Project Cost Analysis 가 프로젝트 지출을 평가·시그널·플랫폼 기능으로 나누고, 비용을 올리는 트레이스·스팬·스레드·테스트 실행을 이름까지 밝혀요. 그 외에 감사 로그가 Datadog로 스트리밍되고, API 키에 순환·만료 API가 생기며, GitLab이 PR 게이트에 합류하고, 골든이 전체 CRUD를 지원해요.

Added

  • Project Cost Analysis — Data Usage에 Cost Insights가 와서, 프로젝트 지출을 온라인·오프라인 평가, 시그널, 플랫폼 기능으로 나누고 시간·기능·모델별로 그려요.
  • GitLab for PR Gate — PR 게이트가 GitLab을 지원해요. 병합 전에 품질 검사가 실행돼요.
  • Default Report Templates — 리포트가 기본 템플릿과 함께 제공돼요.
  • Golden CRUD Endpoints — 골든이 완전한 CRUD 엔드포인트를 지원해요.
  • API Key Rotation, Grace Periods & Expiry — 키 관리를 프로그래매틱하게 순환하고, 유예 기간과 만료 날짜를 설정할 수 있어요.
  • Audit Logs to Datadog — 감사 로그를 Datadog로 직접 내보낼 수 있어요.
  • Admin Actions in Audit Logs — 관리자 행동이 감사 로그에 포함돼요.
  • Governance on Metric Data & Annotations — 거버넌스 런타임 컨트롤이 Metric Data와 Annotations 데이터 모델을 이해해요.

Changed

  • Classification Charts Move to Traces — 분류 탭에 숨어 있던 차트가 트레이스 페이지에 직접 렌더링돼요.
  • Fetch Trace Returns Everything — 트레이스 가져오기가 S3로 오프로드된 데이터를 포함한 전체 트레이스를 반환해요.

July 24, 2026

  • Observability · Evals · Quality of Life

Every Version Everywhere All at Once — 에이전트는 하나가 아니라 프로덕션에서 이중생활을 하는 수십 개 변형이에요. 자동 에이전트 버전 관리가 트레이스에서 모든 변형을 직접 발견해요. 여기에 이름을 밝히는 비용 인사이트, 드디어 생긴 초대, 공유 가능한 필터가 더해져 큰 한 주예요.

Added

  • Automatic Agent Versioning — 트레이스의 LLM과 메타데이터를 해싱해 모든 배포를 자동으로 발견·버전 관리하고, 수십 가지 변형을 즉석에서 비교할 수 있게 해줘요.
  • Organization-Wide Cost Insights — 한 페이지에서 모든 프로젝트의 지출을 봐요. 예산을 먹는 프로젝트를 드디어 찾을 수 있어요.
  • Test Run Cost Insights — 트레이스가 있는 테스트 실행에 비용이 붙어요. 한 축은 품질, 다른 축은 비용.
  • Onboarding Invitations — 온보딩 중 토큰 기반 초대와 실제 초대 수락 페이지로 팀원을 초대할 수 있어요.
  • Starter-to-Teams Upgrades — Starter에서 Teams로 즉시 업그레이드하고, 커밋 전에 비용을 볼 수 있어요.
  • Per-Metric Evaluation Models — 각 지표가 자체 심사 모델을 고를 수 있어요.
  • Metric Collection Sample Rates — 전체가 아니라 조각을 평가해요. 시그널은 유지하고 비용을 줄여요.
  • Shareable Filtered Views — 필터가 URL에 살아요. 뷰를 만들고 링크를 복사하면 동료가 정확히 원하는 곳에 도착해요.
  • Signals from Trace One — 새 프로젝트가 분류와 온라인 평가를 자동으로 켜요. 트레이스를 보내면 시그널을 받아요.

July 17, 2026

  • Observability · Evals · Integrations · Quality of Life

Positive Developments — 헤드라이너: 분류기 라벨에 이제 극성(polarity)이 생겨서, 시그널이 오르면 축하해야 할지 패닉해야 할지 알 수 있어요.

Added

  • Classifier Label Polarity — 분류기 라벨을 positive, negative, neutral로 표시할 수 있어서 모든 추세에 빠졌던 컨텍스트를 더해요.
  • Async AI Connections — AI 연결이 장기 실행 에이전트가 끝날 때까지 기다리지 않아도 돼요. 비동기 응답으로 에이전트가 단일 요청 창을 넘어 작업하고 준비되면 결과를 돌려줘요.
  • Zero-Config Signals & Online Evals — 새 프로젝트가 트레이스 전송에서 바로 Signals와 온라인 평가 사용으로 갈 수 있어요.
  • Cost Insights by Feature — 프로젝트 지출을 기능별로 나눠 볼 수 있어요.
  • Annotation Date Filters — 어노테이션을 날짜로 필터링할 수 있어요.
  • Metric Collection Sample Rates — 지표 컬렉션이 선택한 비율로 들어오는 트래픽을 샘플링할 수 있어요.
  • Report Template Page Breaks — 리포트 템플릿 섹션이 새 페이지에서 시작할 수 있어요.
  • Trace Detail Icons — 트레이스 상세에 제공자·통합 아이콘이 나타나요.

July 10, 2026

  • Observability · Integrations · Evals

Go With the Flow — 헤드라이너: 베타의 새 Flows 페이지 — 모든 추적 요청에서 에이전트가 도구와 모델을 호출하는 방식을 보여주는 실시간 지도로, 실패·오류·지연 시간이 모이는 곳에 불이 켜져요. 그 외에 온보딩이 저장소를 스캔해 트레이싱 PR을 열고, 커스텀 스킬이 코딩 에이전트를 가르치며, MCP 서버가 일급 연결이 되고, 온라인 평가가 트래픽을 샘플링할 수 있고, Observatory에서 트레이스를 리뷰용으로 플래그할 수 있어요.

Added

  • Flows (Beta) — 에이전트가 도구와 모델을 호출하는 방식을 모든 추적 요청에 걸쳐 보여주는 실시간 지도.
  • Auto-Traced Onboarding — 온보딩 중 GitHub 저장소를 연결하면 Confident AI가 코드베이스를 스캔하고 트레이싱을 연결하는 pull request를 열어 줘요.
  • Custom Skills — 조직 수준이나 거버넌스 폴리시별로 커스텀 스킬(설명과 본문이 있는 일반 Markdown 지침)을 만들고 Cursor, Claude Code, Codex에 설치할 수 있어요.
  • Flag Traces for Review — Observatory에서 트레이스를 requires review로 표시하고(하나씩 또는 일괄), 표시된 묶음만 필터링할 수 있어요.
  • Granular Emails & Report Emails — 수신자별로 누가 어떤 알림을 받을지 정확히 고를 수 있어요. 리포트도 이메일 전용 트리거를 얻었어요.
  • Online Eval Sampling — 지표 컬렉션 또는 프로젝트 전체에 샘플 비율을 설정해 대표 조각만 채점해요.
  • Hugging Face on Evals — 평가 모델을 Hugging Face 호스팅 모델로 지정할 수 있어요.
  • MCP Servers as Connections — MCP 서버를 일급으로 등록하고 OAuth 클라이언트 자격 증명이나 커스텀 헤더로 인증하며 도구를 가져올 수 있어요.
  • MCP & Function Tool Calls — 모든 도구 호출이 Function 또는 MCP 유형을 담아, 로컬 함수인지 MCP로 나간 건지 한눈에 보여요.
  • Custom Widget Endpoint — 새 위젯 쿼리 엔드포인트(POST /v1/widgets/query)가 위젯을 인라인 정의하고 즉시 데이터를 가져오게 해요.

July 3, 2026

  • Evals · Observability · Integrations · Red Teaming

Significant Figures — 헤드라이너: 테스트 실행의 통계적 유의성. 한 실행이 다른 실행을 근소하게 이길 때, 진짜 개선인지 샘플 크기 장난인지 알 수 있어요. 그 외에 대시보드·레드팀·거버넌스가 모두 전체 API를 얻고, Jira가 티케팅 통합에 합류하며, AI 연결이 스스로 설정할 수 있게 됐어요.

Added

  • Test Run Upgrades — 통계적 유의성이 모든 비교에 내장됐고, 각 테스트 케이스가 여러 generation을 가질 수 있으며, 트레이스가 API에서 직접 테스트 실행에 붙어요.
  • AI Connections Upgrades — 쿼리 파라미터 지원, 요청 로그, 그리고 연결을 설정하고 문제가 있으면 디버깅하는 AI 기반 흐름.
  • Dashboards & Red Teaming APIs — Dashboards API가 전체 CRUD와 데이터 접근을, Red Teaming API가 UI 없이 평가 실행 킥오프를 제공해요.
  • Governance in the Admin SDK — confident-client가 거버넌스를 말해서 폴리시와 컨트롤을 자체 도구·파이프라인에 연결할 수 있어요.
  • Jira Integration — 나쁜 트레이스를 발견하면 Jira 티켓을 만들 수 있어요.
  • Thread Exports — 전체 다중 턴 대화를 내보낼 수 있어요.
  • Annotation Filters & Graphs — 어노테이션에 저장 필터와 그래프가 생겼어요.
  • On-Prem Deployment Upgrades — 라이선스 기반 기능 게이팅과 내부 루트 CA 지원.

Changed

  • Expanded Platform Model Support on Signals — Signals가 더 많은 플랫폼 모델과 max tokens 설정을 지원해요.
  • Better Dataset CSV Preview — CSV 미리보기가 개선돼 커밋 전에 데이터를 더 깔끔하게 보여줘요.
  • Real-Time Activity in Histograms — 히스토그램이 활동을 실시간으로 갱신해요.

June 19, 2026

  • Security · Evals · Observability · Quality of Life

Govern Yourself Accordingly — 헤드라이너: 거버넌스가 완전한 폴리시 엔진으로 성장했어요. 폴리시를 만들고 컨트롤로 쌓아 조직의 모든 프로젝트에 펼치며, 실시간 컴플라이언스 추적이 내장돼요. 지표가 자체 기준과 루브릭을 쓰고, 분류기가 저장 필터와 워크플로 체이닝을 얻었어요.

Added

  • Governance — 거버넌스가 완전한 폴리시 엔진으로 성장. 배포 전·런타임 컨트롤로 폴리시를 쌓고 소유자를 지정하고 모든 프로젝트에 펼쳐요. 컴플라이언스 매트릭스와 일일 상태 뷰가 포함돼요.
  • AI Criteria & Rubric Generation — 지표가 강력한 LLM의 도움으로 자체 기준과 루브릭을 작성해요. 데이터셋 검증도 지표별로 빠진 필수 필드를 정확히 알려줘요.
  • Classifier Filters & Workflow Chaining — 분류기에 저장 필터 설정과 워크플로 체이닝이 생겼어요. 분류가 끝나는 순간 하류 큐·데이터셋 수집이 저절로 시작돼요.
  • Gemini 3 Series Models — Gemini 3.1 Pro Preview, 3.5 Flash, 3-flash 변형이 평가·모델 선택의 카탈로그에 들어와요.

Changed

  • Per-Evaluation Model Overrides — 평가별 모델을 고를 수 있고, 지원되지 않는 제공자를 가리키면 난해한 반응 대신 명확한 오류가 나와요.
  • Select All on Invitations — 조직 사용자 다중 선택기에 select-all / deselect-all이 생겼어요.
  • Faster Metric Charts — 고볼륨 프로젝트에서 느리던 지표 차트가 새 캐싱 덕에 빨라졌어요.

다음 주는 Launch Week가 월요일에 시작돼요.

June 12, 2026

  • Observability · Red Teaming · Quality of Life

Right on Time — 이번 주에는 플랫폼이 시간을 알게 됐어요. 작업과 알림이 onset, 종료일, 빈도, run-once를 존중해요. 트라이지가 트레이스에서 스팬·스레드·테스트 실행까지 퍼지고, 위험 평가에 프로필 필터와 공식 실행, Executive Insights용 BYOK가 추가됐어요.

Added

  • Flexible Scheduling for Tasks & Alerts — 데이터셋 스케줄링, 내보내기, 레드팀, 알림 모두에 시작 시점, 만료 날짜, 유연한 빈도, run-once 스위치가 생겼어요.
  • Triage on Spans, Threads & Test Runs — 트라이지 워크플로가 스팬, 스레드, 테스트 실행까지 확장돼요. 전체 트레이스뿐 아니라 어떤 조사 단위든 팀의 이슈 트래커 티켓이 될 수 있어요.
  • Risk Profile Filters — 위험 평가 뷰가 위험 프로필로 필터링돼요.
  • Official Assessment Support for Risk Assessments — 위험 평가가 "official" 배지를 달아, 테스트용 실행과 구분돼요.
  • BYOK for Executive Insights — Executive Insights가 플랫폼 선호 모델로 생성될 수 있어요.

Changed

  • AND/OR Toggle Across All Filters — 모든 필터가 AND/OR 로직을 전환할 수 있어요.
  • Model Credentials UI Polish — 모델 자격 증명 흐름이 더 깔끔해졌어요.

June 5, 2026

  • Observability · Integrations · Evals · Red Teaming

On High Alert — 헤드라이너는 새 Alerts 페이지예요. 기존 뷰를 뜯어내고 재구축해서 모든 알림이 전체 이력을 유지해요. 그 외에 트레이스 내보내기가 대상을 고를 수 있고, 공식 테스트 실행이 테스트용 실행이 평가 이력을 망치지 않게 하며, Salesforce와 Snowflake가 지식 베이스에 합류하고, 위험 평가 스케줄이 전체 공격 엔진으로 졸업했어요.

Added

  • New Alerts Page — 모든 알림이 전체 이력을 담아, 무엇이 언제 얼마나 자주 발화했는지 보고 알림에서 근본 원인까지 드릴다운할 수 있어요.
  • Trace Exports — 트레이스를 내보내고 대상을 고를 수 있어요.
  • Official Test Runs — 테스트 실행을 official로 표시할 수 있어 테스트용 실행·스모크 테스트가 평가 이력을 오염시키지 않아요.
  • Salesforce & Snowflake as Knowledge Bases — Salesforce와 Snowflake가 지식 베이스에 합류해 실제 데이터가 사는 시스템에서 직접 합성 데이터를 생성할 수 있어요.
  • Attack Engine for Risk Assessment Schedules — 예약된 위험 평가가 축소 샘플러 대신 전체 공격 엔진을 실행해요.
  • Org-Level Client (Python & TypeScript) — 조직 수준 API 키를 말하는 새 클라이언트가 프로젝트를 즉석으로 프로비저닝해요.

May 29, 2026

  • Integrations · Observability · Red Teaming

We've Got an Issue — 이번 주에는 트레이스에서 티켓까지의 루프를 닫아요. GitHub·Linear 통합이 문제 트레이스를 이슈 트래커로 바로 밀어 넣고, Integrations 페이지가 카드 기반 화장을 받고, 모든 알림이 완전한 종이 흔적을 남겨요.

Added

  • GitHub & Linear Integrations — 문제 트레이스를 팀이 이미 쓰는 도구의 이슈로 바로 바꿔요.
  • Revamped Integrations Page — 각 통합이 카드와 미세한 알림 컨트롤을 얻었어요.
  • Alert History & Logs — 발화된 모든 알림의 전체 이력을 탐색할 수 있어요.
  • Traces on Red Teaming Test Cases — 레드팀 테스트 케이스에 전체 트레이스가 붙어요.
  • Dataset Version API Support — 데이터셋 버전 관리를 API로 스크립트할 수 있어요.

May 22, 2026

  • Observability · Quality of Life · Red Teaming

Queue Tip — 큐가 이제 누구를 호출할지 알고, 대시보드가 알려진 모든 차트 형태를 얻었고, 트레이스가 멀티모달이 됐어요. 거기에 신뢰성 수정들이 조용히 쌓였어요.

Added

  • Queue Assignment & Notifications — 어노테이션 큐가 특정 팀원에게 작업을 라우팅하고 도착 즉시 알려요.
  • Provider & Integrations on Spans — 각 스팬이 어느 제공자·통합이 작업을 하는지 알려줘요.
  • Multimodal Traces (PDFs & Images) — PDF와 이미지가 입력·출력에 실려 멀티모달 모델에 맞는 멀티모달 종이 흔적을 만들어요.
  • Risk Assessment Live Updates — 공격 방법과 취약점이 실시간으로 표면화돼요.
  • Time-Series Tables & Every Graph Type — 대시보드 위젯이 시계열·범주형으로 나뉘고 새 시계열 테이블과 거의 모든 차트 형태가 추가됐어요.
  • PDF & Image Export for Dashboards & Reports — 대시보드 위젯이나 리포트를 PDF·이미지로 깨끗하게 내보낼 수 있어요.
  • Thread Metadata Everywhere — 스레드 메타데이터가 수집부터 표시기·필터·대시보드까지 스며들어요.

Changed

  • Postgres Connection Pooling — 연결 풀링 문제를 잡아 Postgres가 다시 데이터베이스답게 동작해요.
  • 2FA Is Back — 2단계 인증이 돌아왔어요.
  • The 95% Online Eval Error — 온라인 평가 실패의 약 95%를 차지하던 오류가 영구 제거됐어요.
  • More Reliable Signals — Signals가 내부적으로 심각한 신뢰성 개선을 받았어요.

May 15, 2026

  • Evals · Observability · Datasets

The Rules Have Changed — 이번 주는 덜 하는 것에 관한 이야기예요. 온라인 평가가 UI에서 정의한 규칙으로 스스로 돌고, 시그널이 실제 나타나는 이슈로 자동 분류되며, 데이터셋 재실행이 마지막 설정을 정확히 기억해요.

Added

  • Evaluation Rules — API 호출 없이 UI에서 직접 온라인 평가를 실행하는 워크플로를 만들어요. 트리거, 지표, 범위를 고르면 플랫폼이 루프를 돌려요.
  • Prompt Editing in AI Connections — Arena와 Experiments 안에서 프롬프트를 인라인 편집할 수 있어요.
  • Evaluation Config History for Datasets — 모든 데이터셋 실행이 평가 설정을 이력에 저장해요. 같은 설정을 원클릭으로 다시 불러와요.
  • Auto-Classified Signals — 시그널이 트레이스 전체에서 실제 표면화되는 이슈로 자동 분류돼요.
  • Context & Retrieval Context for Multi-Turn Test Cases — 다중 턴 테스트 케이스가 context와 retrieval context 필드를 지원해요.

May 8, 2026

  • Evals · Observability · Quality of Life

Plot Twist — Reliability Week에 온 걸 환영해요. Test Runs가 히트맵, 바 그래프, 시간별 라인 차트를 갖춘 전체 분석 레이어를 얻었고 어떤 차원으로든 쪼갤 수 있어요. Offline Classification으로 사후 분류·재분류가 가능하고, Auto-Surfaced Signals가 데이터에 뭐가 문제인지 플랫폼이 알려줘요.

Added

  • Advanced Test Run Analysis — 모든 지표를 모든 테스트 실행에 걸쳐 히트맵, 바 그래프, 시간별 라인으로 집계하고 데이터셋·식별자·하이퍼파라미터·모델·프롬프트 등 어떤 차원으로든 쪼개요.
  • Offline Classification — 분류기가 오프라인으로 실행돼 트레이스·스레드를 사후 분류하고, 이전 데이터를 재분류해 라벨을 채워요.
  • Auto-Surfaced Signals — Confident AI가 트레이스에서 패턴, 회귀, 이상치를 자동 추천해요.
  • Multi-Turn Eval Upgrades — 변수 보간, 스트리밍 프롬프트, AI 연결 지원으로 다중 턴 평가가 전반적으로 레벨업했어요.

Changed

  • Trace Comparison in Regression Testing — 회귀 테스트가 지표 점수뿐 아니라 트레이스를 diff할 수 있어요.
  • Detail Displayer Upgrades — Thread Displayer와 Test Case Displayer가 대폭 개선됐어요.
  • Revamped Test Cases Page — 엔드투엔드 분류, 컴포넌트 수준 분류, 정렬 인사이트를 위한 새 탭.
  • Sticky Column Headers in Observatory Tables — 열 헤더가 Observatory 테이블 상단에 고정돼요.
  • Faster Test Case & Conversation Loading — 단일·다중 턴 테스트 케이스 로딩이 크게 빨라졌어요.

May 1, 2026

  • Observability · Evals · Security

Health Check Yourself — 이번 주는 언제 건강한지, 정확히 얼마나 위험한지, API 키가 실수로 얼마나 큰 피해를 내는지 아는 것에 관한 이야기예요. Health Dashboards가 평가, 오류율, 비용, 시그널의 실시간 펄스를 줘요. 커스터마이즈 가능한 위험 평가·공격 방법·취약점 그리고 보안 강화된 API 키·모델 자격 증명이 추가됐어요.

Added

  • Health Dashboards — 평가 성능, 오류율, 비용, 시그널용 대시보드로 AI 시스템의 상태를 파악해요.
  • Comment Notifications — 코멘트에 알림이 붙어 태그된 팀원이 실제로 보게 돼요.
  • Customizable Risk Assessments — 커스텀 평가 단계를 포함해 위험 평가가 완전히 커스터마이즈 가능해요.
  • Read-Only API Keys — 읽기만 가능한 API 키를 만들 수 있어요.
  • Model Credentials Flows — 모델 자격 증명 설정에 전용 흐름이 생겼어요.

Changed

  • Org- and Project-Scoped API Keys — API 키가 조직·프로젝트로 범위가 정해지고, 범위 접미사로 한눈에 구분돼요.
  • Auto-Formatted JSON in Dataset Goldens — 데이터셋 골든의 JSON이 저장 시 자동으로 포맷돼요.

다음 주는 Reliability Week예요. 헬멧을 챙겨 오세요.

April 24, 2026

  • Evals · Observability · Datasets

Better Work Is No Work — 최고의 어노테이션 작업은 하지 않아도 되는 작업이에요. Auto-Annotate가 트레이스, 스팬, 스레드, 테스트 케이스에 걸쳐 첫 패스를 해서 팀이 명백한 것에 라벨을 붙이는 대신 인간 판단이 필요한 이상한 경우에 집중하게 해요.

Added

  • Auto-Annotate Across Everything — Auto-Annotate가 트레이스, 스팬, 스레드, 테스트 케이스에서 작동해요.
  • Thread Ingestion to Multi-Turn Datasets — 실제 사용자 스레드를 시나리오와 함께 다중 턴 데이터셋으로 바꿔요.
  • Automated Thread Ingestion Tasks — 다중 턴 데이터셋이 스레드 수집 작업으로 자동으로 신선하게 유지돼요.
  • Platform Models in Multi-Turn Simulations — 다중 턴 시뮬레이션이 플랫폼 모델을 지원해요.
  • Prompts Tab in Multi-Turn Test Cases — 다중 턴 테스트 케이스에 전용 Prompts 탭이 생겼어요.

Changed

  • Arena Full-Screen Viewer — Arena가 전체 화면 뷰어를 지원해요.
  • Aggregated Turn Metadata in Arena — Arena가 토큰, 지연 시간, 비용을 포함한 턴별 집계 메타데이터를 렌더링해요.
  • Confident Agent Pub-Sub Architecture — Confident Agent가 pub-sub 아키텍처를 지원해요.
  • Code Execution, Queue Automations & Dataset Workflows Are Stable — Code Execution, Queue Automations, Dataset Workflows가 베타를 졸업하고 안정화됐어요.

April 17, 2026

  • Observability · Integrations · Evals · Quality of Life

@here Look At This Trace — Confident AI가 멀티플레이어가 되고 컨텍스트 전환을 없애요. 코멘트가 트레이스·스팬·스레드·테스트 케이스에 걸쳐 실시간으로 되고, 누군가 @-멘션하면 Slack에 정확한 트레이스로 연결되는 직접 링크가 도착해요. Slack·Discord도 화장했고, AI 연결의 WebSocket 응답 모드와 Claude Opus 4.7도 나왔어요.

Added

  • Comments — 코멘트가 트레이스, 스팬, 스레드, 테스트 케이스에 실시간으로 되고, @-멘션이 동료 Slack을 정확한 트레이스 딥링크로 핑해요.
  • Revamped Slack & Discord Integrations — 원클릭 설정, 훨씬 적은 설정, 알림·평가 결과·코멘트 @-멘션 전달.
  • WebSocket Response Mode for AI Connections — 음성 AI용 완전한 양방향 저지연 스트리밍.
  • Metric FN/FP/TP/TN Over Time for Online Evals — 온라인 평가가 시간에 따른 false negatives, false positives, true positives, true negatives를 그려요.
  • Native Annotation Test Cases — 어노테이션이 일급 테스트 케이스가 돼요.
  • Tables & Big Number Widgets for Custom Dashboards — 커스텀 대시보드에 Tables와 Big Number 위젯이 추가됐어요.
  • Bar & Stacked Bar Graphs for Custom Dashboards — 바·스택 바 차트가 위젯 라인업에 합류해요.
  • Prompt Auto-Refinement — 실패 테스트 케이스·트레이스·스팬을 가리키면 Confident AI가 프롬프트를 자동으로 다듬어요.
  • Image Support on Annotations — 어노테이션에 이미지를 포함할 수 있어요.
  • Claude Opus 4.7 Everywhere — Opus 4.7이 Arena, Experiments, Evaluations, Platform 전역에서 제공돼요.

Changed

  • Inline Table Editing — 테이블 값 인라인 편집이 크게 개선됐어요.
  • PortKey Model Slug Fetching — 조직 PortKey 제공자의 모델 slug를 자동으로 가져와요.
  • Invitations for Organizations & Projects — 초대가 조직·프로젝트 수준 모두에서 작동해요.

April 10, 2026

  • Observability · Integrations · Quality of Life

Back From Hiatus — Signals가 공개 베타에 들어갔어요. 지표를 미리 정의하는 대신 Signals가 들어오는 모든 트레이스에서 이슈·감정·패턴을 자동으로 표면화해요. Confident Agent가 공개되었고(내부 엔드포인트를 공개 인터넷에 열지 않고 Confident AI에 노출하는 릴레이), Executive Reports도 공개 베타에 들어갔어요.

Added

  • Signals (Public Beta) — 지표를 미리 정의할 필요 없이, Signals가 모든 들어오는 트레이스에서 이슈·감정·행동 패턴을 자동 감지해요.
  • Confident Agent — AI Connections를 통해 내부 엔드포인트를 공개 인터넷에 열지 않고 Confident AI에 노출하는 릴레이 서비스.
  • Executive Reports (Public Beta) — 비즈니스 수준 KPI를 정의하고 매일 이에 대한 보고서를 생성해요.
  • Organization Governance Page — 모든 프로젝트를 한 뷰에서 비용, 지표, 어노테이션 등으로 나란히 비교해요.

March 27, 2026

  • Prompts · Observability · Integrations

You Shall Not Merge!!! — 기다리던 Prompt Pull Requests & Approval Workflows가 드디어 나왔어요. 프롬프트 브랜치에서 PR을 올리고, 리뷰어가 서명 전에 diff와 평가 결과를 검사하며, 모든 변경의 전체 감사 추적을 남겨요. AI 연결도 Postman 스타일 레이아웃, Auth0·HMAC 인증, 다중 턴 테스트 실행의 개별 턴으로 트레이스 직접 연결을 얻었어요.

Added

  • Prompt Pull Requests & Approval Workflows — 어떤 프롬프트 브랜치에도 PR을 올려요. 리뷰어가 승인 전에 diff와 평가 결과를 나란히 보고, 모든 병합이 전체 감사 추적을 남겨요.
  • AI Connection Authorization — AI 연결이 Auth0 SSO와 HMAC 서명을 지원해요.
  • Trace Linking to Turns in Multi-Turn Test Runs — AI 연결이 트레이스를 다중 턴 테스트 실행의 개별 턴에 직접 연결해요.
  • Thread Categorization — 스레드를 자동으로 카테고리화하고 샘플 비율을 설정해 트래픽을 제어해요.

Changed

  • New AI Connection Layout — AI 연결이 Postman 스타일 레이아웃으로 개편됐어요.
  • Improved Red Teaming Progress Bars — 레드팀 진행 표시줄이 더 세밀해졌어요.

다음 주는 최초의 Launch Week예요. 5일, 5개의 출시.

March 21, 2026

  • Prompts · Observability · Integrations

Branching Out — 큰 주예요. Prompt Branches가 프롬프트에 적절한 버전 관리 워크플로를 가져와요. 커스텀 대시보드로 나만의 Observatory 뷰를 처음부터 만들 수 있어요. OpenRouter와 TrueFoundry가 Arena·Experiments에, OpenInference 트레이싱이 Python·TypeScript에, HMAC·Auth0 지원이 엔터프라이즈 인증에 추가됐어요.

Added

  • Prompt Branches — 프롬프트를 브랜치로 분기하고, 안전하게 반복하고, 준비되면 병합해요.
  • Custom Dashboards — 나만의 Observatory 대시보드를 처음부터 만들어요.
  • OpenRouter & TrueFoundry in Arena & Experiments — OpenRouter로 수백 개 모델에 접근하거나 파인튜닝한 TrueFoundry 모델을 가져와요.
  • OpenInference Integration — Python과 TypeScript에서 OpenInference로 LLM 앱을 트레이싱해요.
  • HMAC & Auth0 Support — HMAC 서명과 Auth0 SSO로 엔터프라이즈급 인증.
  • New Thread Displayer — 스레드에 새 시각적 처리 방식이 생겼어요.
  • AI Connections for Quick Runs & Experiments — AI 제공자를 Quick Runs에 연결하고 Arena·Experiments 패널에서 temperature, top-p 등을 조정해요.
  • Error Bars in Observatory — 지표에 신뢰 구간이 표시돼요.
  • Progress Bars for Risk Assessments — 레드팀 잡이 스피너 대신 실시간 진행 표시줄을 보여줘요.

Changed

  • Transformers & Categories out of Beta — 전투 검증되고 프로덕션 준비 완료.
  • User Analytics Upgrades — 테이블의 사용자당 총 비용, Threads 페이지의 User ID 필터, Users에서 Traces로의 클릭스루.
  • New Pagination & Arrow Navigation — 전역 페이지네이션 개선과 Spans·Threads 화살표 키 탐색.
  • Framework Deletion — 더 이상 필요 없는 프레임워크를 삭제할 수 있어요.
  • General Stability & Performance Improvements — 버그 수정과 신뢰성 향상.

March 14, 2026

  • Datasets · Observability · Evals

Version Control Freak — 데이터셋이 Dataset Versioning으로 진지해졌어요. 모든 변경이 추적되고 모든 버전이 참조 가능해요. Arena의 Replay Trace로 실제 트래픽에서 모델을 나란히 비교하고, 컴플라이언스용 Audit Logs도 나왔어요.

Added

  • Dataset Versioning — 데이터셋에 완전한 버전 이력이 생겨 무엇에 대해 평가했는지 항상 정확히 알아요.
  • Replay Trace in Arena — 프로덕션 트레이스를 Arena에서 재생해 서로 다른 모델이 같은 입력을 처리하는 방식을 나란히 비교해요.
  • Audit Logs — 누가 언제 무엇을 했는지 완전한 가시성.

March 7, 2026

  • Datasets · Observability · Integrations

MC...What?!! — Confident AI에 MCP 서버가 생겼어요(깃허브에 오픈소스). 평가, 데이터셋, 트레이스를 MCP 호환 클라이언트에 연결할 수 있어요. 프로덕션 트레이스의 자동 데이터셋 큐레이션, Observatory 업그레이드, PagerDuty 알림도 나왔어요.

Added

  • MCP Server — Confident AI를 MCP 호환 클라이언트에 연결해요.
  • Automatic Dataset Curation from Traces & Spans — 프로덕션 트레이스·스팬을 큐레이션된 데이터셋으로 자동으로 바꿔요.
  • Annotation Tabs in Observatory — 어노테이션이 자체 탭에 살아요.
  • PagerDuty Integration for Alerts — 알림을 PagerDuty로 라우팅해요.
  • Custom Column Variable Mapping — 변수를 Observatory의 커스텀 컬럼에 직접 매핑해요.
  • Category Filters & Metric/Annotation Column Options — 카테고리로 필터링하고 지표·어노테이션 컬럼을 토글해요.

Changed

  • General Stability & Performance Improvements — 더 빠른 로딩, 더 적은 히컵.

February 28, 2026

  • Prompts · Evals · Integrations

Prompt-ly Evaluated — Prompt Evals가 나왔어요. 프롬프트 커밋과 버전 릴리스용 GitHub Actions라 생각하면 돼요. 모든 프롬프트 변경이 품질을 높이고 놀라움을 줄이는 검사를 트리거할 수 있어요.

Added

  • Prompt Evals — 프롬프트 커밋·버전 릴리스에 자동으로 평가를 실행해요. 프롬프트용 CI.
  • Support Ticket Submission Page — 도움이 필요할 때 물어볼 전용 공간.
  • Trace Classification — 트레이스를 카테고리로 정렬해요.
  • Dataset Threads + Scenario Generation — 데이터셋이 스레드를 지원하고 시나리오 생성으로 더 풍부한 테스트 케이스를 만들어요.
  • Portkey Support in Arena and Experiments — Portkey가 Arena·Experiments에서 작동해요.
  • SSE + HTTP Streaming for AI Connections — SSE 또는 HTTP로 응답을 스트리밍해요.
  • Azure Key Vault Integration — 시크릿을 Azure Key Vault에 저장해요.
  • Org Settings Pages — 역할, 권한, API 키용 새 페이지.

Changed

  • Evaluate Buttons on Traces and Spans — 이슈가 나타나는 곳에서 직접 평가를 트리거해요.

February 21, 2026

  • Integrations · Evals · Observability

We Need to Talk. In Code. — 다중 턴 평가가 코드 우선이 되고, Vercel이 가족에 합류하며, 프롬프트가 마침내 마땅한 관측성을 얻었어요.

Added

  • Code-Based Multi-Turn Evals — 코드베이스용 ConversationalTestCase 도입. 다중 턴 평가의 모든 힘을 프로그래매틱하게.
  • Vercel AI SDK Integration — Vercel AI SDK 네이티브 통합으로 ai 패키지 호출을 마찰 없이 트레이싱·평가해요.
  • Transformers on Retrievers & Tools — 검색기 출력과 도구 호출을 평가 전에 재구성해요.
  • Organization-Wide Metrics — 조직 수준에서 지표를 정의하고 모든 팀에 공유해요.

Changed

  • Prompt Observability — 어떤 프롬프트가 프로덕션에서 실행 중인지, 언제 바뀌었는지, 성능이 어떻게 변했는지 추적해요.

February 13, 2026

  • Prompts · Observability · Quality of Life

More Than Meets the AI — Transformers(Beta)가 왔어요. 평가 전에 추적된 데이터를 재구성할 수 있고, 모든 트레이스가 전체 스포트라이트를 받을 필요는 없어요. Prompt Studio도 git 스타일 버전 관리로 커밋 업그레이드를 받았어요.

Added

  • Transformers (Beta) — 개별 스팬을 포함해 추적된 데이터를 평가 전에 변환하는 커스텀 코드를 작성해요. 전체 트레이스가 필요 없다면 정확히 중요한 것만 골라요.
  • Transformers on AI Connections — AI 연결 출력을 원하는 대로 파싱하고 주무를 수 있어요.
  • Prompt Commits — 프롬프트의 모든 변경이 커밋을 만들어요. 전체 이력, 무엇이 언제 바뀌었는지 추측할 필요 없어요.

Changed

  • Git-Based Prompt Studio — Prompt Studio가 깃 워크플로에 합류. 커밋, 버전, diff.

February 7, 2026

  • Evals · Observability · Quality of Life

Let There Be Light (Mode) — 데이터와 화면 모두에서 가시성이 커진 주예요. Observatory 그래프 30개 이상, 데이터 사용량 설정 페이지, 그리고 라이트 모드가 베타를 나왔어요.

Added

  • Data Usage Settings Page — 데이터가 정확히 어떻게 사용되는지 보여주는 전용 페이지.
  • Observatory Graphs — 관측성 데이터를 시각화하고 추세를 발견해요.
  • Code Evals (Beta) — 코드로 자체 평가 로직을 작성해요.
  • Multimodal Arena — 비전 언어 모델을 맞붙게 해요.
  • AI Connection Upgrades — 트레이싱, 리스트 인덱스 키 경로, 중복 연결, 최대 동시성.

Changed

  • Light Mode Out of Beta — 라이트 모드가 공식적으로 유지돼요.
  • Faster Observatory Dashboards — 대시보드 로딩이 매우 빨라졌어요.

January 30, 2026

  • Observability · Quality of Life

Scaling New Heights — 새 체인지로그에 온 걸 환영해요! 더 나은 비용 추적, 신뢰성 개선, 심각한 확장성 업그레이드로 시작해요. (이 시점 이전 체인지로그는 백필된 거예요.)

Added

  • Changelog — 지금 읽고 있는 그것. 구독해서 놓치지 마세요.
  • Custom Model Costs — 프로젝트 설정에서 어떤 모델이든 커스텀 토큰당 비용을 설정해요. 파인튜닝·자체 호스팅 모델의 정확한 비용 추적.
  • Request Timeout for AI Connections — LLM 연결의 타임아웃 한도를 구성해요.
  • High-Volume Trace Ingestion — 버퍼링된 수집으로 트레이스 처리를 강화했어요.

Changed

  • Smoother Experiment Runs — 개선된 스트리밍으로 실시간 평가 진행이 더 안정적이에요.
  • Annotator Attribution — 누가 어노테이션을 남겼는지 보여요.
  • Faster Spans Loading — 트레이스가 많은 프로젝트에서도 스팬 탭이 번개처럼 로딩돼요.

January 23, 2026

  • Evals · Observability · Quality of Life

Alert the Press, We're Going Multimodal — 알림, 공유 가능한 트레이스, 멀티모달 지원이 도입된 큰 주.

Added

  • Public Trace Links — 공개 링크로 트레이스를 누구와나 공유해요.
  • Scheduled Alerts — 임계값을 설정하고 알림을 받아요.
  • Multimodal Evaluations — 이미지 + 텍스트를 평가할 수 있어요.
  • Evaluation Queue — 큰 평가 잡이 타임아웃 대신 정돈되게 큐에 쌓여요.

Changed

  • Snappier Dashboards — 그래프 로딩이 눈에 띄게 빨라졌어요.

January 16, 2026

  • Evals · Quality of Life

On Cloud Nine — Azure 팬, GCP 애호가들, 우리가 봤어요. 이번 주에는 Confident AI에 클라우드를 가져와 자체 인프라로 평가할 수 있게 해요.

Added

  • Azure OpenAI Support — Azure 배포를 연결하고 클라우드에서 평가를 실행해요.
  • GCP Vertex AI Integration — 서비스 계정 키를 넣으면 Google 모델로 달려요.
  • Top-K Filtering — 상위 10, 하위 5 등 원하는 K.

Changed

  • Faster Dashboards — 집계 레이어를 최적화해서 그래프가 커피 한 모금 전에 로딩돼요.
  • Live Evaluation Progress — 스트리밍 진행 업데이트로 평가를 실시간으로 봐요.

January 9, 2026

  • Observability · Red Teaming · Quality of Life

Dashing Into the New Year — 새해, 새 대시보드! 커스터마이즈 가능한 뷰와 더 똑똑한 브레이크다운으로 LLM 성능 시각화를 재설계했어요. 보안 인사이트를 PDF 리포트로 가져갈 수도 있어요.

Added

  • Custom Dashboards — 나만의 뷰를 만들고 저장해요.
  • Dimension Breakdowns — 모델, 환경 등 어떤 차원으로든 슬라이스해요.
  • Risk Assessment Reports (PDF) — 레드팀 실행에서 커스텀 위험 평가 리포트를 만들어 공유 가능한 PDF로 내려받아요.

Changed

  • Fresh Dashboard Layout — 더 나은 흐름으로 재정리.
  • Readable Timestamps — 날짜·시간이 실제 날짜·시간처럼 보여요.

January 2, 2026

  • Evals · Prompts

I See What You Did There — 새해 복 많이 받으세요! 멀티모달 평가로 2026을 시작해요. 이미지 이해 모델이 받을 자격이 있는 테스트를 받게 될 거예요.

Added

  • Multimodal Prompts — 실험에 이미지를 넣어요. GPT-4V, Claude 3, Gemini 등 비전 모델을 테스트해요.
  • Multimodal Test Cases — 이미지 + 텍스트 데이터셋을 만들어요.

December 26, 2025

  • Datasets · Observability · Quality of Life

Boxing Day Unboxing — 좋은 휴일 보냈길 바래요! 이번 주는 가볍게 지나가지만, 대시보드 선물 몇 개는 숨겨 넣었어요.

Added

  • Duplicate Datasets — 원클릭으로 데이터셋을 복제해요.
  • Better Invitation UX — 팀 초대 수락이 더 매끄러워요.

Changed

  • Dashboard Reorganization — 대시보드가 Home 아래로 이동해 탐색이 쉬워졌어요.
  • Multiple Dashboards — 용도별로 여러 대시보드를 만들어요.

December 19, 2025

  • Evals · Observability · Quality of Life

Compare and Contrast — 관점에 관한 주. 새 비교 기능으로 모델이 시간·세그먼트 등 원하는 대로 어떻게 쌓이는지 볼 수 있어요.

Added

  • Custom AI Connection Payloads — AI 연결에 커스텀 파라미터(temperature, max tokens, stop sequences)를 보내요.
  • Comparison Mode — 두 기간을 나란히 두고 무엇이 언제 바뀌었는지 봐요.
  • Filter Presets — 자주 쓰는 필터 조합을 저장해요.

December 12, 2025

  • Evals · Observability · Quality of Life

A Metric Ton of Updates — 멀티모달 평가의 토대를 깔고 스레드를 더 탐색하기 쉽게 해요. 시간 범위 제어도 더 유연해졌어요.

Added

  • Multimodal Metrics — 비전 언어 모델용 목적에 맞춘 지표.
  • Enhanced Thread View — 시작부터 끝까지 대화를 따라가요.

Changed

  • Flexible Time Ranges — 커스텀 날짜 창이 생겼어요.

December 5, 2025

  • Evals · Observability · Quality of Life

100 Ways to Evaluate — 왜 LLM 제공자 하나에 한정하나요? Portkey 통합으로 100개 이상 제공자로 평가할 수 있어요. OpenAI, Anthropic, Cohere, 로컬 모델.

Added

  • Self-Served SSO — 지원팀을 기다리지 않고 조직용 SAML SSO를 설정해요.
  • Portkey Gateway — 통합 하나, 제공자 100개 이상.
  • Custom Graphs — KPI와 실제로 일치하는 시각화를 만들어요.

Changed

  • Optional Tags — 평가 태그가 선택 사항이 돼요.

November 28, 2025

  • Observability · Quality of Life

Permission Accomplished — 좋은 의미로 시스템을 잠그는 주. 향상된 권한으로 누가 무엇을 할 수 있는지 세밀하게 제어하고, 엔터프라이즈 네트워킹용 프록시 지원도 있어요.

Added

  • Multi-Factor Authentication — 계정에 보안 계층을 추가해요.
  • Role-Based Permissions — Admin, Editor, Viewer 같은 세밀한 접근 제어.
  • Proxy Agent Support — 회사 프록시 뒤에서도 연결을 구성해요.
  • Observatory Filters — 어떤 차원으로든 트레이스를 필터링해요.

Changed

  • Smoother Authentication — 특히 엔터프라이즈 SSO 설정에서 로그인 흐름이 더 안정적이에요.

November 21, 2025

  • Evals · Datasets · Integrations

Lit-erally Amazing — LiteLLM이 합류해요! 단일 통합으로 100개 이상 모델 제공자로 평가해요. 어노테이션 도구도 개선됐어요.

Added

  • LiteLLM Support — LiteLLM 게이트웨이를 연결해 OpenAI, Anthropic, Cohere, 로컬 모델 등으로 평가해요.
  • Inherit Model Credentials — 프로젝트가 조직 수준에서 AI 자격 증명을 상속해요.
  • Annotation Upgrades — 더 나은 조직화가 된 새 어노테이션 UI.
  • Dataset Editor Improvements — 골든 데이터셋을 인라인 편집해요.

Changed

  • Better Filter Persistence — 필터 설정이 세션 사이에 유지돼요.

November 14, 2025

  • Evals · Datasets

Docker? I Hardly Know Her — 온프렘을 계획 중? 적절한 Docker 지원으로 자체 호스팅을 쉽게 만들었어요. 다중 턴 골든 데이터셋으로 대화형 평가도 더 똑똑해졌어요.

Added

  • Docker Support — 온프레미스 배포용 전체 Dockerfile과 docker-compose 설정.
  • Conversational Goldens — 다중 턴 대화 데이터셋을 만들어요.
  • Auth On-Prem — 자체 호스팅 배포가 클라우드와 같은 인증 기능을 지원해요.

Changed

  • Simpler Environment Config — 배포를 위한 환경 변수를 간소화했어요.

November 7, 2025

  • Evals

Simulate to Dominate — 챗봇 테스트가 더 쉬워졌어요. 대화 전체를 규모에 맞춰 시뮬레이션하고 실험을 그 어느 때보다 빠르게 돌려요.

Added

  • Conversation Simulations — 에이전트를 규모에 맞춰 테스트하도록 다중 턴 대화를 자동 시뮬레이션해요.

Changed

  • Faster Experiment Completion — 평가 파이프라인을 최적화했어요. 같은 결과, 덜 기다림.

October 31, 2025

  • Evals · Prompts · Quality of Life

Spooky Good Updates — 할로윈인데 사탕은 있지 속임수는 없어요! 도구 호출 스트리밍으로 에이전트가 작동하는 걸 실시간으로 보고, 프롬프트 어시스턴트도 더 똑똑해졌어요.

Added

  • Tool Call Streaming — 에이전트의 도구 호출을 실시간으로 봐요.
  • Prompt Assistant Refactor — 프롬프트 엔지니어링용 AI 헬퍼가 대폭 개선됐어요.
  • Max Concurrent Evaluations — 한 번에 실행되는 평가 수를 제어해요.

Changed

  • Better Error Messages — 문제가 생기면 실제로 왜인지 알 수 있어요.

October 24, 2025

  • Evals

Stream Team — 실시간이 더 실시간이 됐어요. 스트리밍 실험으로 평가 진행을 실시간으로 보고, 실험 엣지 케이스도 우아하게 처리돼요.

Added

  • Streaming Experiments — 모든 게 끝났을 때가 아니라 도착하는 대로 결과를 봐요.
  • Multiple Winners Support — 실험이 여러 우승자(또는 우승자 없음)를 가질 수 있어요.

Changed

  • Experiment Results Handling — 특이한 결과의 엣지 케이스를 더 잘 처리해요.
  • Runtime Environment Config — 배포 환경별 더 깔끔한 설정.

October 17, 2025

  • Evals · Prompts · Datasets

Dataset Your Sights Higher — 데이터셋이 업그레이드됐어요. 데이터셋에서 직접 프롬프트를 평가하고 전용 페이지로 LLM 연결을 관리해요.

Added

  • Dataset Evaluate Prompts — 데이터셋에서 직접 평가를 실행해요. 프롬프트를 선택하고 지표를 고르면 돼요.
  • AI Connection Page — 모든 AI 연결을 관리하는 전용 공간.
  • Prompt Version Labels — 프롬프트 버전에 커스텀 라벨을 달아요.

Changed

  • Smarter Project Fetcher — 특히 프로젝트가 많은 조직에서 프로젝트가 더 빠르고 안정적으로 로딩돼요.

October 10, 2025

  • Evals · Prompts

Gemini Rising — 새 모델 지원과 Arena 개선! Gemini가 합류하고, Arena가 변수 매핑으로 더 유연해졌어요.

Added

  • Gemini Support — Google의 Gemini 모델이 평가에 사용 가능해요.
  • Arena Variable Mapping — 테스트 케이스 변수를 프롬프트 플레이스홀더에 매핑해요.
  • Arena Endpoints — 프로그래매틱 Arena 접근용 새 API 엔드포인트.

Changed

  • Improved Model Selection — 모델 선택 UI가 더 깔끔해요.
  • Better Trace Display — 특히 긴 출력에서 트레이스 상세가 더 깔끔하게 렌더링돼요.

더 알아보기