법률 문서 요약
법률 문서 요약 (Legal summarization)
이 가이드에서는 클로드의 고급 자연어 처리 능력을 활용해 법률 문서를 효율적으로 요약하고, 핵심 정보를 추출하며, 법률 조사를 빠르게 하는 방법을 단계별로 배울 수 있어요. 클로드를 사용하면 계약 검토, 소송 준비, 규제 업무를 간소화해 시간을 절약하고 법률 프로세스의 정확성을 확보할 수 있어요.
출처: 문서
본문
클로드를 사용한 법률 요약 구현 예시를 보려면 요약 쿡북을 방문해 보세요.
클로드로 구축하기 전에 (Before building with Claude)
법률 요약에 클로드를 사용할지 결정하기
클로드 같은 LLM을 사용해 법률 문서를 요약해야 한다는 핵심 신호는 다음과 같아요:
요약이 추출할 세부 사항 결정하기
어떤 문서에도 단일한 올바른 요약은 없어요. 명확한 방향 없이는 클로드가 어떤 세부 사항을 포함해야 할지 결정하기 어려워요. 최적의 결과를 얻으려면 요약에 포함할 특정 정보를 식별하세요.
예를 들어 전대 계약(sublease agreement)을 요약할 때 다음과 같은 핵심 포인트를 추출하고 싶을 수 있어요:
details_to_extract = [
"Parties involved (sublessor, sublessee, and original lessor)",
"Property details (address, description, and permitted use)",
"Term and rent (start date, end date, monthly rent, and security deposit)",
"Responsibilities (utilities, maintenance, and repairs)",
"Consent and notices (landlord's consent, and notice requirements)",
"Special provisions (furniture, parking, and subletting restrictions)",
]
성공 기준 세우기
요약의 품질을 평가하는 것은 악명 높게 어려운 작업이에요. 많은 자연어 처리 작업과 달리 요약 평가는 종종 명확하고 객관적인 지표가 부족해요. 매우 주관적일 수 있으며, 독자마다 요약의 다른 측면을 가치 있게 여길 수 있어요. 클로드가 법률 요약을 얼마나 잘 수행하는지 평가할 때 고려할 수 있는 기준은 다음과 같아요.
자세한 내용은 성공 기준 세우기 가이드를 참고하세요.
클로드로 법률 문서를 요약하는 방법
올바른 클로드 모델 선택하기
법률 문서를 요약할 때 모델 정확도는 극히 중요해요. 높은 정확도가 필요한 이런 유스 케이스에는 Claude Opus 5가 훌륭한 선택이에요. 문서의 크기와 수량이 커서 비용이 걱정된다면 Claude Haiku 4.5 같은 더 작은 모델도 시도해 볼 수 있어요.
비용을 추정하기 위해 다음은 Opus와 Haiku 모델로 전대 계약 1,000개를 요약하는 비용 비교예요:
-
콘텐츠 크기
- 계약 수: 1,000
- 계약당 문자 수: 300,000
- 총 문자 수: 300M
-
추정 토큰
- 입력 토큰: 86M(문자 3.5개당 토큰 1개 가정)
- 요약당 출력 토큰: 350
- 총 출력 토큰: 350,000
-
Claude Opus 5 추정 비용
- 입력 토큰 비용: 86 MTok * $5.00/MTok = $430.00 USD
- 출력 토큰 비용: 0.35 MTok * $25.00/MTok = $8.75 USD
- 총 비용: $430.00 + $8.75 = $438.75 USD
-
Claude Opus 4.8 추정 비용
- 입력 토큰 비용: 86 MTok * $5.00/MTok = $430.00 USD
- 출력 토큰 비용: 0.35 MTok * $25.00/MTok = $8.75 USD
- 총 비용: $430.00 + $8.75 = $438.75 USD
-
Claude Haiku 4.5 추정 비용
- 입력 토큰 비용: 86 MTok * $1.00/MTok = $86.00 USD
- 출력 토큰 비용: 0.35 MTok * $5.00/MTok = $1.75 USD
- 총 비용: $86.00 + $1.75 = $87.75 USD
문서를 클로드가 처리할 수 있는 형식으로 변환하기
요약을 시작하기 전에 데이터를 준비해야 해요. 이는 PDF에서 텍스트를 추출하고, 텍스트를 정리하며, 클로드가 처리할 준비가 되도록 하는 것을 포함해요.
샘플 PDF에 대한 이 과정의 시연은 다음과 같아요:
from io import BytesIO
import re
import pypdf
import requests
def get_llm_text(pdf_file):
reader = pypdf.PdfReader(pdf_file)
text = "\n".join([page.extract_text() for page in reader.pages])
# Remove page numbers
text = re.sub(r"\n\s*\d+\s*\n", "\n", text)
# Remove extra whitespace
text = re.sub(r"\s+", " ", text)
return text
# Create the full URL from the GitHub repository
url = "https://raw.githubusercontent.com/anthropics/claude-cookbooks/main/capabilities/summarization/data/Sample Sublease Agreement.pdf"
url = url.replace(" ", "%20")
# Download the PDF file into memory
response = requests.get(url)
# Load the PDF from memory
pdf_file = BytesIO(response.content)
document_text = get_llm_text(pdf_file)
print(document_text[:50000])
이 예시에서 먼저 요약 쿡북에 사용된 샘플 전대 계약의 PDF를 다운로드해요. 이 계약은 sec.gov 웹사이트에서 공개적으로 제공되는 전대 계약에서 가져온 거예요.
예시는 pypdf 라이브러리를 사용해 PDF 내용을 추출하고 텍스트로 변환해요. 그다음 페이지 번호와 불필요한 공백을 제거해 텍스트 데이터를 정리해요.
강력한 프롬프트 만들기
클로드는 다양한 요약 스타일에 적응할 수 있어요. 프롬프트의 세부 사항을 바꿔 클로드가 더 장황하거나 더 간결하게, 더 많거나 적은 기술 용어를 포함하도록, 또는 손에 든 컨텍스트의 더 높거나 낮은 수준 요약을 제공하도록 안내할 수 있어요.
전대 계약을 분석할 때 생성된 요약이 일관된 구조를 따르도록 보장하는 프롬프트를 만드는 예시는 다음과 같아요:
# Initialize the Anthropic client
client = anthropic.Anthropic()
def summarize_document(
text, details_to_extract, model="claude-opus-5-5", max_tokens=1000
):
# Format the details to extract to be placed within the prompt's context
details_to_extract_str = "\n".join(details_to_extract)
# Prompt the model to summarize the sublease agreement
prompt = f"""Summarize the following sublease agreement. Focus on these key aspects:
{details_to_extract_str}
Provide the summary in bullet points nested within the XML header for each section. For example:
<parties involved>
- Sublessor: [Name]
// Add more details as needed
</parties involved>
If any information is not explicitly stated in the document, note it as "Not specified". Do not preamble.
Sublease agreement text:
{text}
"""
response = client.messages.create(
model=model,
max_tokens=max_tokens,
system="You are a legal analyst specializing in real estate law, known for highly accurate and detailed summaries of sublease agreements.",
messages=[
{"role": "user", "content": prompt},
],
)
return next(block.text for block in response.content if block.type == "text")
sublease_summary = summarize_document(document_text, details_to_extract)
print(sublease_summary)
이 코드는 클로드를 사용해 전대 계약 내용을 요약하는 summarize_document 함수를 구현해요. 함수는 텍스트 문자열과 추출할 세부 사항 목록을 입력으로 받아요. 이 예시에서 코드는 이전 코드 조각에서 정의한 document_text와 details_to_extract 변수로 함수를 호출해요.
함수 내에서 요약할 문서, 추출할 세부 사항, 문서 요약을 위한 특정 지시를 포함하는 프롬프트가 클로드를 위해 생성돼요. 프롬프트는 클로드에게 XML 헤더 안에 중첩된 각 추출 세부 사항의 요약으로 응답하라고 지시해요.
코드가 요약의 각 섹션을 태그 안에 출력하기 때문에, 각 섹션은 후처리 단계로 쉽게 파싱할 수 있어요. 이 접근 방식은 각 요약이 같은 패턴을 따르도록 유스 케이스에 맞게 적응할 수 있는 구조화된 요약을 가능하게 해요.
프롬프트 평가하기
프롬프트는 프로덕션 준비가 되려면 종종 테스트와 최적화가 필요해요. 솔루션의 준비 상태를 판단하려면 정량적·정성적 방법을 결합한 체계적인 과정으로 요약 품질을 평가하세요. 정의한 성공 기준을 기반으로 강력한 경험적 평가를 만들면 프롬프트를 최적화할 수 있어요. 경험적 평가에 포함할 수 있는 지표는 다음과 같아요:
프롬프트 배포하기
솔루션을 프로덕션에 배포하면서 유의할 추가 고려 사항은 다음과 같아요.
-
책임 없음 보장: 요약의 오류가 조직이나 고객에게 법적 책임으로 이어질 수 있는 법적 영향을 이해하세요. 요약이 AI로 생성되었으며 법률 전문가가 검토해야 한다는 점을 명확히 하는 면책 조항이나 법적 공지를 제공하세요.
-
다양한 문서 유형 처리: 이 가이드는 PDF에서 텍스트를 추출하는 방법을 다뤄요. 실제 세계에서는 문서가 PDF, Word 문서, 텍스트 파일 등 다양한 형식으로 올 수 있어요. 데이터 추출 파이프라인이 받게 될 모든 파일 형식을 변환할 수 있게 하세요.
-
클로드로의 API 호출 병렬화: 토큰 수가 많은 긴 문서는 클로드가 요약을 생성하는 데 최대 1분이 걸릴 수 있어요. 대규모 문서 컬렉션의 경우 합리적인 시간 안에 요약을 완료하기 위해 클로드로의 API 호출을 병렬로 보내고 싶을 수 있어요. 병렬로 수행할 수 있는 최대 API 호출 수를 확인하려면 Anthropic의 요율 한도를 참고하세요.
성능 개선 (Improve performance)
복잡한 시나리오에서는 표준 프롬프트 엔지니어링 기법을 넘어 성능을 개선하기 위한 추가 전략을 고려하는 것이 도움이 될 수 있어요. 몇 가지 고급 전략:
메타 요약으로 긴 문서 요약하기
법률 요약은 종종 긴 문서나 여러 관련 문서를 한 번에 다뤄 클로드의 컨텍스트 창을 넘기 쉽다. 메타 요약(meta-summarization)이라는 청킹 방법을 사용해 이 유스 케이스를 처리할 수 있어요. 이 기법은 문서를 더 작고 관리 가능한 청크로 나눈 다음 각 청크를 별도로 처리하는 것이에요. 그런 다음 각 청크의 요약을 결합해 전체 문서의 메타 요약을 만들 수 있어요.
메타 요약 수행 예시:
# Initialize the Anthropic client
client = anthropic.Anthropic()
def chunk_text(text, chunk_size=20000):
return [text[i : i + chunk_size] for i in range(0, len(text), chunk_size)]
def summarize_long_document(
text, details_to_extract, model="claude-opus-5-5", max_tokens=1000
):
# Format the details to extract to be placed within the prompt's context
details_to_extract_str = "\n".join(details_to_extract)
# Iterate over chunks and summarize each one
chunk_summaries = [
summarize_document(
chunk, details_to_extract, model=model, max_tokens=max_tokens
)
for chunk in chunk_text(text)
]
final_summary_prompt = f"""
You are looking at the chunked summaries of multiple documents that are all related.
Combine the following summaries of the document from different truthful sources into a coherent overall summary:
<chunked_summaries>
{"".join(chunk_summaries)}
</chunked_summaries>
Focus on these key aspects:
{details_to_extract_str}
Provide the summary in bullet points nested within the XML header for each section. For example:
<parties involved>
- Sublessor: [Name]
// Add more details as needed
</parties involved>
If any information is not explicitly stated in the document, note it as "Not specified". Do not preamble.
"""
response = client.messages.create(
model=model,
max_tokens=max_tokens,
system="You are a legal expert that summarizes notes on one document.",
messages=[
{"role": "user", "content": final_summary_prompt},
],
)
return next(block.text for block in response.content if block.type == "text")
long_summary = summarize_long_document(document_text, details_to_extract)
print(long_summary)
summarize_long_document 함수는 문서를 더 작은 청크로 나누고 각 청크를 개별적으로 요약해 앞선 summarize_document 함수를 확장해요.
코드는 원본 문서 내의 20,000자 청크 각각에 summarize_document 함수를 적용해 이뤄져요. 그런 다음 개별 요약을 결합하고, 이 청크 요약들에서 최종 요약을 만들어요.
summarize_long_document 함수가 예시 PDF에는 엄밀히 필요하지 않다는 점에 주의하세요. 전체 문서가 클로드의 컨텍스트 창에 들어가기 때문이에요. 하지만 클로드의 컨텍스트 창을 넘는 문서나 여러 관련 문서를 함께 요약할 때는 필수가 돼요. 어쨌든 이 메타 요약 기법은 종종 앞선 단일 요약 접근에서 놓쳤던 추가적인 중요한 세부 사항을 최종 요약에 포착해요.
요약 색인 문서로 대규모 문서 컬렉션 탐색하기
LLM으로 문서 컬렉션을 검색하는 것은 보통 검색 증강 생성(RAG)을 수반해요. 하지만 대규모 문서가 관련되거나 정확한 정보 검색이 중요한 시나리오에서는 기본 RAG 접근으로 충분하지 않을 수 있어요. 요약 색인 문서(summary indexed documents)는 전통적인 RAG 방법보다 적은 컨텍스트를 사용해 검색용 문서 순위를 매기는 더 효율적인 방법을 제공하는 고급 RAG 접근이에요. 이 접근에서 먼저 클로드를 사용해 코퍼스의 각 문서에 대한 간결한 요약을 생성하고, 그다음 클로드를 사용해 던져진 쿼리에 대한 각 요약의 관련성을 순위 매겨요. 이 접근에 대한 자세한 내용과 코드 기반 예시는 요약 쿡북의 요약 색인 문서 섹션을 확인하세요.
클로드를 파인튜닝해 데이터셋에서 학습하기
클로드의 요약 생성 능력을 향상시키는 또 다른 고급 기법은 파인튜닝이에요. 파인튜닝은 법률 요약 요구와 정확히 일치하는 커스텀 데이터셋으로 클로드를 훈련시켜 클로드가 유스 케이스에 적응하도록 보장하는 것이에요. 파인튜닝 수행 방법 개요는 다음과 같아요:
-
오류 식별: 클로드의 요약이 부족한 사례(중요한 법적 세부 사항 누락, 컨텍스트 오해, 부적절한 법률 용어 사용 등)를 수집하는 것으로 시작해요.
-
데이터셋 큐레이션: 이러한 문제를 식별했으면 이런 문제 사례의 데이터셋을 컴파일해요. 이 데이터셋은 원본 법률 문서와 교정된 요약을 포함해야 해서, 원하는 동작을 클로드가 배우도록 보장해요.
-
파인튜닝 수행: 파인튜닝은 가중치와 파라미터를 조정하기 위해 큐레이션된 데이터셋으로 모델을 재훈련하는 것을 포함해요. 이 재훈련은 클로드가 법률 도메인의 특정 요구에 더 잘 적응하게 하고, 표준에 따라 문서를 요약하는 능력을 향상시켜요.
-
반복 개선: 파인튜닝은 일회성 과정이 아니에요. 클로드가 계속 요약을 생성함에 따라 저성과한 새 예시를 반복적으로 추가해 능력을 더 다듬을 수 있어요. 시간이 지남에 따라 이 지속적인 피드백 루프로 법률 요약 작업에 고도로 특화된 모델이 나와요.