Cohere의 텍스트 생성 소개
Cohere의 텍스트 생성 소개
대규모 언어 모델이 텍스트 출력을 어떻게 생성하는지 설명하는 문서예요. 모델의 학습 방식과 텍스트 생성 원리를 쉽게 풀어드릴게요.
출처: 문서
본문
대규모 언어 모델은 많은 이유로 인상적이지만, 그중에서도 가장 두드러진 것은 텍스트를 빠르게 생성하는 능력이에요. 약간의 프롬프트만으로도 개념 설명, 블로그 포스트, 웹 카피, 시(詩), 그리고 거의 모든 것을 만들어낼 수 있죠. 그 스타일은 어린이와 성인, 기술 전문가와 일반인 모두에게 적합하게 조정할 수 있고, 수십 가지의 서로 다른 자연어로 작업하도록 요청할 수도 있어요.
이 문서에서는 이 기능을 가능하게 하는 기본적인 것들을 다룰 거예요. 더 실습적인 내용으로 바로 건너뛰고 싶다면 "Chat API 사용하기"를 확인해 보세요.
대규모 언어 모델은 어떻게 학습되나요?
많은 기술적 복잡성을 생략하면, 대규모 언어 모델은 이전에 나온 토큰들이 주어졌을 때 다음 토큰을 예측하도록 학습된 신경망일 뿐이에요. "잠깐만, 안에 들어가서 내 \\\_를 가져와야 해" 같은 문장을 생각해 보세요. 자연어 사용 경험이 풍부한 인간으로서 여러분은 추가 컨텍스트가 없어도 이 문장을 완성할 토큰에 대해 합리적인 추측을 할 수 있어요:
- "잠깐만, 안에 들어가서 내 **가방(bag)**을 가져와야 해."
- "잠깐만, 안에 들어가서 내 **열쇠(keys)**를 가져와야 해."
- 등등.
물론 다른 가능성들도 그럴듯하지만 덜 가능성 있는 것들이 있어요:
- "잠깐만, 안에 들어가서 내 **친구(friend)**를 가져와야 해."
- "잠깐만, 안에 들어가서 내 **책(book)**을 가져와야 해."
그리고 기술적으로는 문법적으로 맞지만 실제 대화에서는 거의 발생하지 않는 긴 꼬리(long-tail)의 가능성도 있죠:
- "잠깐만, 안에 들어가서 내 **기린(giraffe)**을 가져와야 해."
여러분은 평생 언어를 사용해 왔기 때문에 이런 문장이 어떻게 끝날지 직관적으로 알 수 있어요. Command R+ 같은 모델은 수십억 개의 토큰 시퀀스를 보고 이들의 통계적 분포를 파악해 다음에 무엇이 올지 예측할 수 있게 되면서, 같은 위업을 수행하는 방법을 배워야 합니다.
일단 그렇게 되면 모델은 "양자 컴퓨팅에 관한 블로그 포스트 제목을 몇 개 만들어 줘" 같은 프롬프트를 받고, 학습된 분포를 사용해 그러한 요청 뒤에 올 것이라고 생각하는 토큰 시퀀스를 생성할 수 있어요. 토큰을 생성하는 AI 시스템이기 때문에 "생성형 AI(generative AI)"라고 불리며, Cohere 모델처럼 강력한 모델에서는 결과가 놀랍도록 좋은 경우가 많아요.
더 알아보기(Learn More)
당사 문서의 나머지 "텍스트 생성(Text Generation)" 섹션은 Cohere 모델을 사용하는 방법을 안내해요. "Chat API 사용하기"를 확인해 설정 방법과 응답이 어떤 형태인지 이해하거나, 스트리밍 가이드를 읽고 생성형 AI를 스트리밍 애플리케이션에 통합하는 방법을 알아보세요.
검색 증강 생성(retrieval-augmented generation), 도구 사용(tool-use), 에이전트 구축(agent-building) 가이드를 읽는 것도 도움이 될 거예요.