문자열 인코딩
문자열 인코딩 (String encoding)
Octave는 내부적으로 UTF-8 인코딩을 사용해요. 외부 시스템이나 파일과 데이터를 주고받을 때는 다른 코드 페이지(codepage)와의 변환이 필요한 경우가 있는데, 그때 unicode2native와 native2unicode 함수를 써요.
출처: 문서
본문
unicode2native
native_bytes = unicode2native (utf8_str, codepage)
native_bytes = unicode2native (utf8_str)
codepage를 사용해 UTF-8 문자열 utf8_str을 바이트 스트림으로 변환해요.
문자 벡터 utf8_str은 codepage로 주어진 코드 페이지를 사용해 바이트 스트림 native_bytes로 변환돼요. codepage 문자열은 유효한 코드 페이지의 식별자여야 해요. 유효한 코드 페이지의 예는 "ISO-8859-1", "Shift-JIS", "UTF-16" 등이에요. 지원되는 코드 페이지 목록은 https://www.gnu.org/software/libiconv에서 확인할 수 있어요.
codepage를 생략하거나 비우면 시스템 기본 코드 페이지가 사용돼요. 어떤 문자가 코드 페이지 codepage에 매핑될 수 없으면 그 문자는 해당 코드 페이지에 맞는 대체 시퀀스로 바뀌어요.
참고: native2unicode.
native2unicode
utf8_str = native2unicode (native_bytes, codepage)
utf8_str = native2unicode (native_bytes)
codepage를 사용해 바이트 스트림 native_bytes를 UTF-8로 변환해요.
벡터 native_bytes의 숫자는 반올림되고 0에서 255 사이의 정수로 잘려요. 이 바이트 스트림은 문자열 codepage가 주는 코드 페이지로 매핑된 뒤 utf8_str 문자열로 반환돼요. Octave는 내부 인코딩으로 UTF-8을 사용해요.
codepage 문자열은 유효한 코드 페이지의 식별자여야 해요. 유효한 예는 "ISO-8859-1", "Shift-JIS", "UTF-16" 등이에요. 지원되는 코드 페이지 목록은 https://www.gnu.org/software/libiconv에서 확인할 수 있어요. codepage를 생략하거나 비우면 시스템 기본 코드 페이지가 사용돼요.
native_bytes가 문자열 벡터라면 그대로 반환돼요. 참고: unicode2native.
더 알아보기
- 문자열과 수치 데이터의 관계는 Numerical Data and Strings 절을 참고하세요.
- 문자열 변환 함수는 Converting Strings 절에서 함께 다뤄요.