[한국공공정책신문=김유리 기자]
◇ 자동 음성인식의 개념
자동 음성인식(ASR)은 컴퓨터가 인간의 음성을 이해하고 문자로 변환하는 기술이다. 이 기술은 음성입력을 사용하여 디지털 데이터를 생성하는 프로세스를 지원한다. 일상생활에서는 스마트폰의 음성 어시스턴트(assistant)나 음성입력 기능으로 자주 볼 수 있다.
*자동 음성인식(Automated Speech Recognition, ASR)이란 인간이 하는 말을 기계가 인식하는 과정을 말한다. 이 프로세스에서는 알고리즘을 사용하여 인간의 음성을 기계가 이해할 수 있는 텍스트로 변환한다. ASR의 성능은 인간과 기계 간에 음성 기반 커뮤니케이션을 가능하게 하는 것을 목적으로 한 다양한 기술에 중요시되는 기능이다.
◇ ASR의 구조
① 음성 수집이다. 음성인식 과정은 마이크로폰이나 녹음 장치를 사용하여 음성을 수집하는 것부터 시작한다. 음성은 아날로그 신호로 받아들여진다. ② 음성의 디지털화다. 수집된 음성은 디지털 신호로 변환되어 컴퓨터가 처리할 수 있는 형식이 된다. ③ 음성의 해석이다. 디지털 음성신호는 음향 모델이라고 불리는 통계 모델을 사용하여 해석한다. 음향모델은 음성 음소(음의 기본 단위)를 식별하는 데 도움이 된다. ④ 텍스트 생성이다. 음향모델이 음소를 식별한 후 언어모델을 사용하여 이러한 음소를 단어나 문구로 변환한다. 최종적으로 음성이 텍스트로 표시된다.
◇ ASR의 응용
① 음성 어시스턴트이다. 스마트폰이나 스마트 스피커에 탑재되어 있는 음성 어시스턴트(예, Sir, Google Assistant)는 ASR 기술을 이용하여 사용자의 음성 지시를 이해하고 대응한다. ② 자동 문자 깨우기다. 회의나 인터뷰의 음성을 텍스트로 변환하기 위한 자동 문자 깨우기 툴도 ASR을 이용하고 있다. 수동으로 문자를 일으키는 수고를 줄일 수 있다. ③ 음성 조작이다. 차량 내비게이션 시스템이나 가정용 전자제품 등에서 음성으로 조작하는 기능도 ASR 기술을 사용하고 있다.
*Siri는 Apple의 iOS와 iPadOS, macOS, watchOS, tvOS등 Apple의 소프트웨어 탑재 기기들 전반에서 작동하는 인공지능 개인 비서 응용 프로그램이다. 기본 호출 명령어는 “Hey Siri”, “Siri야”이다. 이외에도 이탈리아어로 설정하면 Ehi Siri로, 덴마크어로 바꾸면 Hej Siri로 바뀌는 등 여러 번역이 있다.
◇ ASR의 장점과 과제
첫째, 장점으로는 ① 효율적인 조작이다. 손을 사용하지 않고 조작할 수 있기 때문에 효율적으로 작업을 진행할 수 있다. ② 접근성 향상이다. 시각이나 손이 불편한 사람들에게도 편리한 기능을 제공한다. 둘째, 과제로는 ① 인식 정확도다. 소음이 많은 환경이나 악센트, 발음의 차이로 인해 인식 정확도가 저하될 수 있다. ② 프라이버시의 염려다. 음성 데이터가 수집되기 때문에 개인정보 보호 문제가 발생할 수 있다.
*음성 데이터는 프라이버시와도 관련되기 때문에 사용자 측만의 형편으로 이용ㆍ활용할 수 없다고 하는 과제도 있다. 이는 얼굴인증 등과도 마찬가지다.
결국, 자동 음성인식(ASR)은 음성을 문자로 변환하는 중요한 기술로 우리의 일상생활이나 비즈니스에 큰 영향을 주고 있다. 음성 어시스턴트나 자동 문자 깨우기 툴 등 많은 응용이 있어, 그 편리성과 효율성을 제공하고 있다. 다만, 인식 정밀도나 프라이버시에 관한 과제도 존재지만, 기술의 진화에 따라 이러한 문제도 개선되고 있다.
이 규 철 / 법학박사(상법)
∙ ‘100세대학TV’ 크리에이터 및 전문강사
∙ AI·GPT, SDGs&ESG코칭 및 전문강사
∙ 생성AI와 챗GPT, SDGs·ESG경영전략,
글로벌 MBAtoCEO, 리더의 필승전략,
100세대학 행복디자인 매뉴얼 등 27권
∙ 일본(와세다대),중국(복단대·화동정법대)






