[디지털데일리 백지영기자] 솔트룩스(대표 이경일)는 국립국어원의 ‘구어 자료 수집 및 원시 말뭉치 구축 사업’을 수주했다고 12일 밝혔다.
현재 주요 국가 공공 데이터세트 현황을 살펴보면 미국 25만2952건, 캐나다 8만1949건, 영국 5만1297건에 달한다. 이에 비해 한국은 2만9934건으로 미국의 1/9 수준이다. 특히 언어 데이터인 말뭉치 어절 보유량을 살펴보면 영어 2000억 어절, 중국어 800억 어절 대비 한국어 2억 어절로 영어의 1/1000에 불과하다.
이에 국립국어원은 TV, 라디오 등의 구어 원자료와 드라마, 연극 대본 등의 준구어 원자료를 수집하여 말뭉치를 구축하고, 저작권 이용 계약까지 체결하는 말뭉치 구축 사업을 추진한다.
솔트룩스는 이미 지난해 자체 말뭉치 구축 전문인력을 통해 품질순도 99.9%의 국립국어원 ‘국어 말뭉치 연구 및 구축 사업’을 수행한 경험이 있다. 이를 바탕으로 인공지능(AI) 산업 발전을 위한 대규모 고품질 우리말 자원 구축을 진행할 예정이다.
솔트룩스 이경일 대표는 “자체 보유한 AI 원천 기술력과 AI 서비스 개발 경험을 통해 성공적으로 사업을 수행하겠다”고 강조했다.
<백지영 기자>jyp@ddaily.co.kr
Copyright ⓒ 디지털데일리. 무단전재 및 재배포 금지
“해외서도 응급의료 상담 가능”…LGU+, 소방청과 '안전·연결' 캠페인 진행
2025-05-11 12:00:00[OTT레이더] 강하늘X고민시의 쓰리스타 로맨스, 넷플릭스 '당신의 맛'
2025-05-11 11:54:28SKT 유심 교체 고객 143만명…6월 말까지 1077만장 유심 확보
2025-05-11 11:54:16SKT, '유심 교체' 대신 '유심 재설정' 도입…"티머니·금융인증서 교체 필요 X"
2025-05-11 10:00:08[현장]“어르신, 온라인 예약 하셨어요?”...SKT 유심교체 방문해보니
2025-05-10 07:07:00[DD퇴근길] 김영섭號 KT, 통신 다음은 AI…"MS 협력 성과 가시화"
2025-05-09 17:25:15[툰설툰설] '파격'과 '격정'의 콜라보…개꿈 vs 사랑하는 나의 억압자
2025-05-11 15:07:38[네카오는 지금] 1분기 엇갈린 성적표…AI 전략으로 반전 노린다
2025-05-11 15:07:16[인터뷰] 의사 가운 벗고 AI 입다…실리콘밸리 홀린 ‘피클’
2025-05-11 11:55:43[IT클로즈업] 오프라인은 힘든데…네카오 커머스 1분기 호실적 비결은
2025-05-11 11:37:17국내 플랫폼 다 죽는다…"공정거래법 개정안, 경쟁력 약화할 것"
2025-05-09 19:09:38