[디지털데일리 백지영기자] 솔트룩스(대표 이경일)는 국립국어원의 ‘구어 자료 수집 및 원시 말뭉치 구축 사업’을 수주했다고 12일 밝혔다.
현재 주요 국가 공공 데이터세트 현황을 살펴보면 미국 25만2952건, 캐나다 8만1949건, 영국 5만1297건에 달한다. 이에 비해 한국은 2만9934건으로 미국의 1/9 수준이다. 특히 언어 데이터인 말뭉치 어절 보유량을 살펴보면 영어 2000억 어절, 중국어 800억 어절 대비 한국어 2억 어절로 영어의 1/1000에 불과하다.
이에 국립국어원은 TV, 라디오 등의 구어 원자료와 드라마, 연극 대본 등의 준구어 원자료를 수집하여 말뭉치를 구축하고, 저작권 이용 계약까지 체결하는 말뭉치 구축 사업을 추진한다.
솔트룩스는 이미 지난해 자체 말뭉치 구축 전문인력을 통해 품질순도 99.9%의 국립국어원 ‘국어 말뭉치 연구 및 구축 사업’을 수행한 경험이 있다. 이를 바탕으로 인공지능(AI) 산업 발전을 위한 대규모 고품질 우리말 자원 구축을 진행할 예정이다.
솔트룩스 이경일 대표는 “자체 보유한 AI 원천 기술력과 AI 서비스 개발 경험을 통해 성공적으로 사업을 수행하겠다”고 강조했다.
<백지영 기자>jyp@ddaily.co.kr
Copyright ⓒ 디지털데일리. 무단전재 및 재배포 금지
유료방송-FAST 新 협력모델 제안…“통합 에코시스템 구축 필요”
2025-04-19 17:37:27[AI시대, ICT 정책은②] 네트워크 준비지수 5위인데…우리 정부는 준비됐나
2025-04-19 08:00:00[DD퇴근길] 이마트 옆 다이소 옆 이케아…서울 '강동' 격전지로
2025-04-18 17:48:11넷플릭스 1분기 27%↑ 영업익 4조원…韓 ‘폭싹속았수다’ 흥행 언급도
2025-04-18 16:24:08[AI시대, ICT 정책은①] ‘정부주도→민간주도’…“인프라 위한 해외자본 유치 필수” 의견도
2025-04-18 15:28:56네이버, 좌표찍기 알림 공지 시스템 도입…최수연 "이달 내 적용"
2025-04-18 19:04:20구글, 美 ‘반독점’ 재판서 유죄 판결… '사실상 해체' 위기 직면
2025-04-18 18:04:23[DD퇴근길] 이마트 옆 다이소 옆 이케아…서울 '강동' 격전지로
2025-04-18 17:48:11“무료 체험 뒤 몰래 결제?”…다크패턴, 근절 방안 마련한다
2025-04-18 16:23:01위믹스, 1차 바이백 중간경과 보고… 해킹 탈취 물량 바이백 완료
2025-04-18 14:27:08