← 전체 프로젝트

팜한농 (FarmsAll)LG 계열 · 농업2025–2026음성 스택 전체. 데이터, 모델, 서빙, 검수 플랫폼

실제 농업 통화에서 상용 API를 이기는 음성인식

고객사 통화의 1%로 학습했습니다. 나머지 99%가 로드맵입니다.

컨설턴트의 전화 통화가 영농일지와 컨설팅 보고서가 됩니다. 실제 농업 통화에서 파인튜닝한 엔진은 글자 오류 10.45%, 국내 1위 상용 음성 API는 16.39%입니다.

  • 농업 통화10.45% CER · 상용 API 16.39% · 기본 모델 16.18%
  • 일상 대화7.16% · 상용 API 7.33%. 잃은 것 없음
  • 학습 데이터검토한 약 14,000시간 중 약 1,300시간 선별, + 고객사 통화 471건
  • 서빙B200 4장, vLLM, 배치 / 스트리밍 / 화자 분리

필요했던 것

컨설턴트는 하루 종일 농민과 전화합니다. 그 통화에 영농일지와 상담 보고서에 들어가야 할 사실이 있습니다. 그런데 범용 음성인식은 작물명, 농약명, 상표명, 지역 용어를 엉망으로 받아 적었고, 사용자는 전사 결과를 믿지 않게 됐습니다. 기성 엔진은 뉴스와 스튜디오 대화에서 점수를 잘 받도록 학습되어 있습니다. 휴대전화로 하는 농업 통화에 맞춰 최적화하는 곳은 없습니다.

만든 것

네 부분입니다. 팀이 전사를 고치고 학습 데이터를 만드는 사람 검수 플랫폼. 회사 GPU에서 서빙되는, 화자 분리가 붙은 파인튜닝 음성 모델. 인식된 용어를 엔진에 힌트로 되돌려 주는 56,000개 농업 용어 사전. 그리고 다른 모든 시스템이 부르는 게이트웨이: 배치 또는 스트리밍, 화자 라벨 유무 선택. 그 뒤에서 전사 결과가 보고서 코파일럿으로 흘러갑니다.

달라진 것

고객사의 실제 통화 2,354문장으로, 모든 엔진에 같은 채점 규칙을 적용해 측정했습니다. 우리 엔진: 글자 오류율 10.45%. 국내 1위 상용 음성 API: 16.39%. 출발점이었던 오픈소스 모델: 16.18%. 일상 대화에서는 상용 API와 같은 수준(7.16% 대 7.33%)이고, 공개 휴대전화 녹음에서는 앞섭니다(10.54% 대 11.56%). 업계에서 흔히 말하는 기준으로 20% 언저리는 “쓸 수 있지만 다시 확인”, 10% 언저리는 “믿을 수 있음”입니다. 고객사는 녹음된 통화의 약 1%만 라벨링하고 첫 번째 구간에서 두 번째 구간으로 옮겨 갔습니다.

기술적으로는
  • 데이터: 공개 한국어 음성 코퍼스 8종(약 14,000시간)을 검토, 약 11,000시간을 라이선스·정제, 약 1,300시간(약 91만 문장)을 학습에 사용. 전화 채널 녹음 비중을 35%로 올렸는데, 양이 아니라 이 비율이 숫자를 움직였음. 전화 녹음은 채널 지문으로 검증. 여기에 고객사 통화 471건(약 9시간): 약 7시간은 학습, 93건(약 2시간)은 고정 심사 세트로 따로 보관.
  • 합격 기준: 모든 후보 엔진을 같은 고객사 통화 심사 세트로 판정. 일상 대화 성능은 0.3점 이상 떨어지면 안 됨.
  • 확장 근거: 같은 학습량에서 고객사 통화를 99건에서 347건으로 늘리자 오류가 12.7%에서 11.3%로. 두 배마다 약 0.7점. 아직 라벨링하지 않은 고객사 통화가 약 1,000시간. 전부 쓰면 약 7%, 용어 사전과 후처리까지 하면 5%로 예상.
  • 모델과 서빙: B200 4장에서 Qwen3-ASR 파인튜닝과 pyannote 화자 분리, OpenAI 호환 /v1/audio/transcriptions 인터페이스 뒤에서 vLLM으로 서빙. 모드: 배치, 스트리밍, 화자 분리, 화자 분리 스트리밍.
  • 검수 플랫폼: TypeScript 모노레포(NestJS, Postgres, S3), 커밋 771건. API, 워커, 웹 앱이 공유하는 텍스트 교정 패키지.
  • 측정 위생: 모든 엔진에 같은 정규화(문장 부호 제거, 숫자 표기 통일, 띄어쓰기 무시). 심사 세트의 띄어쓰기 불일치만으로 1.7점이 왔다 갔다 했기 때문에, 대량 라벨링 전에 전사 지침을 먼저 고정. 2,354발화로 측정한 후처리 엔진은 아무것도 더하지 않았고, 그렇게 기록.
  • 정리: 체크포인트 정리로 GPU 스토리지 9.7 TiB 회수.
세 종류 음성의 글자 오류율. 우리 엔진, 상용 API, 오픈소스 기본 모델
2026년 9월 24일 측정, 학습에 쓰지 않은 음성, 모든 엔진에 같은 정규화 적용
녹음에서 보고서까지의 음성 파이프라인 다이어그램
녹음에서 보고서까지의 파이프라인
음성 라벨링 플랫폼
학습 데이터를 만드는 사람 검수 플랫폼
  • Qwen3-ASR
  • pyannote
  • vLLM
  • FastAPI
  • NestJS
  • PostgreSQL
  • S3