Upwork 고객사 (비공개)소프트웨어 회사 · Upwork 프로젝트2024–2025단독 엔지니어, SDK로 납품
AI가 지어낸 주장을 사용자보다 먼저 잡아내기
별 5개, 1만 8천 달러, 그리고 어떤 파이프라인에도 끼울 수 있는 컴포넌트.
AI 답변을 주장 하나하나로 쪼개고, 각 주장을 참조 문서와 대조한 뒤, 정확히 틀린 주장들만 중심으로 답변을 다시 씁니다.
기간2024년 11월 – 2025년 3월
평가별 5개, $18K
납품 형태Python SDK, wheel + sdist
평가 방법합성 환각 주입, 혼동 행렬 채점
필요했던 것
고객사 제품은 참조 문서로 질문에 답했는데, 답변에 문서가 말한 적 없는 내용이 섞이곤 했습니다. 어느 문장이 틀렸는지를 자동으로 알아야 했고, 답변을 버리는 대신 고쳐야 했습니다.
만든 것
답변을 주어–서술어–목적어 주장으로 바꾸고 각 주장을 참조와 대조하는 파이프라인. 너무 많이 실패하면 정확한 실패 지도를 붙여 다시 생성시켜서, 다시 쓴 답변은 틀린 것만 고치고 맞는 것은 지킵니다. 고객사가 자기 데이터로 측정할 수 있도록 기준선과 평가 키트가 딸린 설치형 SDK로 납품했습니다.
달라진 것
고객사는 별 5개 평가를 남겼습니다. 이 컴포넌트는 이식 가능합니다. 참조 텍스트가 있는 어떤 질의응답 시스템에도 끼울 수 있습니다.
기술적으로는
주장별 판정: 답변의 각 트리플렛을 모든 참조 트리플렛과 한 번의 제한된 LLM 요청으로 대조. 출력은 triplet_idx:result로 강제하고 판정 지도로 병합.