AI 엔지니어 · 8년 · 투윅스 대표

2주면,아이디어를 바로 쓸 수 있는 AI로만들어 드립니다.

기능 뒤에 있는 시스템을 만듭니다. 데이터, 모델, 검증 장치, 그리고 이를 담는 서비스까지. 첫 상담부터 운영까지 한 사람이 맡고, 2주마다 직접 써볼 수 있는 결과로 보여드립니다.

  • 100만명+제가 만든 AI의 누적 사용자
  • 7,000억원+제가 만든 AI가 돕는 연간 사업 규모
  • 36%제가 개발한 모델의 평균 성능 향상
  • 2주아이디어에서 프로토타입까지

AI를 도입하라는데, 왜 매번 제자리일까요?

  • 01

    어디서부터 시작할지 모르겠다

    AI로 뭘 할 수 있는지는 많이 듣지만, 우리 회사 업무에 어떻게 붙일지는 누구도 구체적으로 말해주지 않습니다.

  • 02

    데모는 되는데 현장에서는 안 된다

    시연 때 그럴듯했던 챗봇이 실제 고객 질문과 실제 데이터 앞에서는 엉뚱한 답을 합니다.

  • 03

    끝나면 아무것도 남지 않는 외주

    납품이 끝나면 코드도, 문서도, 운영 노하우도 외주사에만 남아 있습니다.

  • 04

    근거를 알 수 없는 견적

    왜 이 금액인지, 무엇을 빼면 얼마가 줄어드는지 설명 없는 견적서만 받습니다.

되는 것만 약속하고, 2주마다 보여드립니다.

  1. 01

    현장 데이터로 먼저 검증

    실제 문서, 통화, 데이터로 작은 버전을 먼저 만들어 보고, 효과가 확인된 기능만 본 개발로 가져갑니다.

  2. 02

    2주마다 작동하는 결과

    보고서가 아니라 직접 눌러볼 수 있는 결과물로 진행 상황을 공유합니다.

  3. 03

    기능별로 투명한 견적

    무엇에 얼마가 드는지 기능별로 보여드립니다. 필요 없는 기능은 빼고 필요한 만큼만 맡기시면 됩니다.

제가 만들어 드리는 것.

여덟 가지, 모두 실제로 납품해 본 것들입니다. 카드를 누르면 어떻게 만드는지와 어디에 적용했는지가 나옵니다.

RAG · 검색 증강 생성

사내 문서를 읽고 답하는 AI 비서

직원이 평소 말로 물으면, AI가 회사 문서를 직접 읽고 출처를 보여주며 답합니다. 답변을 바탕으로 회신 초안 작성, 양식 채우기, 티켓 열기까지 이어서 할 수 있습니다. 근거가 없으면 없다고 말합니다.

  • RAG
  • 하이브리드 검색
  • 출처 표시
  • 스트리밍 채팅
  • 카카오톡/Slack

연 매출 7,000억 원 규모 기업의 실제 서비스 앱 안에서 운영 중입니다.

어떻게 만드나닫기

받으시는 것. 문서(PDF, 워드, 엑셀, 슬라이드, 한글 오피스 형식, 스캔본)를 읽어 들이는 파이프라인, 의미와 키워드를 함께 쓰는 검색 층, 그리고 출처를 달아 답하는 채팅 화면(웹 또는 메신저 안). 접근 권한, 기억, 고객사 인프라 배포는 추가 옵션이 아니라 기본입니다.

정직하게 만드는 방법. 출시 전에 실제 질문 목록과 “일 잘하는 직원이라면 이렇게 답한다”는 기준 답변을 함께 정합니다. AI는 그 목록으로 채점되고, 이후 바뀔 때마다 다시 채점됩니다. 출처 없는 답은 답이 아니며, 시스템이 그렇게 말합니다.

기술 용어로는. 검색 증강 생성(RAG): 의미 단위 청킹, 벡터 + 키워드 하이브리드 검색과 리랭킹, 출처가 달린 답변, 스트리밍 채팅, LLM 심사 모델로 채점하는 평가 세트.

GraphRAG · 지식 그래프

전문 분야 지식을 담은 지식 그래프

작물과 처방, 부품과 고장, 규정과 사례처럼 지식이 "무엇이 무엇과 이어지는가"에 관한 것이라면, 문서 검색이 답하지 못하는 질문을 그래프가 답합니다.

  • Neo4j
  • LLM 추출
  • text-to-Cypher
  • 전문가 검수 루프

대기업 계열사에 온톨로지, 추출 파이프라인, 데이터베이스, 그 위의 에이전트까지 만들어 납품했습니다.

어떻게 만드나닫기

받으시는 것. 고객사 전문가와 함께 설계한 스키마, 문서를 그래프로 바꾸면서 품질을 관리하는 추출 파이프라인(모순은 표시하고, 사람이 결정한 사례를 기준으로 해소), 빌드·스냅샷·초기화 도구가 딸린 데이터베이스, 그리고 그래프에 자연어로 묻는 비서. 인도 후 고객사 팀이 직접 확장할 수 있도록 방법론 문서까지 드립니다.

대부분의 업체가 이걸 보여주지 못하는 이유. 어려운 부분은 데이터베이스가 아니라, 품질을 측정하면서 데이터를 만드는 일입니다. 그 구축을 실제 서비스에서 해 본 것이 제 경력입니다.

기술 용어로는. GraphRAG: 온톨로지 설계, 품질 관리가 붙은 LLM 추출, Neo4j 다중 데이터베이스, text-to-Cypher 에이전트, 그래프 + 벡터 하이브리드 검색.

AI 에이전트 · 멀티에이전트

조사하고 쓰는 AI 에이전트, 승인은 사람이

한 업무를 AI 에이전트 팀이 조사, 평가, 초안 작성까지 맡고, 밖으로 나가기 전에 사람이 승인합니다.

  • LangGraph
  • CrewAI
  • 승인 관문
  • 재개 가능한 실행
  • 에이전트별 비용

FederationLabs의 수출 바이어 보고서가 운영 중이고, STIA에는 승인 관문 2개가 있는 20개 에이전트 마케팅 파이프라인을 만들었습니다.

어떻게 만드나닫기

받으시는 것. 시장 조사, 바이어 평가, 캠페인 전략, 제안서 초안 같은 한 업무를 전문 에이전트들의 파이프라인으로 설계합니다. 검증 단계가 붙습니다: 실제 데이터에 근거 대기, 초안을 고치는 비평 에이전트, 사람이 눌러야 넘어가는 승인 관문. 결과는 느슨한 텍스트가 아니라 정형 레코드로 고객사 DB에 들어갑니다.

제가 고집하는 것. 긴 실행은 중간에 죽어도 이어서 돌아가야 합니다. 승인은 프롬프트가 아니라 코드로 강제해야 합니다. 모든 모델 호출에 비용이 붙어야 합니다. 이 세 가지가 에이전트 시스템을 1년 뒤에도 쓸 수 있게 만듭니다.

기술 용어로는. AI 에이전트와 LLM 워크플로: 메모리, 도구 사용, 가드레일, 멀티에이전트 오케스트레이션(LangGraph, CrewAI), 다단계 비즈니스 로직과 정형 출력을 위한 결정적 파이프라인, human-in-the-loop 관문, 재개 가능한 실행.

LLM 워크플로 · 문서 생성

회사 양식 그대로 완성되는 문서

녹음, PDF, 웹 데이터, 교육과정 같은 원본 자료를 회사 템플릿에 맞는 진짜 파워포인트·워드·엑셀 파일로 만듭니다. 열자마자 바로 편집할 수 있습니다.

  • PPTX/DOCX/XLSX 생성
  • OCR
  • 음성 전사
  • 스키마 검증 출력

망고팩토리에서 유료 이용 교사들에게 수업 슬라이드를, 농업 기업에는 통화 녹음으로 컨설팅 보고서를 만들어 줍니다.

어떻게 만드나닫기

받으시는 것. 지저분한 입력(스캔본, 한글 오피스 형식, 음성)을 읽는 수집 단계, 회사 템플릿을 그 자리에서 채워 브랜딩과 레이아웃이 그대로 살아남는 생성 단계, 의미로 고르는 이미지 선택, 이메일·저장소·앱 안으로의 전달. 정형 출력은 파일로 쓰기 전에 스키마로 검증해서, 잘못된 생성은 조용히 나가지 않고 크게 실패합니다.

이것이 아닌 것. 마크다운을 슬라이드에 붙여 넣은 것이 아닙니다. 팀이 원래 만들던 것과 같은 종류의 파일이 나옵니다. 더 빠를 뿐입니다.

기술 용어로는. 스키마 검증 정형 출력이 있는 LLM 워크플로, 제자리 PPTX / DOCX / XLSX 생성, 수집용 OCR과 음성 전사, 의미 기반 이미지 검색.

LLM 파인튜닝 · 모델 배포 · 음성 AI

직접 학습시켜 직접 배포하는 자체 모델

API가 너무 비싸거나, 느리거나, 부정확하거나, 데이터를 밖에 보낼 수 없을 때. 고객사 데이터로 모델을 학습시키고 고객사 장비에 배포합니다. 학습과 서빙 둘 다, 텍스트와 음성 둘 다.

  • LoRA / 전체 파인튜닝
  • vLLM / ONNX 서빙
  • 음성인식
  • 화자 분리
  • GPU + CPU 배포
  • 라벨링 도구

100만 명이 쓰는 서비스에서 자체 모델이 GPT-4를 대체했고, 실제 농업 통화에서 상용 API가 16.39% 틀릴 때 파인튜닝한 음성인식은 10.45% 틀립니다.

어떻게 만드나닫기

파인튜닝. 문서, 로그, 녹음에서 시작하는 데이터 파이프라인과, 필요하면 고객사 팀이 학습 데이터를 만드는 라벨링 도구. 기반 모델 선택(오픈 웨이트 LLM, 음성 모델), GPU 클러스터에서 LoRA 또는 전체 파인튜닝, 그리고 지금 쓰는 API와 고객사 테스트셋으로 비교한 평가. 바꿀지 말지가 의견이 아니라 종이 위의 숫자로 결정됩니다. API가 이기면 그렇게 말씀드립니다.

배포. 고객사 인프라에서 돌아가는 모델: vLLM 또는 ONNX Runtime, GPU 또는 CPU, 컨테이너로, OpenAI 호환 엔드포인트 뒤에. 애플리케이션은 URL만 바꾸면 됩니다. 배치와 스트리밍 모드, 수지가 맞는 곳엔 오토스케일링, 모니터링, 다음 버전도 같은 방식으로 나가는 CI/CD. 요청당 비용과 지연 시간은 전후로 측정합니다.

기술 용어로는. 성능·비용·프라이버시 제약을 위한 LLM 파인튜닝(LoRA, 전체)과 자체 모델 학습, 도메인 적응 STT·화자 분리·스트리밍 전사(GPU 클러스터), OpenAI 호환 인터페이스의 vLLM·ONNX Runtime 서빙.

LLM 평가 · 최적화 · MCP · 에이전트 하네스

AI를 측정 가능하게, 그리고 꾸준히 낫게

"잘 안 되는데 왜인지 모르겠다"를 숫자로 바꾸고, 릴리스마다 그 숫자를 올리는 평가·최적화 루프로 만듭니다. 제 모델을 세계 최고 성능까지 끌어올린 것과 같은 루프입니다.

  • 평가 하네스
  • 최적화 루프
  • LLM 심사
  • 환각 탐지
  • MCP 서버
  • 에이전트 하네스

이 루프로 만든 채점 모델이 논문으로 세계 최고 성능을 기록했고, 사실 검증 SDK 프로젝트는 별 5개 평가를 받았습니다. 제 자동 에이전트 러너는 매일 돌아갑니다.

어떻게 만드나닫기

측정. 고객과 합의한 기준, 채점된 데이터셋, 심사 모델, 버전이 붙은 리포트로 이루어진 평가 프레임워크. CI에 연결된 회귀 테스트가 있어서 모델이나 프롬프트를 바꿔도 운영 성능이 조용히 떨어질 수 없습니다. 문제가 지어낸 주장이라면, 주장 단위로 대조하는 사실 검증 컴포넌트를 붙입니다.

최적화. 그다음이 루프입니다. 실패 사례를 분석하고, 한 번에 하나만 바꾸고(프롬프트, 검색, 데이터, 파인튜닝), 다시 재고, 숫자가 움직인 것만 남기고, 안 움직인 것도 기록합니다. 성능이 운이 아니라 일정에 따라 좋아지는 방법입니다. 에세이 채점 모델을 100만 명이 쓰기 전에 세계 최고 성능으로 만든 것도 같은 루프였습니다.

무인 운영. 목표가 자율 실행이라면: 고객사 데이터와 도구 위의 MCP 서버, 권한 규칙이 있는 하네스, 잠금·타임아웃·제한된 재시도·비용 상한·실행당 한 번의 종합 알림이 있는 스케줄 러너.

뒤에 있는 규칙. 검증은 별도 프로세스에서 다른 모델로 돌립니다. 자기 일을 자기가 검토하는 시스템은 자기 실수를 놓치기 때문입니다.

기술 용어로는. 평가 하네스, LLM 심사 채점, 환각 탐지, 오류 분석 기반 최적화; 고객사 데이터와 API를 에이전트 도구로 노출하는 MCP 서버; 스케줄링·재시도·권한·human-in-the-loop를 갖춘 에이전트 하네스.

엔드투엔드 개발 · 풀스택

AI만이 아니라 제품 전체

프론트엔드, 백엔드, 데이터베이스, 배포. 아직 개발팀이 없으신가요? AI를 둘러싼 제품까지 만들고, 나중에 팀이 이어받을 수 있는 형태로 넘겨드립니다.

  • React / Next.js
  • FastAPI / NestJS
  • PostgreSQL / Supabase
  • Docker
  • AWS / GCP
  • CI/CD

망고팩토리는 혼자서 5개월 만에 처음부터 끝까지 만든 유료 SaaS이고, LG 계열사에는 작물 모니터링 대시보드와 게이트웨이를 만들었습니다.

어떻게 만드나닫기

받으시는 것. 바로 쓸 수 있는 제품: 고객이 로그인하는 앱, 그 뒤의 백엔드와 데이터베이스, 필요하면 결제와 내보내기, 고객사 클라우드 배포까지. 전체를 혼자 출시해 본 사람이 만들기 때문에, 아직 없는 팀을 AI가 기다릴 필요가 없습니다.

기술 용어로는. React, Next.js 또는 Svelte 프론트엔드; FastAPI 또는 NestJS 백엔드; PostgreSQL, Supabase 또는 Firestore; Docker, AWS 또는 GCP; 첫날부터 CI/CD와 인프라 코드화.

AX 전환 · 컨설팅

어디에 AI를 넣어야 효과가 큰지 찾기

무엇을 만들기 전에, 어떤 업무가 AI로 가장 큰 효과를 보는지 찾고, 고객사 데이터로 작은 파일럿을 돌려 확인한 뒤에 확장합니다.

  • 업무 프로세스 진단
  • 2주 파일럿
  • 효과 측정 기준
  • 로드맵

이 페이지의 모든 사례가 이렇게 시작했습니다. 2주 프로토타입 패키지가 그 파일럿입니다.

어떻게 만드나닫기

받으시는 것. 업무 흐름의 짧은 진단: 시간이 어디에 들어가는지, 어떤 데이터가 이미 있는지, 어느 단계를 AI가 측정 가능한 결과로 대신할 수 있는지. 그다음 파일럿 하나, 2주, 고객사 데이터로, 끝에는 됐는지 안 됐는지를 말해 주는 숫자. 그다음 나머지를 효과와 위험 순으로 정리한 로드맵.

이것이 아닌 것. “AI 전략” 슬라이드가 아닙니다. 결과물은 작동하는 파일럿과, 제가 아닌 어느 엔지니어에게 줘도 되는 글로 된 계획입니다.

기술 용어로는. 프로세스·데이터 감사, 후보 업무 점수화, 파일럿 전에 합의한 평가 기준, 단계별 범위와 견적이 붙은 로드맵.

첫 상담부터 운영까지, 제 일처럼 만듭니다.

  1. STEP 1

    요구사항 · 데이터 분석

    해결하려는 문제와 가지고 계신 데이터를 함께 확인합니다. 통화 녹취, 문서, DB 무엇이든 괜찮습니다.

  2. STEP 2

    범위 · 견적 문서

    기능별 소요 시간과 비용, 마일스톤을 한 문서로 정리합니다. 대표님이 읽고 바로 결정할 수 있는 문서입니다.

  3. STEP 3

    2주 단위 개발

    2주마다 직접 써볼 수 있는 결과물을 공유하고, 받은 피드백을 다음 2주에 반영합니다. 마일스톤마다 직접 해보실 수 있는 검수 기준이 글로 적혀 있고, 대금은 검수 뒤에 냅니다.

  4. STEP 4

    검증 · 인도 · 운영

    실측 수치로 성능을 검증하고, 소스코드와 문서, 운영 가이드를 모두 넘겨드립니다. 출시 후 운영도 함께합니다.

AI 상담 챗봇 구축예시 화면
M1 · 데이터 정리 · 1차 동작본완료
M2 · 현장 검증 · 정확도 개선진행 중
M3 · 앱 연동 · 운영 이관예정
다음 데모2주 차 금요일

진행 상황, 언제든 한 화면에서

  • 마일스톤 문서무엇이 언제 끝나는지 한 페이지로
  • 2주 데모말이 아니라 작동하는 화면으로
  • 프로젝트 문서 저장소기획·설계·결정 기록을 고객과 공유

꼭 필요한 기능만, 근거가 보이는 견적으로.

  1. 1

    기능별 시간 × 단가

    모든 기능을 필요한 작업 시간으로 풀어 표로 보여드립니다. 전에 만들어 본 부분은 연동에 드는 시간만 받고, 어느 줄이 그런 항목인지 견적서에 적습니다.

  2. 2

    쌓아 올리는 3단 패키지

    핵심 기능, 확장, 고도화 순서로 나눠 두어 필요한 단계까지만 고르실 수 있습니다.

  3. 3

    예산에 맞춘 범위 조정

    예산이 부족해도 품질은 낮추지 않습니다. 대신 범위를 줄이고, 나머지는 나중에 붙일 수 있게 설계합니다. 포함되지 않는 것도 견적서에 적습니다.

견적 문의하기
견적서 예시 (실제 견적은 상담 후 산정합니다)
패키지기능작업 시간
1 · 핵심문서 수집 · 정제 파이프라인24h
1 · 핵심근거가 달린 답변 챗봇40h
2 · 확장관리자 화면 · 답변 품질 대시보드32h
3 · 고도화카카오톡 · 앱 연동24h
추천

2주 프로토타입 패키지

아이디어가 실제로 되는지, 보유하신 데이터로 2주 안에 확인합니다. 큰 비용을 들이기 전에 방향이 맞는지 먼저 확인할 수 있습니다.

  1. DAY 1–3

    요구사항 · 데이터 수집

    목표와 성공 기준을 정하고 필요한 데이터를 모읍니다.

  2. DAY 4–7

    1차 동작본

    핵심 기능 하나를 실제로 작동하게 만듭니다.

  3. DAY 8–11

    현장 데이터로 검증

    실제 데이터로 돌려 보고, 수치로 확인하며 고칩니다.

  4. DAY 12–14

    리뷰 · 다음 범위 확정

    결과를 함께 보고 본 개발 범위와 견적을 정합니다.

2주 뒤 손에 남는 것
  • 직접 써볼 수 있는 프로토타입
  • 수치로 정리한 검증 리포트
  • 본 개발 범위 · 견적 문서
패키지 문의하기

어떤 프로젝트를 했고, 무엇이 달라졌는지.

사례 8건, 고객사 이름은 허락을 받고 씁니다. 카드를 누르면 기술적인 내용까지 전체 이야기가 나옵니다.

  • 100만명+제가 만든 AI의 누적 사용자

    영어 시험 연습 서비스 TestGlider. 에세이·말하기 채점 모델을 제가 만들고 운영했습니다.

  • 7,000억원+제가 만든 AI가 돕는 연간 사업 규모

    LG 계열 팜한농. 제가 만든 AI 재배 상담이 앱 안에서 돌아가고 있고, 2026년 5월부터 전체 농가로 넓히고 있습니다.

  • 36%제가 개발한 모델의 평균 성능 향상

    예를 들어 농업 현장 통화에서 100글자 중 16개를 틀리던 상용 음성인식을, 제 모델은 10개로 줄였습니다.

  • 2주아이디어에서 프로토타입까지

    보유하신 데이터로 돌아가는 첫 버전을 2주 안에 직접 써보실 수 있습니다.

  • 5개월기획부터 상용 출시까지

    망고팩토리. 선생님들이 돈을 내고 쓰는 SaaS를 첫 줄부터 출시까지 혼자 만들었습니다.

  • 60억원+제 기술로 고객사가 유치한 투자

    TestGlider가 제 채점 모델을 핵심 기술로 투자를 유치했습니다. 이 모델은 논문으로 세계 최고 성능을 입증했습니다.

Neo4j에 구축된 농업 지식 그래프. 환경 조건, 병해, 재배 유형 등이 색깔별 노드로 연결되어 있다

팜한농 (FarmsAll)LG 계열 · 농업 · 연 매출 7,000억 원+2025–2026

농업 기업 앱 안에서 운영 중인 AI 재배 상담

회사의 농업 기술 노하우(재배 지침, 과거 보고서, 컨설턴트 통화)가 농가 질문에 출처를 달아 답하고, 컨설턴트 대신 보고서 초안을 씁니다.

  • 실제 서비스에서 운영 중 · 2026년 5월부터 전체 농가로 확대
  • 답변은 출처를, 보고서는 통화 원문을 인용
  • 아키텍처 지도 하나, 게이트웨이 하나로 저장소 16개를 정렬
사례 자세히 보기 →
세 종류 음성에 대한 글자 오류율 막대그래프. 우리 엔진, 상용 API, 오픈소스 기본 모델 비교

팜한농 (FarmsAll)LG 계열 · 농업2025–2026

실제 농업 통화에서 상용 API를 이기는 음성인식

컨설턴트의 전화 통화가 영농일지와 컨설팅 보고서가 됩니다. 실제 농업 통화에서 파인튜닝한 엔진은 글자 오류 10.45%, 국내 1위 상용 음성 API는 16.39%입니다.

  • 실제 농업 통화 오류 10.45%, 국내 1위 상용 API는 16.39%
  • 선별한 음성 약 1,300시간 + 고객사 통화 7시간으로 16.18%(오픈소스 기본)에서 10.45%로
  • 자체 서버 B200 4장 · 서빙 모드 4가지 · 라벨링 플랫폼 매일 사용 중
사례 자세히 보기 →
TestGlider 서비스 화면

TestGlider (데이터뱅크)에듀테크 스타트업 · 사용자 약 100만 명2020–2023

100만 학습자의 에세이와 말하기 채점

영어 시험 연습 서비스에 에세이와 말하기 답변의 즉각적이고 일관된 점수가 필요했습니다. 사람 채점으로도, 호출당 과금하는 외부 서비스로도 감당할 수 없는 규모였습니다.

  • 사용자 약 100만 명 · 60억 원+ 투자 유치를 뒷받침
  • 자체 모델이 LLM 첨삭 파이프라인을 대체
  • 자체 호스팅 음성인식이 호출당 과금하던 외부 비용을 대체
사례 자세히 보기 →
학교 템플릿으로 생성된 교실 보드게임 슬라이드 6장

망고팩토리 (MangoFactory)에듀테크 SaaS · 유료 이용 교사2025

학교 양식 그대로 나오는 수업 슬라이드

교사가 수업을 설명하면, 학교 템플릿에 맞는 편집 가능한 파워포인트와 120GB가 넘는 교육과정 자료에서 뽑은 활동지·퀴즈가 나옵니다.

  • 유료 사용자 · 현직 교사가 실제 수업에서 사용
  • 2025년 7월–11월, 5개월 만에 혼자 구축
  • 고객사 PPTX 템플릿을 그대로 채움. 이미지로 굽는 부분 없음
사례 자세히 보기 →
생성된 바이어 조사 보고서 첫 페이지

FederationLabs무역 정보 스타트업2025

AI 에이전트 팀이 쓰는 수출 바이어 조사 보고서

수출 기업이 제품을 말하면, 에이전트 팀이 해외 바이어를 찾고, 실제 무역 기록으로 점수를 매기고, 영업팀이 바로 쓸 수 있는 보고서를 씁니다.

  • 2025년 3월–6월 납품, federationlabs.ai에서 운영 중
  • 실제 무역 기록으로 바이어를 A/B 등급으로 평가
  • 보고서가 나가기 전에 자체 비평 단계가 고쳐 씀
사례 자세히 보기 →
사실 검증 파이프라인 다이어그램

Upwork 고객사 (비공개)소프트웨어 회사 · Upwork 프로젝트2024–2025

AI가 지어낸 주장을 사용자보다 먼저 잡아내기

AI 답변을 주장 하나하나로 쪼개고, 각 주장을 참조 문서와 대조한 뒤, 정확히 틀린 주장들만 중심으로 답변을 다시 씁니다.

  • 별 5개 평가 · $18K 프로젝트
  • pip으로 설치하는 SDK로 납품
  • 실패가 주장 단위라서, 수정도 주장 단위
사례 자세히 보기 →
에이전트 오케스트레이션 다이어그램

STIA마케팅 기술 회사 · 진행 중2025–2026

전문 에이전트 20개, 사람의 승인 2번

AI가 전략과 아웃리치 초안을 쓰지만, 전문가와 고객이 차례로 승인해야 무엇이든 움직이는 마케팅 캠페인 플랫폼. 중간에 죽은 실행은 멈춘 곳에서 다시 이어집니다.

  • 전문 서브에이전트 20개, 순차 승인 관문 2개
  • 프로세스가 죽어도 실행이 살아남아 중간부터 재개
  • 백엔드 전체에 테스트 약 1,300개
사례 자세히 보기 →
연구 모델에서 운영 서빙까지

발표 논문응용 AI 연구2016–2025

세계 최고 성능 AI 모델 연구를 서비스에 넣기

모델 연구를 계획하고, 실행하고, 발표합니다. 논문에서 세계 최고 성능을 기록한 에세이 채점 모델이 그대로 100만 명이 쓰는 서비스에 들어갔습니다. 출시 전에 측정하는 습관도 같은 곳에서 나왔습니다.

  • 세계 최고 성능, arXiv 2309.02740. 계획·실행·집필 모두 직접
  • 논문의 모델이 그대로 100만 명이 쓰는 서비스로
사례 자세히 보기 →

NDA로 이름을 밝힐 수 없는 프로젝트가 2건 더 있습니다.

고객사, 업종, 수치 없이 무엇을 만들었는지만 아래에 적었습니다. 비슷한 과제인지 판단하실 수 있게요.

비공개 프로젝트 보기

이름을 밝힐 수 없는 프로젝트.

비공개 · 2026

기억과 안전장치가 있는 대화형 에이전트

대화가 바뀌어도 사용자를 기억하고, 정해진 행동 범위를 벗어나지 않는 AI 동반자입니다. 시스템 일부가 멈춰도 실패하지 않고 할 수 있는 만큼만 답합니다.

  • LangGraph 1.0
  • 장기 기억
  • 가드레일
  • 평가 하네스
  • 트레이싱
어떻게 만들었나
  • 대화 그래프 위에 장기 기억을 얹었고, 가드레일에는 API 호출 없이 동작하는 오프라인 언어 검사가 포함됩니다.
  • 평가 하네스와 전체 트레이싱을 갖춰, 행동이 바뀌면 느낌이 아니라 숫자로 확인합니다.
  • 기능 등급별로 단계적 저하: 의존 서비스가 죽어도 에이전트는 줄어든 기능으로 계속 답합니다.
  • 타입 검사·린트·테스트(mypy, ruff, pytest)를 갖추고 문서와 함께 인도했습니다.
비공개 · 2026 · 운영 중

플랫폼 팀이 열어볼 필요 없는 AI 서비스

AI 두뇌와 고객사 플랫폼 사이에 문서화된 인터페이스 계약과 스텁 모드를 두어, 고객사 엔지니어는 안정된 인터페이스에 붙이고 AI는 그 뒤에서 계속 발전합니다.

  • FastAPI 비동기
  • 작업 큐
  • 실시간 이벤트
  • PDF/DOCX 내보내기
  • 결제
  • IaC + CI
어떻게 만들었나
  • 서비스 인터페이스 명세를 먼저 쓰고, 스텁 구현을 두어 AI가 완성되기 전에 플랫폼 팀이 개발·테스트할 수 있게 했습니다.
  • 백그라운드 작업과 실시간 업데이트가 있는 비동기 API, 문서 내보내기, 결제 연동, 오류 모니터링.
  • 첫날부터 인프라 코드화와 CI. 현재 운영 중입니다.

직접 설계하고, 직접 만들고, 숫자로 증명합니다.

  • 8년AI 연구 · 개발 경력
  • SOTA논문으로 입증한 세계 최고 성능
  • 100%소스코드 · 문서 인도
  • 한 사람이 처음부터 끝까지

    영업 따로, 개발 따로가 아닙니다. 첫 상담을 받고, 설계하고, 만들고, 운영하는 사람이 같은 사람입니다. 이야기 나누는 사람이 코드를 쓰는 사람입니다.

  • 소스코드 · 문서 전부 인도

    코드, 학습된 모델, 설계 문서, 평가 데이터셋, 운영 가이드까지 모두 고객의 자산이 됩니다. 외부 제품을 붙인 부분은 "연동"이라고 적지, "개발"로 숨기지 않습니다.

  • 실측 수치로 검증

    "잘 됩니다"라는 말 대신, 같은 데이터와 같은 기준으로 비교한 숫자로 성능을 보고합니다. 효과가 0으로 측정된 기능은 끄고, 그 사실을 기록합니다.

  • 출시 후 운영까지

    모니터링, 오류 대응, 재학습, 기능 추가까지 출시 이후에도 함께합니다.

자주 묻는 질문

Q.왜 2주 단위인가요?

AI 프로젝트는 직접 써보기 전까지 알 수 없는 부분이 많습니다. 2주마다 작동하는 결과를 확인하면 방향이 틀렸을 때 빨리 바로잡을 수 있고, 그만큼 비용 낭비가 줄어듭니다.

Q.소스코드와 산출물은 받을 수 있나요?

네. 소스코드, 학습된 모델, 데이터 처리 스크립트, 설계·운영 문서를 모두 넘겨드리고, 인도 범위는 계약서에 적어 둡니다.

Q.대금은 어떻게 내나요?

마일스톤별 고정 금액입니다. 마일스톤마다 직접 해보실 수 있는 검수 기준이 글로 적혀 있고, 대금은 날짜가 아니라 검수 뒤에 냅니다. Upwork를 통하거나 투윅스와 직접 계약하실 수 있습니다.

Q.AI 결과물의 품질은 어떻게 확인하나요?

실제 데이터로 측정한 숫자로 확인합니다. 예를 들어 음성인식은 같은 통화 2,354문장을 제 모델과 상용 서비스에 나란히 돌려 틀린 글자 수를 비교해 보고했습니다.

Q.데이터가 정리되어 있지 않아도 되나요?

괜찮습니다. 흩어진 문서, 녹취 파일, 엑셀처럼 정리되지 않은 데이터를 쓸 수 있는 형태로 만드는 일부터 함께합니다.

Q.프리랜서인가요, 회사인가요?

둘 다입니다. 제 회사 투윅스(TwoWeeks)를 통해서도, Upwork를 통해서도 일합니다. 어느 쪽이든 저와 직접 일하시게 됩니다.

2주 뒤, 작동하는 결과로 보여드리겠습니다.

해결하고 싶은 문제를 Upwork 메시지로 보내 주세요. 첫 상담이 끝나면 문제가 한 문장으로 정리되고, AI가 맞는 도구인지 아닌지, 아니라면 무엇이 맞는지 답을 가져가시게 됩니다.

국내 기업이신가요? 같은 일을 제 회사 투윅스를 통해서도 맡고 있습니다. twoweeks-acu.pages.dev ↗

이렇게 적어 주시면 더 빠르게 답변드립니다
  1. 회사 · 서비스 소개
  2. 해결하고 싶은 문제
  3. 가지고 계신 데이터
  4. 희망 일정 · 예산