AI & 프롬프트
AI 뉴스/소식

알렉산더 왕이 본 것은 'AI'가 아니라 'AI의 밥'이었다 - 데이터 라벨링

중년개발자
중년개발자

@loxo

6일 전

10

Scale AI의 성공은 “AI 모델을 만든 회사”라기보다, AI가 배우기 위해 필요한 ‘교과서’를 대규모로 만들어 준 회사라는 점에서 봐야 합니다.

그리고 Alexandr Wang이 대단한 이유도 바로 여기에 있습니다. 그는 19세에 이 문제를 발견하고, 당시에는 사람들이 별로 중요하게 생각하지 않던 데이터 라벨링을 거대한 산업으로 만들었습니다. Scale AI는 2016년 설립됐고, Wang은 2025년 CEO에서 물러나 Meta의 AI 조직으로 이동했습니다. (포브스)

1. 알렉산더 왕이 본 것은 'AI'가 아니라 'AI의 밥'이었다

당시 AI 스타트업을 보면 대부분 이런 생각이었습니다.

“더 좋은 알고리즘을 만들자.”
“더 큰 GPU를 사용하자.”
“더 좋은 신경망을 만들자.”

그런데 Wang은 조금 다른 질문을 했습니다.

“그 AI에게 무엇을 가르칠 것인가?”

이게 핵심입니다.

예를 들어 자율주행차 AI에게 사진 한 장을 보여준다고 해보겠습니다.

text
🚗 도로 사진 사람 → Pedestrian 자동차 → Car 신호등 → Traffic Light 자전거 → Bicycle 도로 → Road

컴퓨터에게 사진을 그냥 주면 컴퓨터는 픽셀 덩어리만 봅니다.

사람이

text
이것은 사람이다. 이것은 자동차다. 이 영역이 도로다.

라고 표시해 줘야 AI가 “아, 이런 패턴을 사람이라고 부르는구나”를 학습할 수 있습니다.

Scale AI가 처음부터 파고든 것이 바로 이것이었습니다.

Scale 스스로도 데이터 라벨링을 AI가 학습할 수 있도록 데이터에 의미와 맥락을 부여하는 작업이라고 설명합니다. (Scale AI)


2. 그런데 '데이터 라벨링'이 구체적으로 뭘 하는 것일까?

여기서 생각보다 재미있습니다.

단순한 라벨링

가장 간단한 것은 이런 것입니다.

text
사진 → 고양이 사진 → 개 사진 → 자동차 사진 → 사람

하지만 실제 AI 산업에서는 훨씬 복잡합니다.

자율주행차를 예로 들어보겠습니다.

자동차가 도로를 달리면서 카메라와 LiDAR로 데이터를 수집합니다.

한 장면이 들어옵니다.

text
사람 ┌───────┐ │ 🚶 │ └───────┘ 🚗 🚙 ========================= 도로 =========================

사람이 하는 일은 단순히

"사람 있음"

이라고 쓰는 것이 아닙니다.

예를 들어:

text
Object #1 type = pedestrian bounding box x = 423 y = 181 width = 62 height = 148 confidence = high

처럼 정확한 위치와 종류를 표시합니다.

더 발전하면 사람의 외곽선을 따라가는

Polygon / Segmentation

을 합니다.

text
●──● / \ ● ● │ 사람 │ ● ● \ / ●──●

그리고 3D 데이터에서는 LiDAR 점군을 이용해

text
🚗 ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ●

이 점들이 어떤 자동차를 구성하는지도 표시합니다.

Scale은 실제 자동차 산업에서 2D·3D 센서 데이터를 대상으로 한 annotation을 제공해 왔습니다. (Scale AI)


3. 그런데 진짜 어려운 것은 '애매한 데이터'다

여기서 Scale의 사업 가치가 커집니다.

예를 들어 이런 사진이 있다고 해보죠.

text
🌧️ ┌───────────────┐ │ 🚶 │ │ ░░░░░░ │ │ 🚗 │ └───────────────┘

비가 내리고 있습니다.

사람이 우산을 쓰고 있습니다.

밤입니다.

자동차 헤드라이트가 비칩니다.

사람의 몸 일부가 자동차에 가려졌습니다.

이런 상황이 AI에게 훨씬 어렵습니다.

그래서 좋은 데이터 회사는 단순히

사람 1명 → 라벨링

하는 회사가 아닙니다.

AI가 틀리기 쉬운 데이터를 찾아내고, 전문가가 그것을 정확하게 판정하도록 만드는 회사가 됩니다.

Scale도 현재는 단순 라벨링을 넘어 데이터 수집 → 큐레이션 → 라벨링 → 모델 평가까지 연결하는 Data Engine을 강조하고 있습니다. (Scale AI)


4. ChatGPT 같은 LLM에서는 라벨링이 더 재미있다

여기서 Scale AI의 사업이 한 단계 진화합니다.

예를 들어 AI에게 질문합니다.

질문

인공지능이 인간의 삶을 어떻게 바꿀까?

AI가 두 가지 답변을 합니다.

A

AI는 인간의 생산성을 향상시키고 의료와 과학 발전에 기여할 수 있습니다.

B

AI가 발전하면 인간은 아무것도 할 필요가 없어집니다.

사람에게 묻습니다.

text
어느 답변이 더 좋은가? A ●●●●●●●●● B ●●

그리고 왜 A가 좋은지도 평가하게 합니다.

text
정확성 ★★★★★ 논리성 ★★★★★ 도움성 ★★★★★ 안전성 ★★★★★

이것이 Human Preference Data입니다.

즉,

인간이 AI의 답변을 평가하고
그 평가를 AI가 다시 학습하는 것

입니다.

이것이 ChatGPT 같은 모델을 발전시키는 RLHF(Reinforcement Learning from Human Feedback)와 연결됩니다. Scale은 현재 생성형 AI 데이터 사업에서 prompt-response 생성, RLHF, red teaming, evaluation 등을 제공한다고 설명합니다. (Scale AI)


5. 그래서 Scale AI는 사실 '사람 + 소프트웨어' 회사였다

여기가 Alexandr Wang의 진짜 사업적 통찰입니다.

처음에는 이런 구조입니다.

text
고객 "AI를 학습시키고 싶다" Scale AI 수많은 사람 데이터 라벨링 정제된 Training Data AI 회사

그런데 Wang은 단순히 사람을 연결하는 인력 중개업체로 머물지 않았습니다.

소프트웨어를 만들었습니다.

text
Raw Data ┌──────────────────┐ │ Scale Platform │ │ │ │ 자동화 │ │ Labeling │ │ Quality Control │ │ Human Review │ │ Evaluation │ └──────────────────┘ Training Data AI Model

즉,

사람의 노동을 소프트웨어로 조직화한 것입니다.

Scale의 현재 품질관리 방식도 개별 annotation 검증, dataset 평가, contributor 평가라는 여러 단계로 구성되어 있다고 설명합니다. (Scale AI)


6. Wang의 진짜 천재성은 '시장의 위치'를 찾은 것이다

저는 Alexandr Wang의 가장 대단한 점을 코딩 능력보다 이것이라고 봅니다.

당시 사람들은

AI 모델이 가장 중요한 자산이다.

라고 생각했습니다.

Wang은

그 모델을 학습시키는 데이터가 병목이 될 것이다.

라고 본 것입니다.

실제로 Scale은 자율주행에서 시작했습니다.

text
2016 ├─ 자율주행 데이터 ├─ 이미지 라벨링 ├─ 3D / LiDAR ├─ 로봇 └─ 컴퓨터 비전 생성형 AI RLHF 평가 / 안전성

Forbes는 Scale이 처음에는 자율주행차용 데이터 라벨링에 집중했고 이후 생성형 AI 붐과 함께 고객과 사업 영역을 확대했다고 평가합니다. (포브스)


7. 더 놀라운 것은 '데이터 라벨링 → 데이터 엔진'으로 진화했다는 것

초기의 질문은

"데이터에 라벨을 붙여주세요."

였습니다.

하지만 지금의 질문은 훨씬 고차원적입니다.

"우리 AI가 왜 틀리는지 찾아주세요."

예를 들어 AI의 성능을 분석해보니

text
일반적인 자동차 99.2% 밤의 자동차 96.1% 비 오는 날 91.3% 가려진 자동차 83.7% 오토바이 + 자동차 79.2%

라면,

Scale 같은 데이터 엔진은

text
① 모델이 약한 영역 발견 ② 그런 데이터 수집 ③ 사람이 정답 생성 ④ 모델 재학습 ⑤ 다시 평가 ⑥ 또 약점 발견

이라는 학습의 폐쇄 루프를 만들 수 있습니다.

Scale은 이를 Base Phase → Improvement Phase → Target Phase라는 모델 개발 단계로 설명합니다. (Scale AI)


8. 그래서 '데이터 라벨링 회사'라고만 하면 Scale을 과소평가하는 것이다

Scale AI를 한 문장으로 표현하면 저는 이렇게 표현하겠습니다.

"AI가 세상을 이해하도록 인간의 지식을 기계가 읽을 수 있는 형태로 변환하는 회사."

초기에는

사진 → 라벨

이었지만,

지금은

인간의 판단 → AI가 학습할 수 있는 데이터

로 범위가 넓어진 것입니다.

그래서

text
사람 판단 Label / Preference / Evaluation Training Data AI AI의 판단 사람의 평가 다시 Training Data

라는 거대한 순환 구조가 만들어집니다.


9. 그리고 Alexandr Wang의 또 하나의 대단한 점

그는 19세에 이 문제를 사업으로 봤다는 것입니다.

MIT에 진학한 뒤 1년 만에 학교를 떠나 Y Combinator를 통해 Scale AI를 시작했습니다. 당시 그는 19세였습니다. (포브스)

더 중요한 것은 “AI 모델을 직접 만들겠다”가 아니라 “AI 산업이 반드시 필요로 하는 삽과 곡괭이를 팔겠다”는 선택이었습니다.

골드러시에서 금을 캐는 사람보다

곡괭이와 삽을 파는 사람이 더 안정적으로 돈을 번다

는 유명한 사업 전략과 같습니다.

Wang도 Scale을 AI 시대의 “picks and shovels”에 비유했습니다. (포브스)


10. 다만 Scale의 성공을 미화해서만 보면 안 된다

여기에는 중요한 이면도 있습니다.

Scale의 초기 사업은 수많은 글로벌 작업자들에게 데이터 라벨링을 맡기는 방식으로 크게 확장됐고, Forbes는 Remotasks 등을 통한 대규모 외주 노동과 낮은 보상, 노동환경 문제 등을 비판적으로 보도했습니다. (포브스)

또한 데이터 라벨링 자체는 시간이 지나면서 가격 경쟁이 심한 상품화된 업무가 될 위험도 있습니다. 실제로 Scale도 2026년에는 단순 라벨링에서 기업용 AI 개발·데이터 엔진 쪽으로 무게중심을 옮기고 있다는 평가가 나옵니다. (포브스)

그래서 Wang의 진짜 성공을 “사람을 많이 고용해서 라벨링했다”라고 이해하면 핵심을 놓칩니다.


핵심은 이것입니다

text
과거 데이터 ──→ AI 모델 사람이 라벨링 Scale AI가 만든 것 Raw Data Human Intelligence Label / Preference / Evaluation High Quality Data AI Model Model Evaluation 다시 데이터 생성

그리고 이 구조를 사업으로 만든 것이 Alexandr Wang입니다.

AI 시대의 중요한 질문을

“누가 가장 좋은 AI 모델을 만들 것인가?”

에서

“누가 AI가 가장 좋은 것을 배우게 만들 것인가?”

로 바꿔버린 것입니다.

그래서 Wang의 사례는 단순한 데이터 라벨링 성공 사례라기보다, “남들이 하찮게 보던 AI의 보조 작업에서 산업의 핵심 인프라를 발견한 사례”로 보는 것이 훨씬 정확합니다.

2026년 현재 Forbes 기준으로 Wang은 2025년 Meta의 Scale 지분 49% 거래 이후 Meta의 AI 수장을 맡았고, 2026년 8월 24일 기준 Forbes 실시간 추정 순자산은 약 32억 달러로 집계됩니다. (포브스)

결국 Alexandr Wang이 발견한 것은 데이터 라벨링이 아니라, “AI의 지능은 결국 인간이 만든 데이터의 품질에서 시작된다”는 산업의 병목이었습니다.

#Scale AI#데이터 라벨링#인공지능#알렉산더 왕#머신러닝

댓글 0

Ctrl + Enter를 눌러 등록할 수 있습니다
※ AI 다듬기는 내용을 정제하는 보조 기능이며, 최종 내용은 사용자가 확인해야 합니다.