[비전검사 시리즈 25편] AI 데이터셋 구축 방법: 고성능 AI 모델을 만드는 데이터 구축 노하우
AI 데이터셋 구축 방법, 왜 AI 성능의 핵심일까?
AI 비전검사를 도입하려는 기업들이 가장 많이 하는 질문 중 하나는 다음과 같습니다.
"최신 AI 모델을 사용하면 검사 정확도가 높아질까요?"
결론부터 말하면 AI 모델보다 데이터셋(Data Set)의 품질이 더 중요합니다.
실제로 같은 AI 모델을 사용하더라도 데이터셋 구축 방식에 따라 검사 정확도가 크게 달라질 수 있습니다.
- 데이터가 다양하면 AI는 다양한 상황에 대응합니다.
- 데이터가 부족하면 AI는 특정 조건만 학습합니다.
- 데이터가 잘못 구축되면 AI는 잘못된 기준으로 판단합니다.
즉, 좋은 AI는 좋은 데이터셋에서 시작됩니다.
이번 글에서는 제조 현장에서 활용할 수 있는 AI 데이터셋 구축 방법과 실무 노하우를 소개합니다.
AI 데이터셋(Data Set)이란?
AI 데이터셋이란 AI가 학습하기 위해 사용하는 이미지와 정답(Label) 정보의 모음입니다.
예를 들어 스크래치 검사를 위한 데이터셋이라면 다음과 같이 구성됩니다.
| 정상 제품 | Normal |
| 스크래치 | Scratch |
| 찍힘 | Dent |
| 오염 | Contamination |
Object Detection이라면 Bounding Box가 포함되고,
Segmentation이라면 Pixel Mask가 포함됩니다.
즉, 이미지 + 정답(Label)이 하나의 데이터셋을 구성합니다.
AI 데이터셋 구축 절차
제조업에서는 일반적으로 다음 순서로 데이터셋을 구축합니다.
1단계. 검사 목적 정의
가장 먼저 해야 할 일은 "무엇을 검사할 것인가?"를 명확하게 정하는 것입니다.
예를 들어 자동차 부품 검사
- 스크래치
- 찍힘
- 이물
- 크랙
PCB 검사
- 납땜 불량
- 부품 누락
- 패턴 단선
반도체 검사
- Crack
- Particle
- Chip
검사 항목이 명확해야 데이터도 정확하게 수집할 수 있습니다.
2단계. 이미지 수집
다음은 다양한 환경에서 이미지를 확보하는 단계입니다.
수집해야 하는 데이터는 다음과 같습니다.
정상 이미지
제품마다 자연스러운 편차가 존재합니다.
따라서
- 색상 차이
- 위치 차이
- 밝기 차이
- 제조 Lot 차이
를 포함해야 합니다.
불량 이미지
불량 데이터는 가능한 많이 확보하는 것이 좋습니다.
예를 들어 스크래치 검사라면
- 긴 스크래치
- 짧은 스크래치
- 얕은 스크래치
- 깊은 스크래치
- 방향이 다른 스크래치
를 모두 포함해야 합니다.
3단계. 데이터 분류
수집한 이미지를 종류별로 분류합니다.
예
Normal
Scratch
Dent
Crack
Particle
Contamination
분류 기준은 작업자마다 달라지지 않도록 사전에 정의해야 합니다.
4단계. 라벨링
라벨링은 AI 데이터셋에서 가장 중요한 작업입니다.
Classification
→ 이미지 전체 분류
Object Detection
→ Bounding Box
Segmentation
→ Pixel Mask
라벨링이 잘못되면 AI는 잘못된 정보를 학습합니다.
5단계. 데이터 검수
라벨링이 끝났다고 바로 학습하면 안 됩니다.
반드시 검수를 진행해야 합니다.
검수 항목
- 라벨 누락
- 오라벨
- 중복 데이터
- 흐린 이미지
- 잘못 촬영된 이미지
좋은 AI 데이터셋의 조건
① 다양한 환경 포함
실제 생산 현장은 항상 일정하지 않습니다.
포함해야 하는 조건
- 조명 변화
- 제품 위치 변화
- 카메라 각도 변화
- 생산 시간 변화
- 제품 편차
다양한 환경을 포함할수록 AI의 일반화 성능이 높아집니다.
② 정상 데이터만 많으면 안 된다
많은 제조기업이 실수하는 부분입니다.
예)
정상: 20,000장
불량: 300장
이렇게 되면 AI는 정상만 학습합니다.
결과)
False OK 증가
불량 검출 실패가 발생합니다.
③ 애매한 데이터는 제거한다
사람도 판단하기 어려운 이미지는 AI도 어렵습니다.
예를 들어
- 초점이 흐림
- 제품 일부만 촬영
- 조명이 과도함
- 노이즈 발생
이런 이미지는 제거하는 것이 좋습니다.
AI 데이터셋 구축 실패 사례
실패 사례 ① 개발실 데이터만 사용한 경우
한 제조업체는 개발실에서 촬영한 이미지 8,000장으로 AI를 학습했습니다.
테스트 정확도는 98%였습니다.
하지만 실제 생산라인에서는
- False NG 증가
- False OK 증가
문제가 발생했습니다.
원인
생산 환경 데이터가 없었습니다.
실제 현장에서는
- 먼지
- 진동
- 조명 변화
- 위치 편차
가 발생했기 때문입니다.
해결 방법
생산라인 데이터를 추가 수집하고 AI를 재학습했습니다.
실패 사례 ② 불량 종류가 부족했던 경우
한 업체는 스크래치 이미지 100장만 확보했습니다.
하지만 실제 생산에서는
- 찍힘
- 오염
- Crack
도 함께 발생했습니다.
AI는 새로운 불량을 정상으로 판단했습니다.
해결 방법
불량 유형별 데이터를 지속적으로 추가했습니다.
실패 사례 ③ 라벨링 기준이 달랐던 경우
외부 업체와 내부 직원이 함께 라벨링을 진행했습니다.
하지만
A 작업자는 작은 흠집도 불량
B 작업자는 큰 흠집만 불량
으로 표시했습니다.
AI는 서로 다른 기준을 동시에 학습하면서 정확도가 크게 떨어졌습니다.
해결 방법
라벨링 가이드 문서를 제작하고 모든 작업자가 동일한 기준으로 작업하도록 수정했습니다.
데이터셋 품질을 높이는 방법
데이터 증강(Data Augmentation)
부족한 데이터를 보완하기 위해
- 좌우 반전
- 회전
- 밝기 조절
- 확대
- 축소
등을 적용할 수 있습니다.
하지만 실제 생산 환경과 다른 과도한 변형은 오히려 성능을 떨어뜨릴 수 있습니다.
지속적인 데이터 업데이트
AI는 한 번 학습했다고 끝나는 것이 아닙니다.
운영 중 발생하는
- 신규 불량
- False OK
- False NG
를 데이터셋에 추가하여 재학습해야 합니다.
데이터 버전 관리
학습 데이터는 버전별로 관리하는 것이 좋습니다.
예)
Dataset v1
Dataset v2
Dataset v3
처럼 관리하면 성능 비교와 문제 분석이 쉬워집니다.
AI 데이터 관리 체크리스트
□ 정상 데이터가 충분한가?
□ 불량 종류가 다양하게 포함되었는가?
□ 실제 생산 환경 이미지인가?
□ 라벨링 기준이 통일되었는가?
□ 데이터 검수를 완료했는가?
□ 신규 데이터를 지속적으로 추가하는가?
자주 묻는 질문(Q&A)
Q1. AI 데이터셋은 몇 장 정도 필요할까요?
A.
정답은 없습니다.
제품 종류와 검사 난이도에 따라 달라집니다.
중요한 것은 수량보다 다양성입니다.
같은 제품 1만 장보다 다양한 조건의 3천 장이 더 좋은 결과를 만드는 경우도 많습니다.
Q2. 불량 데이터가 거의 없는데 어떻게 해야 하나요?
A.
제조 현장에서는 흔히 발생하는 문제입니다.
다음과 같은 방법을 활용할 수 있습니다.
- 초기 생산 데이터 저장
- 의도적으로 불량 제작
- 운영 중 발생한 불량 지속 추가
- 데이터 증강 활용
Q3. 인터넷 이미지를 사용해도 되나요?
A.
권장하지 않습니다.
실제 생산 환경과 촬영 조건이 다르기 때문에 현장 적용 시 정확도가 크게 떨어질 수 있습니다.
가능하면 자사 생산라인에서 촬영한 이미지를 사용하는 것이 가장 좋습니다.
Q4. 데이터가 많으면 정확도가 항상 올라가나요?
A.
아닙니다.
품질이 낮은 데이터 10만 장보다
품질이 높은 데이터 5천 장이 더 좋은 성능을 만드는 경우가 많습니다.
데이터의 양보다 품질과 다양성이 중요합니다.
마무리
AI 비전검사의 성공 여부는 최신 AI 모델이 아니라 데이터셋 구축 품질에 달려 있습니다.
정확한 데이터셋을 구축하기 위해서는
- 검사 목적을 명확히 정의하고
- 실제 생산 환경에서 다양한 이미지를 수집하며
- 일관된 기준으로 라벨링하고
- 지속적으로 데이터를 관리하고 개선하는 과정
이 반드시 필요합니다.
제조 현장에서 AI를 성공적으로 운영하는 기업들은 공통적으로 데이터를 일회성 자산이 아니라 지속적으로 관리해야 하는 핵심 자산으로 생각합니다.
다음 AI 비전검사 시리즈 26편에서는 「라벨링(Labeling) 잘하는 방법 - AI 성능을 높이는 정확한 라벨링 노하우」를 자세히 알아보겠습니다.