[데이터가 저절로 쌓이게 하기] 2주차 Day 2 — 반쯤 빈 데이터가 없는 것보다 나쁜 이유

주차 주제: 모으려 하면 실패한다 | 제조 사례: 31% 로 내린 결론

오늘의 목표: 편향이 왜 생기고 왜 안 보이는지 알고, 쓸지 말지 판정한다.

소요 시간: 30분


1. 한 문장으로

없으면 못 합니다.
반쯤 있으면 틀린 답을 냅니다.              ★

2. 왜 틀리나 — 빠진 게 무작위가 아니어서

어제의 점검표 — 31% 만 들어왔습니다.          ★
그 31% 는 어떤 31% 인가?                  ★
· 한가한 날이 많습니다                    ★
· 성실한 사람 쪽이 많습니다                 ★
· 문제가 없던 날이 많습니다                 ★
    (문제 있으면 바쁘고, 바쁘면 안 씁니다) ★
그러면

  "설비 이상률 2%" 같은 숫자가 나옵니다.    ★
  실제보다 훨씬 낮습니다.                  ★

3. ★ 이게 보이지 않습니다

· 숫자가 나옵니다                            ★
· 그럴듯합니다
· 오류가 안 납니다                        ★
그리고 그 숫자로
  · 보고합니다                              ★
  · 예산을 정합니다
  · AI 를 학습시킵니다                    ★
마지막이 가장 나쁩니다.                      ★
편향된 데이터로 배우면

  편향을 그대로 재현합니다.                ★
  그리고 그럴듯하게 답합니다.             ★

4. 제조업의 전형적인 편향

① 바쁠 때가 빠집니다                       ★
   → 성수기 데이터가 적습니다
   → 성수기 예측이 틀립니다               ★

② 야간·주말이 빠집니다                     ★
   → 교대별 비교가 안 됩니다

③ 문제 있을 때가 빠집니다                  ★
   → 이상 탐지를 못 배웁니다              ★

④ 특정 사람 것만 있습니다                  ★
   → 그 사람 방식이 정답이 됩니다          ★

⑤ 잘 된 것만 남습니다                      ★
   → 실패 사례가 없습니다
③⑤ 가 AI 에 치명적입니다.                   ★
이상을 배워야 하는데 이상이 없습니다.     ★

5. 그럼 쓰지 말아야 하나

아닙니다. 알고 쓰면 됩니다.                ★
할 일

  ① 채움률을 세세요                       ★
  ② 빠진 게 무작위인지 보세요              ★
  ③ 아니면 어느 쪽으로 치우쳤나 적으세요   ★
  ④ 그 한계를 결과에 붙이세요              ★
④가 중요합니다.
  "설비 이상률 2%
   (점검 입력률 31%. 바쁜 날이 빠져 있어
    실제보다 낮을 것)"                     ★

6. ② 무작위인지 보는 법

빠진 것과 들어온 것을 축별로 비교하세요.   ★
  축          입력된 것   전체              ★
  ────────────────────────────────────
  요일        ______      ______           ★
  교대        ______      ______
  라인        ______      ______           ★
  작업자      ______      ______           ★
  생산량 구간  ______      ______           ★
비율이 다르면 치우친 것입니다.            ★
마지막 축이 특히 잘 드러냅니다.              ★
  생산량 많은 날의 입력률  ___%              ★
  생산량 적은 날의 입력률  ___%              ★

7. 제조 현장의 실제

어느 업체, 설비 이상률로 보전 계획을 세웠습니다.
  데이터상 이상률  2.1%                    ★
  → "설비 상태 양호"                       ★
  → 예방보전 주기를 늘렸습니다            ★
6개월 뒤
  돌발 고장 2.4배                          ★
확인해 보니
  점검 입력률          31%                  ★
  생산량 상위 30% 인 날의 입력률  11%      ★
  생산량 하위 30% 인 날의 입력률  58%      ★
바쁜 날이 거의 빠져 있었습니다.           ★
그리고 설비는 바쁜 날 고장 납니다.         ★
고친 뒤 (점검을 부산물로 — 내일 Day 3)
  입력률 97%                               ★
  실제 이상률 6.8%                         ★
2.1 이 아니라 6.8 이었습니다.             ★

8. ★ 「숫자가 나빠진다」 를 미리 말하세요

채움률을 올리면
숫자가 나빠 보입니다.                      ★
  이상률 2.1% → 6.8%                        ★
  불량률도 올라갑니다
  지연 건수도 늘어납니다                    ★
그리고 누가 묻습니다

  "왜 이렇게 나빠졌죠?"                     ★
답

  "나빠진 게 아니라 보이기 시작한 겁니다."  ★
이 말을 먼저 해 두세요.                   ★

모델 고르기 과정 10주차 Day 4 와 같은 얘기입니다.


9. 쓸지 말지 판정

  채움률   빠진 게 무작위?   판정            ★
  ──────────────────────────────────────
  90%+     —                씁니다        ★
  70~90%   무작위           씁니다 (주의 표시) ★
  70~90%   치우침           보정하거나 안 씀 ★
  70% 미만  —                추세만        ★
  50% 미만  —                안 씁니다     ★
마지막에서

  「참고」 라고 쓰지 말고 안 쓰세요.         ★
"참고" 라고 적어도
보고서에 들어가면 숫자가 됩니다.          ★

10. 오늘 해 볼 것 (15분)

① 채움률을 세세요

  항목        채움률                         ★
  ________    ___%
  ________    ___%                           ★
② 치우침을 보세요

  생산량 상위 30% 날의 입력률  ___%          ★
  생산량 하위 30% 날의 입력률  ___%          ★
  → 차이가 크면 치우친 것입니다            ★
③ 판정하세요

  항목        판정 (씀/주의/안 씀)            ★
  ________    ________
  ________    ________                       ★

11. 내일 할 것

★ 일을 하면 남는다는 발상.

이 과정의 핵심입니다. 입력률 31% 가 97% 가 된 방법입니다.


이 글은 데이터가 저절로 쌓이게 하기 과정의 2주차 2일차입니다. 과정 전체 보기

진도와 검색이 되는 판: AXPulse 기술따라가기

댓글

이 블로그의 인기 게시물

자재관리는 잘 쓰는데 BOM은 엑셀입니다

협력사 AI 로봇 도입, 공급망 스마트 제조 생태계 대응 전략

개발 테스트 자동화, AI 에이전트와 MCP 도입 전략