[온톨로지 적용하기] 5주차 Day 2 — 대소문자·띄어쓰기는 뜻이 아니다

주차 주제: 같은 것을 다르게 부를 때 | 제조 사례: 표기 차이 3,400건

오늘의 목표: 표기 차이를 정규화로 걷어내고, 뜻의 차이만 남긴다.

소요 시간: 30분


1. 한 문장으로

동의어 매핑을 하기 전에
표기 차이부터 걷어냅니다.                  ★

2. 표기 차이의 종류

① 공백           "M8 볼트" / "M8볼트"          ★
② 대소문자       "Bracket" / "BRACKET"         ★
③ 기호           "M-8" / "M8" / "M_8"          ★
④ 전각/반각      "MM" / "MM"                 ★
⑤ 단위 표기      "mm" / "㎜" / "미리"          ★
⑥ 한/영 혼용     "브라켓" / "bracket"          ★
⑦ 순서          "볼트 M8" / "M8 볼트"         ★
①~⑤ 는 기계가 해결합니다.                 ★
⑥⑦ 은 사람이 정해야 합니다.               ★

3. 왜 먼저 하나

안 하면
· 동의어 목록이 부풀려집니다              ★
   3,400개인데 실제 뜻 차이는 200개

· 사람이 판정할 것이 많아집니다               ★

· 진짜 문제가 묻힙니다                    ★
② 기준정보 과정 12주차 Day 1 의
「정규화 후 일치」 와 같은 수법입니다.         ★

4. ★ 정규화 규칙을 정하세요

비교할 때만 쓰는 규칙입니다.
저장된 값은 안 바꿉니다.                   ★
① 모든 공백 제거
② 대문자로 통일                                ★
③ - _ / . 제거                                 ★
④ 전각 → 반각                                  ★
⑤ 단위 표기 통일 (㎜→MM, ㎏→KG)               ★
예

  "M-8 볼트 (SUS)"
  → "M8볼트(SUS)"                              ★

5. ⑦ 순서는 기계가 어렵다

"볼트 M8" 과 "M8 볼트"
정규화해도 다릅니다.
  "볼트M8"  vs  "M8볼트"                       ★
해법 — 토큰으로 쪼개서 정렬               ★

  볼트M8  → [볼트, M8] → 정렬 → [M8, 볼트]
  M8볼트  → [M8, 볼트] → 정렬 → [M8, 볼트]    ★
  → 같음                                      ★
다만 위험합니다.

  "좌 브라켓" 과 "브라켓 좌" 는 같지만
  "A→B 변환" 과 "B→A 변환" 은 다릅니다.    ★
→ 토큰 정렬은 후보만 뽑는 데 씁니다.      ★

6. ⑥ 한/영은 사람이 정한다

"브라켓" 과 "Bracket"
기계는 모릅니다.
해법

  · 표준 표기를 정합니다 (한글 또는 영문)  ★
  · 나머지는 동의어로 등록                     ★
  · LLM 에게 후보를 뽑게 합니다                ★
    (번역은 LLM 이 잘합니다)                   ★
  · 사람이 확인합니다                       ★
LLM 이 틀리는 자리

  · 업계 고유어 ("가다" · "시다")              ★
  · 회사 고유 약어 (BRK-A · SUB-2)             ★
  · 오타가 굳은 말 ("브라켇")                  ★

7. 제조 현장의 실제

어느 업체, 품목명 동의어 후보를 뽑았습니다.
처음 — 단순 비교
  후보 12,400쌍                                ★
  → 사람이 볼 수 없는 양
정규화 후 (①~⑤)
  후보 3,400쌍                                 ★
토큰 정렬 추가 (⑦)
  후보 890쌍                               ★
사람이 판정
  같은 것    620쌍                             ★
  다른 것    210쌍                             ★
  보류       60쌍
그리고 210쌍의 「다른 것」 을 보니
  좌/우 구분      92쌍                         ★
  REV 차이        61쌍                         ★
  재질 차이       38쌍                         ★
  규격 미세 차이   19쌍                         ★
전부 한두 글자 차이였습니다.              ★
자동으로 묶었으면 사고였습니다.

8. ★ 위험 표시를 미리 걸어 두세요

아래 글자가 다른 쌍은 자동 통합 금지     ★
  좌 / 우 / L / R                              ★
  상 / 하 / U / D
  전 / 후 / F / R                              ★
  내 / 외
  REV · Rev · 버전 숫자                        ★
  숫자 (M6/M8, 100/1000)                       ★
  재질 (SUS/SS/AL)                             ★
이 목록을 만들어 두면

  · 자동 판정에서 빼냅니다                 ★
  · 사람 판정으로 보냅니다
  · 사고가 안 납니다                           ★

9. 표기 통일은 「앞으로」만

"그럼 기존 데이터를 정규화해서 저장할까요?"
안 됩니다.                                    ★
· 과거 데이터가 바뀝니다                      ★
· 고객이 쓰는 표기가 있습니다                 ★
· 도면에 박혀 있습니다                        ★
대신

  · 저장은 그대로                             ★
  · 비교할 때만 정규화                     ★
  · 앞으로 등록할 때 표기 규칙 적용        ★
    (② 기준정보 과정 11주차)

10. 오늘 해 볼 것 (15분)

① 표기 차이를 세어 보세요

  단순 비교 후보  ___쌍                        ★
  정규화 후       ___쌍                        ★
  → 줄어든 비율 ___%                           ★
② 위험 글자 목록을 만드세요

  우리 업에서 한 글자가 결정적인 것        ★

  1. ________  2. ________
  3. ________  4. ________                     ★
③ 한/영 표준을 정하세요

  개념명    한글 / 영문                        ★
  품목명    한글 / 영문
  규격      한글 / 영문                        ★

11. 내일 할 것

매핑을 어디에 적을 것인가.

엑셀에 적으면 3개월 뒤 죽습니다. 살아 있게 두는 자리를 정합니다.


이 글은 온톨로지 적용하기 과정의 5주차 2일차입니다. 과정 전체 보기

진도와 검색이 되는 판: AXPulse 기술따라가기

댓글

이 블로그의 인기 게시물

자재관리는 잘 쓰는데 BOM은 엑셀입니다

협력사 AI 로봇 도입, 공급망 스마트 제조 생태계 대응 전략

개발 테스트 자동화, AI 에이전트와 MCP 도입 전략