로봇 데이터 관리
📌 개요
📖 핵심 개념
로봇이 만들어 내는 데이터의 종류
| 데이터 | 성격 | 관리 포인트 |
|---|---|---|
| 센서 데이터 (영상, 점군, IMU 등) | 대용량·고속 스트림 | 용량 폭발 — 선별 저장·압축 필요 |
| 운영 로그·알람 | 시간순 텍스트/이벤트 | 로테이션, 장애 분석용 보존 |
| 상태 시계열 (관절·전류·온도) | 주기적 수치 | 시계열 DB, 다운샘플링 |
| 지도·환경 모델 | 갱신되는 공간 데이터 | 버전 관리, 로봇 간 공유 |
| 작업 실적·통계 | 정형 레코드 | 관계형 DB, 트랜잭션 |
| 학습 데이터셋·모델 | 라벨·버전이 생명 | 데이터셋/모델 버전 관리 |
데이터 생애주기(Data Lifecycle)
수집 → 저장 → 처리·분석 → 활용 → 보관(아카이브) → 폐기
- 수집(Collection): 무엇을, 얼마나 자주, 어떤 품질로 모을지 정의 — 전부 모으면 저장·통신이 폭발하므로 목적 기반 선별이 원칙 (→ 수집 방식은 로봇 모니터링 프로그램)
- 저장(Storage): 데이터 성격에 맞는 저장소 선택 (아래 절)
- 처리·분석(Processing): 정제·변환 후 통계·학습에 사용
- 활용(Use): 모니터링, 예지보전, 훈련, 디지털 트윈
- 보관(Archive): 자주 안 쓰는 데이터를 저비용 저장소로 이동 (콜드 스토리지)
- 폐기(Disposal): 보존 기한이 지난 데이터의 안전한 삭제 — 개인정보는 법적 의무
저장소의 선택 — RDB, NoSQL, 시계열 DB, 오브젝트 스토리지
| 저장소 | 데이터 모델 | 강점 | 로봇에서의 용도 |
|---|---|---|---|
| 관계형 DB(RDB) | 테이블·SQL | 트랜잭션(ACID), 정합성, 복잡한 질의 | 작업 실적, 사용자·설정 관리 |
| NoSQL | 문서·키값·컬럼 등 | 유연한 스키마, 수평 확장(Scale-out) | 다양한 형식의 이벤트·메타데이터 대량 저장 |
| 시계열 DB | 타임스탬프 기반 | 시간 범위 질의·압축·다운샘플링 최적화 | 상태 모니터링 데이터 (→ 로봇 모니터링 프로그램) |
| 파일/오브젝트 스토리지 | 파일·객체 단위 | 대용량 저비용 | 영상, 점군, 지도, 모델 파일 |
스케일업(Scale-up, 수직 확장): 서버 한 대를 더 좋은 사양으로 — 한계와 비용 급증. 스케일아웃(Scale-out, 수평 확장): 서버 여러 대로 분산 — NoSQL·빅데이터 시스템의 기본 전략.
빅데이터의 3V (+5V)
- Volume(규모): 방대한 양 — 로봇 한 대가 하루 수백 GB의 센서 데이터 생성 가능
- Velocity(속도): 빠른 생성·처리 속도 — 실시간 스트림
- Variety(다양성): 정형(테이블) + 반정형(로그·JSON) + 비정형(영상·음성) 혼재
- 확장: Veracity(정확성·신뢰성), Value(가치) 를 더해 5V
데이터 품질과 전처리
분석·학습의 성패는 데이터 품질이 좌우한다 — GIGO(Garbage In, Garbage Out).
- 결측치(Missing Value) 처리: 통신 끊김 등으로 빠진 값 — 제거하거나 보간으로 채움
- 이상치(Outlier) 처리: 센서 오류로 튄 값 — 탐지 후 제거·보정 (분석 대상인 "진짜 이상"과 구별 주의)
- 정규화·표준화: 단위·범위가 다른 값들을 비교 가능한 스케일로 변환
- 라벨링(Labeling): 학습용 데이터에 정답 표기 — 품질 관리가 학습 성능을 결정 (→ 인지지능 알고리즘 설계)
백업(Backup) — 전체 · 증분 · 차등
장애·실수·랜섬웨어로부터 데이터를 지키는 마지막 방어선이다. 세 방식의 비교가 시험 포인트.
| 방식 | 백업 대상 | 백업 속도·용량 | 복원 절차 |
|---|---|---|---|
| 전체 백업(Full) | 모든 데이터 | 느림·큼 | 전체 1개만 복원 — 가장 단순 |
| 증분 백업(Incremental) | 직전 백업 이후 변경분 | 가장 빠름·작음 | 전체 + 모든 증분을 순서대로 — 가장 복잡 |
| 차등 백업(Differential) | 마지막 전체 백업 이후 변경분 | 중간 (누적되며 커짐) | 전체 + 마지막 차등 1개 — 중간 |
- 3-2-1 규칙: 데이터를 3벌 보관, 2가지 다른 매체에, 1벌은 원격지(오프사이트)에
- 백업은 복원 시험을 해봐야 완성이다 — 복원 안 되는 백업은 백업이 아니다
개인정보 보호 — 로봇 데이터의 법적 관리
로봇의 카메라·마이크가 수집하는 얼굴·음성·위치는 개인정보다. 개인정보보호법의 원칙을 지켜야 한다.
- 수집 최소화: 목적에 필요한 최소한만 수집, 수집 사실 고지·동의
- 비식별화(De-identification): 익명처리(Anonymization) — 누구인지 복원 불가능하게 (얼굴 블러링 등) / 가명처리(Pseudonymization) — 식별자를 가명으로 대체, 추가 정보와 결합하면 재식별 가능하므로 분리 보관
- 접근 통제·암호화: 권한자만 접근, 저장·전송 암호화 (→ 로봇 보안)
- 보존 기한·파기: 목적 달성 후 지체 없이 파기
📊 다이어그램 · 수식
로봇 데이터 생애주기와 저장소
graph LR
C["수집
선별·타임스탬프"] --> S["저장"]
S --> P["처리·분석
정제·라벨링"]
P --> U["활용
모니터링·훈련·예지보전"]
U --> A["보관
콜드 스토리지"]
A --> D["폐기
기한 경과 시 안전 삭제"]
S -.- DB1[("RDB
실적·설정")]
S -.- DB2[("시계열 DB
상태 스트림")]
S -.- DB3[("NoSQL
이벤트·메타")]
S -.- DB4[("오브젝트
영상·지도·모델")]백업 방식의 비교 (일요일 전체 백업 후)
graph TD
subgraph INC["증분 백업 — 직전 백업 이후 변경분"]
I0["일: 전체"] --> I1["월: 월요일 변경분"] --> I2["화: 화요일 변경분"] --> I3["수: 수요일 변경분"]
IR["수요일 복원 = 전체 + 월 + 화 + 수 (모두 필요)"]
end
subgraph DIF["차등 백업 — 마지막 전체 이후 변경분"]
D0["일: 전체"] --> D1["월: 일∼월 변경분"] --> D2["화: 일∼화 변경분"] --> D3["수: 일∼수 변경분"]
DR["수요일 복원 = 전체 + 수요일 차등 1개"]
end🎯 핵심 요약 · 암기 포인트
✏️ 예상문제
1. 로봇 상태(관절 전류·온도)의 초당 수백 건 주기 데이터를 저장하고 시간 구간 질의·다운샘플링을 효율적으로 하려 한다. 가장 적합한 저장소는?
① 관계형 DB ② 시계열 데이터베이스 ③ 텍스트 파일 1개에 계속 추가 ④ 스프레드시트
정답 및 해설
정답: ② 타임스탬프 기반 대량 스트림의 압축 저장, 시간 범위 질의, 다운샘플링에 최적화된 것이 시계열 DB다. RDB도 가능하지만 이 작업 부하에는 비효율적이다.
2. 빅데이터의 3V에 해당하지 않는 것은?
① Volume — 방대한 규모 ② Velocity — 빠른 생성·처리 속도 ③ Variety — 정형·비정형의 다양성 ④ Visibility — 화면 표시 품질
정답 및 해설
정답: ④ 3V는 Volume·Velocity·Variety다. 확장 개념으로 Veracity(신뢰성)와 Value(가치)를 더해 5V라 부른다. Visibility는 해당되지 않는다.
3. 일요일에 전체 백업을 하고 평일에는 직전 백업 이후의 변경분만 백업했다. 수요일 데이터 유실 시 복원에 필요한 것은?
① 수요일 백업 1개 ② 전체 백업 + 수요일 백업 ③ 전체 백업 + 월·화·수 백업 모두 ④ 복원이 불가능하다
정답 및 해설
정답: ③ "직전 백업 이후 변경분"은 증분 백업이다. 증분은 사슬처럼 이어지므로 전체 백업에 월→화→수 증분을 순서대로 모두 적용해야 한다. 전체+마지막 1개로 되는 것은 차등 백업이다.
4. 안내 로봇이 수집한 얼굴 영상 데이터의 관리로 적절하지 않은 것은?
① 수집 목적에 필요한 최소한만 수집하고 수집 사실을 고지한다 ② 얼굴을 블러링하는 등 비식별화 처리를 한다 ③ 접근 권한을 통제하고 저장·전송 시 암호화한다 ④ 목적 달성 후에도 언젠가 쓸 수 있으니 무기한 원본을 보관한다
정답 및 해설
정답: ④ 개인정보는 목적 달성 후 지체 없이 파기하는 것이 법적 의무다. "언젠가 쓸지 모르니 무기한 보관"은 수집 최소화·보존 기한 원칙 위반이다.
5. 가명처리(Pseudonymization)에 대한 설명으로 옳은 것은?
① 어떤 방법으로도 재식별이 불가능한 상태다 ② 식별자를 가명으로 대체한 것으로, 추가 정보와 결합하면 재식별될 수 있어 분리 보관이 필요하다 ③ 데이터를 완전히 삭제하는 것을 말한다 ④ 암호화와 완전히 같은 개념이다
정답 및 해설
정답: ② 가명처리는 이름·ID를 가명으로 바꾼 상태라 매핑 정보와 결합하면 되살아난다. 그래서 매핑 정보를 분리 보관해야 한다. 재식별이 불가능한 것은 익명처리(①)다.
🔗 관련 노트
- 로봇 훈련 프로그램 — 데이터가 원료가 되는 훈련 파이프라인
- 로봇 모니터링 프로그램 — 데이터의 수집·시계열 저장
- 로봇 보안 — 데이터 암호화·접근 통제
- 동기화 프로그램 — 로봇-서버 데이터 동기화
- 로봇과 ICT 융합 — 빅데이터·클라우드 활용의 큰 그림
- _MOC 로봇운영소프트웨어