2025 내일배움캠프 QAQC_2기

2025 내일배움캠프 QAQC_2기 6일차

mingdoremi 2025. 5. 8. 18:15

안녕하세요! 오늘은 사전캠프 6일차입니다!

5일차까지는 SQL강의를 들었었는데, 사실 ADsP시험을 앞두고 있어서 오늘은 ADsP 3과목 강의를 들었어요!

사실 준비한 기간이 너무 짧아서 시험을 칠지말지 고민을 했지만 일단 시험을 쳐보기로 결정을 했습니다!

짧지만 남은 기간동안 조금 더 열심히 해보려고요! 

유튜브 아답터님의 ADsP의 3과목인 데이터 분석 요약강의를 들었습니다! 양이 너무 방대해서 강의 내용의 적당 부분만 작성하도록 할게요!

 

1. 데이터마트

- 데이터 마트(DM) : 데이터 웨어하우스의 한 분야로 특정 목적을 위해 사용 (소규모 데이터웨어하우스)

- 요약변수와 파생변수

(1) 요약변수 : 수집된 정보를 종합한 변수로서 재활용성이 높음 (1개월간 수입)

(2) 파생변수 : 의미를 부여한 변수, 논리적 타당성 필요 (고객구매등급)

-결측값과 이상값 검색

  • EDA(탐색적 자료 분석)

- 데이터의 의미를 찾기 위해 통계, 시각화를 통해 파악

- EDA의 4가지 주제

1) 저항성의 강조 : 자료 변동에 민감하지 않음

2) 잔차 계산 : 값들이 주경향으로부터 얼마나 벗어나 있는지 확인하는 척도

3) 자료변수의 재표현 : 원래 변수를 적당한 척도로 변환

4) 그래프를 통한 현시성 : 시각화를 통하여 효율적으로 파악

  • 결측값 처리

- 존재하지 않는 데이터, null/NA로 표시

1) 완전분석법 : 결측값 가지는 데이터 삭제

2) 평균 대치법(=비조건부 평균 대치) : 단순평균으로 대치

3) 회귀 대치법(=조건부 평균 대치) : 회귀분석의 결과로 대치

4) 단순 확률 대치법 : 확률적으로 선택하여 대치

- Nearest Neighbor : 바로 가까운 응답으로 대체

- Hot-Deck : 현재 데이터 셋에서 비슷한 성향으로 대체

- Cold-Deck : 유사한 외부 출처에서 비슷한 성향으로 대체

5) 다중 대치법 : 여러 번 대치 (대치→분석→결합)

  • 이상값 처리

- 극단적으로 크거나 작은 값이며, 의미 있는 데이터일수도 있음(체중 3kg)

이상값을 항상 제거하는 것은 아님

(1) ESD(Extreme Studentized Deviation)

- 평균으로부터 표준편차의 3배 넘어가는 데이터는 이상값으로 판단

(2) 사분위수

- Q1-1.5IQR보다 작거나, Q3+1.5IQR보다 크면 이상값으로 판단

- 최솟값, 1~3사분위값, 최댓값 등을 표현하며, 평균값은 표현하지 않음.

(3) Z-Score

- 데이터를 정규화(평균 0, 표준편차1) 후, 일정 임계 값을 초과할 경우 이상값으로 판단

(4) DBScan

- 밀도를 이용하여 밀도가 적은 부분의 데이터를 이상값으로 판단

 

2. 통계분석

  • 전수조사와 표본조사

- 전수조사 : 전체를 다 조사, 시간과 비용 많이 소모

- 표본조사 : 일부만 추출하여 모집단을 분석

  • 자료의 척도 구분

1) 질적 척도

- 명목척도 : 어느 집단에 속하는지 나타내는 자료 (대학교, 성별)

- 순서척도 (서열척도) : 서열관계가 존재하는 자료 (학년, 순위)

2) 양적 척도

- 등간척도 (구간척도) : 구간 사이 간격이 의미가 있으며 덧셈과 뺄셈만 가능 (온도, 지수 등)

- 비율척도 : 절대적 기준 0이 존재하고 사칙연산 가능한 자료 (무게, 나이 등)

  • 확률적 표본 추출 방법

1) 랜덤 추출법 : 무작위로 표본 추출

2) 계통 추출법 : 번호 부여하여 일정 간격으로 추출

3) 집락 추출법(=군집 추출법)

- 여러 군집으로 나눈 뒤 군집을 선택하여 랜덤 추출

- 군집 내 이질적 특징, 군집 간 동질적 특징

4) 층화 추출법

- 군집 내 동질적 특징, 군집 간 이질적 특징

- 같은 비율로 추출 시, 비례 층화 추출법

5) 복원, 비복원 추출

- 복원 추출 : 추출되었던 데이터를 다시 포함시켜 표본 추출

- 비복원 추출 : 추출되었던 데이터는 제외하고 표본 추출

  • 비확률적 표본 추출 방법

1) 편의 추출법 : 연구자가 쉽게 접근 가능한 대상으로 표본을 추출

2) 의도적 추출법 : 연구자가 특정 기준을 정하고, 이에 맞는 표본을 추출

3) 할당 추출법 : 특정 기준으로 나눈 후, 그 그룹에서 할당된 수 만큼 추출

4) 눈덩이 추출법 : 초기 응답자로부터 새로운 응답자를 추천 받는 방식

5) 자기선택 추출법 : 응답자가 스스로 조사에 참여할지 결정

  • 기초 통계량

1) 중심경향성 측면

- 산술평균 : 일반적인 평균 개념으로, 모든 값을 더한 후 데이터 개수로 나눈 값

- 기하평균 : 모든 값을 곱하고, n 제곱근을 구하는 방식(비율적 증가율)

- 조화평균 : 역수의 산술평균을 구한 후, 다시 역수를 취하는 방식 (비율 계산)

- 중앙값 : 데이터를 크기 순서로 나열했을 때 중간에 위치한 값

- 최빈값 : 데이터에서 가장 자주 나타나는 값

2) 분산 정도 측면

- 분산 : 각 데이터가 평균과 얼마나 떨어져 있는지 나타내는 지표

- 표준편차 : 분산에 제곱근을 취한 값

- 사분위수(IQR) : 데이터의 상위 75%와 하위25%의 중간 범위

3) 관계 측면

(1) 공분산 : 두 확률변수의 상관정도

- 공분산 = 0 : 상관이 전혀 없는 상태

- 공분산 > 0 : 양의 상관관계

- 공분산 < 0 : 음의 상관관계

- 최소, 최대값이 없어 강약 판단 불가

(2) 상관계수 : 상관정도를 -1 ~ 1 값으로 표현

- 상관계수 = 1 : 정비례 관계

- 상관계수 = 0 : 상관없음

- 상관계수 = -1 : 반비례 관계

(3) 공분산과 독립성의 관계

- 두 변수가 독립이면 공분산은 0이지만, 공분산이 0이라고 두 변수가 독립이라고 할 수는 없음

  • 첨도와 왜도

1) 첨도 : 자료의 분포가 얼마나 뾰족한 지 나타내는 척도

- 첨도 = 3 : 정규 분포 형태

→ 3을 빼서 0을 기준으로 정규 분포 형태를 판단하기도 함

- 값이 클수록 뾰족한 모양

2) 왜도 : 자료 분포의 비대칭 정도 (0일때 대칭)

- 왜도 < 0 : 최빈값 > 중앙값 > 평균값

- 왜도 > 0 : 최빈값 < 중앙값 < 평균값

 


 

 

내용도 다 외우고 문제도 많이 풀어봐야하는데 양이 많네요.. .!

확률, 통계와 같은 수학을 오랜만에 만나서 기억도 가물가물..합니다..

일단 할 수 있는데까지 해보는 거죠!! 파이팅!

오늘도 수고 많으셨습니다!