전체 글 76

2025 내일배움캠프 QAQC_2기 본캠프 39일차

안녕하세요! 오늘은 본캠프 39일차입니다!오늘은 프로젝트 2일차입니다! 저희가 선택한 모빌리티 데이터에 대해 분석해보았는데,주요변수들과 Fault_Condition과의 관계를 보면상관관계도 유의미한 값이 없고 분포를 보았을 때도 별다른 유의미한 값이 없어서 팀원들간에 고민을 하다가 통계분석으로 넘어가기로 했어요!저는 온도와 Fault_Condition과의 관계와 Fuel_Efficiency와 Fault_Condition과의 관계를 분석해보았습니다! 🔹온도와 Fault_Condition 정규성 검정🔹귀무가설(H₀) : 온도는 정규분포를 따른다대립가설(H₁) : 온도는 정규분포를 따르지 않는다#Shapiro-Wilk Testfrom scipy.stats import shapirostat, p = shap..

2025 내일배움캠프 QAQC_2기 본캠프 38일차

안녕하세요! 오늘은 본캠프 37일차입니다!!오늘은 새로운 프로젝트가 시작되는 날이에요! 베이직반은 끝났지만 못 풀어본 문제들을 풀겠습니다! 1번. 인코딩 (Encoding)문제from sklearn.preprocessing import LabelEncoderimport pandas as pddf = pd.DataFrame({'색상': ['빨강', '파랑', '초록', '파랑', '빨강']})위 데이터를 라벨 인코딩 할것!색상_인코딩 이라는 새로운 칼럼으로 만들어서 전체 데이터프레임을 출력할 것from sklearn.preprocessing import LabelEncoderimport pandas as pddf = pd.DataFrame({'색상': ['빨강', '파랑', '초록', '파랑', '빨강']..

2025 내일배움캠프 QAQC_2기 본캠프 37일차

안녕하세요! 오늘은 본캠프 37일차입니다! 오늘은 과제 제출날이어서 오전부터 개인과제를 풀고 2시에 무사히 제출했어요!!통계, 머신러닝.. 어려워요...아직 이해도 잘 안되는 것 같습니다...복습할 시간도 없고 진도는 빨리 나가고 뭔가 허우적대는 느낌이에요... 🥺내일부터는 새로운 프로젝트를 시작하는데 잘 하고 싶습니다!!! 01. 계층적 군집화(Hierarchical Clustering)데이터를 계층적 구조로 군집화하는 방법으로, 트리 형태의 군집 구조를 만들어 다양한 레벨에서 군집을 관찰할 수 있습니다.계층적 군집화의 두 가지 접근법응집형(Agglomerative) - Bottom-up 방식각 데이터를 개별 클러스터로 시작가장 가까운 클러스터들을 순차적으로 합병최종적으로 하나의 클러스터가 될 때까지..

2025 내일배움캠프 QAQC_2기 본캠프 36일차

안녕하세요! 오늘은 본캠프 36일차입니다! 오늘의 베이직 문제!1번. 치료 전후 혈압 비교import pandas as pdfrom scipy import stats# 데이터: 같은 환자의 치료 전후 혈압before = [150, 155, 160, 145, 158, 162, 148, 152]after = [140, 145, 155, 138, 150, 155, 142, 145]# 정규성 검정 후 적절한 검정 수행# 빈칸: 어떤 검정을 사용해야 할까요?statistic, p_value = stats._________(before, after)print(f"검정통계량: {statistic:.4f}")print(f"p-value: {p_value:.4f}")import pandas as pdfrom scipy ..

2025 내일배움캠프 QAQC_2기 본캠프 35일차

안녕하세요! 오늘은 본캠프 35일차 입니다! 오늘의 베이직 문제!1번. 박스플롯으로 이상치 확인하기박스플롯을 통해 변수의 분포 및 이상치를 시각적으로 탐지할 수 있어야 한다.import pandas as pdimport seaborn as snsimport matplotlib.pyplot as plt# 샘플 데이터data = {'Department': ['HR', 'HR', 'HR', 'IT', 'IT', 'IT', 'Finance', 'Finance', 'Finance'],'Salary': [50000, 52000, 100000, 70000, 72000, 75000, 60000, 61000, 250000]}df = pd.DataFrame(data)import pandas as pdimport seabo..

2025 내일배움캠프 QAQC_2기 본캠프 34일차

안녕하세요 오늘은 본캠프 34일차입니다!요즘 날씨가 너무 덥네요 🥵 오늘의 베이직 문제!1번. 두 도시의 월별 평균 기온 비교다음 두 도시의 월별 평균 기온 데이터를 사용하여 하나의 그래프에 두 개의 선 그래프를 그려 두 도시의 기온 변화 추이를 비교하고 출력하세요. (x축: 월, y축: 기온, 각 도시별 라벨 명시)import matplotlib.pyplot as pltmonths = ['Jan', 'Feb', 'Mar', 'Apr', 'May']city_a_temps = [5, 7, 12, 18, 23]city_b_temps = [3, 6, 10, 15, 20]import matplotlib.pyplot as pltmonths = ['Jan', 'Feb', 'Mar', 'Apr', 'May']cit..

2025 내일배움캠프 QAQC_2기 본캠프 33일차

안녕하세요! 오늘은 본캠프 33일차입니다!오늘은 금요일!! 오늘 하루도 파이팅하고 내일 쉬어용~~ 오늘의 베이직반 문제!1번. 막대 그래프 그리기import matplotlib.pyplot as pltfruits = ['Apple', 'Banana', 'Orange']sales = [150, 200, 120]1. xlabel은 fruit2. ylabel은 sales3. title은 fruit salesfruits 리스트를 x축 레이블로, sales 리스트를 y축의 막대 높이로 사용하여 과일별 판매량을 나타내는 막대 그래프를 그려라.import matplotlib.pyplot as pltfruits = ['Apple', 'Banana', 'Orange']sales = [150, 200, 120]plt.ba..

2025 내일배움캠프 QAQC_2기 본캠프 32일차

안녕하세요! 오늘은 본캠프 32일차입니다!! 오늘의 베이직 기초 문제! 1번. 추출된 데이터 제거이름(name)과 생년월일(birth_date)이 모두 같은 행은 독창적인 고객으로 간주됩니다.이 플러그인을 제거하여 고유한 사용자 정보만 입력하세요.import pandas as pddata = {'이름': ['김철수', '이영희', '김철수', '최민수'],'birth_date': ['1990-01-01', '1985-02-14', '1990-01-01', '1992-03-21'],'email': [' a@example.com ', ' b@example.com ', ' c@example.com ', ' d@example.com ']}df = pd.DataFrame(data) import pandas as ..

2025 내일배움캠프 QAQC_2기 본캠프 31일차

안녕하세요! 오늘은 본캠프 31일차입니다! 오늘은 회귀분석 - 선형회귀에 대한 강의를 들었습니다.선형회귀 이론공통Y는 종속 변수, 결과 변수X는 독립 변수, 원인 변수, 설명 변수통계학에서 사용하는 선형회귀 식 beta0 : 편향(Bias)beta1 : 회귀 계수varepsilon : 오차(에러), 모델이 설명하지 못하는 Y의 변동성머신러닝/딥러닝에서 사용하는 선형회귀 식w: 가중치b: 편향(Bias)회귀 평가지표 - MSE에러 정의방법방법1) 에러 = 실제 데이터 - 예측 데이터 로 정의하기방법2) 에러를 제곱하여 모두 양수로 만들기, 다 합치기방법3) 데이터만큼 나누기에러 정의 방법 수식화Mean Squared Erorr(MSE)기타 평가 지표RMSE: MSE에 Root를 씌워 제곱 된 단위를 다시 ..

2025 내일배움캠프 QAQC_2기 본캠프 30일차

안녕하세요! 오늘은 본캠프 30일차 입니다!!!벌써 30일차라니 시간이 정말 빠르네요... 오늘은 통계학 기초 6주차 강의를 들었습니다!6.1 재현 가능성 - 우연히 결과가 나오는 것이 아닌, 항상 일관된 결과가 나오는지 확인!1) 재현가능성이란 무엇인가? 재현 가능성동일한 연구나 실험을 반복했을 때 일관된 결과가 나오는지 여부. 연구의 신뢰성을 높이는 중요한 요소ex) 신약을 개발할 때 실험실에서만 효과가 있는 것이 아니라 실제 상황에서도 일관된 결과가 나온다고 믿을 수 있기 때문에 개발 가능한 것최근 p값에 대한 논쟁이 두드러지고 있음p값을 사용하지 않는 것이 좋다유의수준을 0.05에서 변경하는 것이 좋다가설검정 원리상의 문제나 가설검정의 잘못된 사용이 낮은 재현성으로 이어진다는 문제 발생최근 논문을..