너무 어렵다. 사실 여태까지 어렵지 않았던 것은 없었다.
첫술에 배부를 수 없다고, 반복해서 보다보면 익숙해지고 잘하게 되겠지.
sql도 파이썬도 그랬다. 나아질거란 믿음으로 차근차근 파이팅하자!
요약/나만의 인사이트
- sorted 함수는 이터러블한(순회가능한) 리스트, 문자열, 튜플을 받아서 리스트로 반환한다.
s = "Zbcdefg" answer = sorted(s, reverse=True) print(answer) # ['g', 'f', 'e', 'd', 'c', 'b', 'Z']
- 데이터의 특성에 따라 분포를 고르는 것이 중요하다.
- 데이터 수가 충분하면 → 정규분포
- 데이터 수가 작으면 → 스튜던트 t분포
- 일부 데이터가 전체적으로 큰 영향을 끼치면 → 롱 테일 분포(파레토 분포)
- 범주형 데이터의 독립성 검정이나 적합도 검정 시 → 카이 제곱 분포
- 결과가 두개(성공 또는 실패)만 나오면 → 이항 분포
- 특정 공간, 시간에서 발생하는 사건 → 푸아송 분포
- 데이터 분석가는 사실을 기반으로 해석해서 의사결정을 돕는 사람이다. 따라서 잘 해석하고 설득력있는 제안을 위해선 통계적 지식이 매우매우 중요하다.
- 추론통계는 확률로 불확실성을 다루는 통계이다.
새롭게 알게 된 것
- 모집단과 표본
- 모집단 : 전체 / 표본 : 일부
- 모집단을 조사하면 좋지만 비용,시간,접근성 문제로 표본을 사용한다.
- 다만, 표본을 추출할 시 편향을 최소화하고 모집단의 특성을 포함할 수 있어야 한다.
import numpy as np import matplotlib.pyplot as plt # 모집단 생성 (예: 국가의 모든 성인의 키 데이터) population = np.random.normal(170, 10, 1000) # 표본 추출 sample = np.random.choice(population, 100) plt.hist(population, bins=50, alpha=0.5, label='population', color='blue') plt.hist(sample, bins=50, alpha=0.5, label='sample', color='red') plt.legend() plt.title('population and sample distribution') plt.show()- np.random.normal : 랜덤하게 정규분포(가우시안 분포)로 난수(무작위로 만들어진 수) 생성하기
- 정규분포: 평균과 표준편차를 중심으로 데이터가 대칭적으로 분포하는 분포
- loc=정규분포의 평균, scale=정규분포의 표준편차, size=배열의 크기
- numpy.random.normal(loc=0.0, scale=1.0, size=None)
- np.random.choice(population, 100): 주어진 배열에서 임의로 샘플링, population에서 임의로 100개 샘플링
- bins : 히스토그램 구간, 정수나 리스트형태로 작성할 수 있음.
- alpha: 막대의 투명도 0(투명) ~ 1(불투명)
- label: 범례
- 표본오차와 신뢰구간
- 표본오차
- 표본에서 계산된 통계량과 모집단의 진짜 값 간의 차이
- 표본의 크기가 클수록 표본오차는 작아진다.
- 신뢰구간
- 모집단의 특정 파라미터(평균, 비율)에 대해 추정된 값이 포함될 것으로 기대되는 범위
- 일반적으로 95%의 신뢰수준을 많이 사용함.
- 즉 모집단은 신뢰구간 범위내, 상한값과 하간값 사이에 값이 있을 것으로 추정함.
- 정규분포
- 데이터가 평균 중심에 몰려고 있고, 평균에서 멀어질수록 빈도가 줄어듦.
- 종 모양의 대칭 분포이다.
- 표준편차가 크면 데이터의 흩어짐 정도가 크다는 말이니까 그래프의 분포도가 넓다.
- 큰 집단의 데이터는 정규분포를 따르는 경향이 있다. 즉 평균 주위에 많은 값들이 위치하고, 극단적인 값은 적다.
- 표본오차

- 긴 꼬리 분포
- 부유층이 전체 소득에서 큰 비중을 차지, 아마존 인기 제품이 전체 매출의 80%를 차지, 소수 베스트셀러가 전체 판매량의 대부분을 차지한다와 같은 사례
- 긴 꼬리 분포를 보임. 이를 롱테일 현상이라고 말하기도 함.
- 비대칭적이며 데이터수가 많아져도 정규분포가 될 수 없다.
- 따라서 롱 테일 현상을 보이면 “아 이건 긴 꼬리 분포구나”라고 해석하는 것이 좋다.

- 스튜던트 t분포
- 약물 시험과 같이 표본이 작을 때 정규분포 대신 사용
- 데이터 수가 많으면 정규 분포가 된다.
- 자유도가 커질수록 정규분포에 가까워진다.
- 자유로란 자유롭게 변할 수 있는 값의 개수를 뜻한다. 전체 데이터 중에서 통계량(ex 평균)을 구하는데 제약을 받지 않는 값의 개수이다.

-
- 카이제곱분포
- 성별이나 나에에 따른 선거 후보 지지율, 성별과 직업 선택 간의 관계 검토, 주사위의 각 면이 동일한 확률로 나오는지 검토 등
- 범주형 데이터의 독립성 검정(영향)이나 적합도 검정(실제 확률에 맞게 구현되었는가)에 사용되는 분포

- 카이제곱분포
- 이항분포
- 동전을 10번 던졌을 때, 앞면이 나오는 횟수 / 제조업체가 제품의 불량률을 모니터링할 때 등 결과가 2개가 나오는 상황일 때 사용하는 분포
- 이산형 분포라고 지칭하기도 함.
- 데이터가 커지면 커질수록 정규분포 양상을 띈다.
- 푸아송분포
- 특정시간 동안 콜센터에 오는 전화의 수, 특정 시간동안 수신되는 문자의 수
- 람다가 무한으로 가면 정규분포 모양을 보인다.
- λ람다 = 평균 발생률 (주어진 시간이나 공간에서 사건이 몇번 발생했는가?)
통계란?
- 사실을 해석하게 해주는 논리적 도구이다. ex ~때문에 유입률이 감소했을 것이다.
- 데이터분석가는 사실을 바탕으로 해석하고 의사결정의 근거를 제공하는 사람
기술통계란?
- 데이터를 요약하고 기술하는 통계
- 평균, 최빈값, 중앙값, 분산, 표준편차, 왜도, 청도
- 모집단의 분포 형태와 상관없이 표본을 여러번 추출해 평균을 구하면 평균들의 분포는 정규분포에 가까워진다. 하지만 표본마다 평균은 조금씩 달라질 것이고, 표본 평균들의 퍼짐(변동성)을 나타내는 값이 표준오차이다.
- 표준편차와 표준오차의 차이
- 표준편차: 데이터가 평균으로부터 얼마나 퍼져있는가
- 표준오차: 여러 표본을 뽑았을 때 표본평균이 얼마나 흔들리는가
- 왜도와 첨도
- 왜도: 데이터가 한쪽 방향으로 쏠린 정도
- 첨도:뾰족함이나 완만한 정도
추론통계를 이해하기위한 빌드업 (확률 기초)
확률
- 0 ≤ P(A) ≤ 1
- 모든 사건의 확률을 전부 더하면 1이다.
- 확률변수는 결과를 나오기 전에는 어떤 값이 나올지 모르지만, 그 값들이 나올 확률은 알고 있는 경우이다. (ex 주사위 1/6)
확률분포
- 확률변수가 가질 수 있는 값과 그에 대한 발생 확률 간의 관계를 정리한 것
- x축은 확률변수, y축은 그 값이 나올 가능성(확률 또는 밀도)
조건부확률
- 동시확률분포
- 확률변수 2개를 동시에 생각할 때의 확률분포를 동시확률분포라고 한다.
- 예를들어 주사위1을 굴렸을 때 주사위2가 3이 나올 확률
- 조건부확률
- 어떤 정보가 주어졌을 때, 다른 사건이 일어날 확률
- P(X | Y) : Y라는 정보가 주어졌을 때, X가 일어날 조건부 확률
- 예들들어 비가 온다는 정보가 주어졌을 때, 우산을 쓸 확률
추론통계란?
- 표본을 통해 모집단을 추정하거나 가설을 검정하는 통계
- 빈도주의, 베이지만, 양측 검정, 단측 검정
- 현실에선 전수조사가 어려운데 모집단이 정규분포(종모양)이라고 가정하면 표본을 통해 모집단의 특성을 추정 가능하다.
- 예를들어 대한민국 20대 키가 정규분포를 따르면 무작위로 뽑은 20대 한명의 키가 163~177에 들어갈 확률이 68%이다.
- 우리가 관측한 데이터가 정규분포에 가까우면, 모집단도 정규분포를 따른다고 추정하고 통계 분석을 진행한다.
'기타 > 통계, 머신러닝' 카테고리의 다른 글
| 250701_기초 통계학(선형회귀, 다중선형회귀), 파이썬(클래스) (1) | 2025.07.01 |
|---|---|
| 250630_기초 통계학(모수 추정, 중심극한 정리, 표본오차와 표준편차) (7) | 2025.06.30 |
| 250627_기초 통계학(다양한 상관계수, 가설검정 시 주의점), 파이썬(map, split, strip 내장함수) (0) | 2025.06.28 |
| 250626_기초 통계학(유의성 검정, 회귀) (4) | 2025.06.26 |
| 250624_기초 통계학(상관관계, 기술통계, 추론통계) , SQL 파이썬 코드카타 (0) | 2025.06.24 |