전체 글 76

250630_기초 통계학(모수 추정, 중심극한 정리, 표본오차와 표준편차)

큰일이다. 정말 모르겠다. 통계... 일단 개념의 체계부터 다시 바로 잡고 필수로 알아야 하는 핵심 위주로만 철저하게 익히자! 할 수 있다!!! 요약/나만의 인사이트베이즈 정리는 관측된 결과를 보고 원인을 추정하는 것이다. 즉 P(A), P(B), P(B|A)가 있을 때 P(A|B)를 구하는 것이다.P(A|B)는 B가 일어났을 때 A가 일어날 확률을 말한다. 사후확률이라고도 한다.기술통계가 데이터를 해석하고 요약하는 통계기법이였다면 추론 통계는 표본집단을 통해 모집단을 추정하거나 어떤 주장이 맞는지 검정하는 통계이다.신뢰구간 95%는 100번 중 95번 참값 포함새롭게 알게 된 것통계와 머신러닝통계 : 해석에 초점x, y의 차이머신러닝 : 예측에 초점잘 예측하면 good통계와 머신러닝의 원리는 같음.베이..

250628_판다스(조회, 정렬, 조건필터, 통계, 복사와 결측치)

요약/나만의 인사이트데이터 분포 확인하기 .value.counts()embark_town 컬럼에 대해 데이터 분포 확인하기 df[’embark_town’].value_counts()who 컬럼에 대해 데이터 분포 확인하기 df[’who’].value_counts()정렬하기 .sort_values(by=[ ], ascending=[ ])total_bill과 tip에 대한 내림차순 정렬하기 tips.sort_values(by=[’total_bill’, ‘tip’], ascending=[False, False])size를 기준으로 내림차순, tip을 기준으로 오름차순 정렬하기 tips.sort_values(by=[’size’, ‘tip’], ascending=[False, True])인덱싱, 슬라이싱 df.l..

기타/Python 2025.06.30

250627_기초 통계학(다양한 상관계수, 가설검정 시 주의점), 파이썬(map, split, strip 내장함수)

요약/나만의 인사이트map은 반복가능한(차례차례 순회가능한) 자료형을 하나씩 꺼내 함수를 적용시킬 수 있는 내장함수이다.함수를 적용시키면 객체에 반환한다. 다만 미리 반환해 두는 게 아니라 호출 시 반환하는 형태이다..strip()은 문자열 앞뒤 공백을 삭제해주는 내장함수이다. “ ab “ → “ab”.split()은 문자열을 공백으로 나눠 리스트에 반환해주는 내장함수이다. “a, b” → [’a’, ‘b’]다양한 상관계수가 있고 선형, 비선형 관계를 나타낼 때 사용한다.가설검정 시 다양한 주의점들이 있는데 재현 가능성의 보장, 선택적 보고 지양, 원하는 결과가 나올 때까지 자료수집하는 것을 지양 등이 있다.새롭게 알게 된 것상관계수피어슨 상관계수x와 y의 선형 관계를 보여줌.-1에서 1사의 값을 가지며..

250626_기초 통계학(유의성 검정, 회귀)

어려운 문제로 약 한시간 동안 골머리를 앓다가 튜터님께 도움의 손길을 요청했다.문제에 요구되는 중요한 개념을 전해 듣고, 후속 풀이의 실마리를 받아냈다. 마침내 1시간의 추가 고뇌 시간을 거친쳐 해결할 수 있었다. 감사한 마음을 담아 메시지를 보내니 아래와 같이 답신주셨다. 머리 끙끙 풀어낸 문제가 큰 성장에 도움이 된다란 말... 정말 감격스러웠다. SQL, 파이썬을 공부하며 재미는 있었지만, 개념을 숙지했는데도 도통 문제가 풀리지 않아 좌절했던 나날이 있었다.주말 모두를 할애하여 보충학습을 했는데도 나의 학습 상향 속도는 미진했다. 퇴사 후 호기롭게 선택한 이 길에서 난 노력했는데도 안되다며 절망스런 시간들이었다.고개를 축 늘어뜨린채 한숨을 내쉬었지만 포기할 순 없었다. 마음을 다잡아보았다."아직..

250625_기초 통계학(다양한 분포들)

너무 어렵다. 사실 여태까지 어렵지 않았던 것은 없었다.첫술에 배부를 수 없다고, 반복해서 보다보면 익숙해지고 잘하게 되겠지.sql도 파이썬도 그랬다. 나아질거란 믿음으로 차근차근 파이팅하자! 요약/나만의 인사이트sorted 함수는 이터러블한(순회가능한) 리스트, 문자열, 튜플을 받아서 리스트로 반환한다.s = "Zbcdefg" answer = sorted(s, reverse=True) print(answer) # ['g', 'f', 'e', 'd', 'c', 'b', 'Z'] 데이터의 특성에 따라 분포를 고르는 것이 중요하다.데이터 수가 충분하면 → 정규분포데이터 수가 작으면 → 스튜던트 t분포일부 데이터가 전체적으로 큰 영향을 끼치면 → 롱 테일 분포(파레토 분포)범주형 데이터의 독립성 검정이나 적합..

250624_기초 통계학(상관관계, 기술통계, 추론통계) , SQL 파이썬 코드카타

요약/나만의 인사이트분산, 표준변차는 변동성을 측정하는 두가지 주요 척도이다.표준편차는 원래 데이터 값과 동일한 단위로 변환되어 평균으로부터 대략 얼마나 떨어졌는지 확인 할 수 있다. 따라서 분산보다 직관적이라 할 수 있다.상관관계는 두 변수간의 관계를 측정하는 방법이다.1, -1에 가까우면 높은 상관관계를 뜻한다.0에 가까울수록 상관관계가 없음을 말한다.여러 변수들의 상관관계를 나타내는 것을 다변량 분석이라고 한다.pairplot(두변수간 상관관계 여러개), heatmap(색깔로 표시) 그래프로 표시할 수 있다.새롭게 알게 된 것1. 통계의 종류 기술통계 데이터를 요약하고 설명하는 통계 - 특정 대표값으로 요약단, 데이터 중 이상치라는게 항상 존재할 수 있으니 이 부분 유념해야 함.평균, 중앙값, 분..