기타/통계, 머신러닝

250704_머신러닝(지도학습-회귀, 분류)

baektree 2025. 7. 4. 19:36
더보기
  • 이번주 회고
    • Keep (잘한점/유지할점)
      • 통계, 머신러닝이 어려웠지만 거듭 복습하여 개념에 익숙해지도록 노력했다.
      • 코드타카를 풀 때 문제를 구조화했다. 문제가 요구하는것 /단계별 풀이/ 그에 따른 필요한 구문이나 함수 등을 논리적으로 생각해보려고 애썼다.
      • 틀린 문제는 위의 과정을 세세하게 거쳐 오답노트를 작성했다.
      Problem (아쉬운점)
      • 한마리 고양이의 일방적 괴롭힘(?) 이슈로 중재하느라 중간중간 학습에 집중하지 못한점이 아쉽다.
      • 통계, 머신러닝 개념이 낯설고 어려워서 이해하고 풀이하는데 한참이나 걸린 것이 아쉽다.
      • 코드타카 문제를 풀고 틀릴 때 자책하는 게 아쉽다. (나는 왜 공부를 했는데 문제를 풀지 못할까)
      Try(시도할점)
      • 하루 종일 모든 시간을 집중하는 것은 불가능하다는 걸 인정하자.
      • 우선순위가 높은(중요성, 긴급성) 과업은 15시 이전으로 계획하자.
      • 그 이후엔 풀이학습 시간을 가지자.
      • 비록 통계나 머신러닝이 아직 어렵고 괴롭(?)지만 첫술에 배부를수 없다는 점을 받아들이고 계속해서 정진하자.
      • 무엇보다 신기하고 방대한 공부를 하고 있는 나를 칭찬하며 나아질거란 믿음으로 꾸준히 정진할 것을 되새기자!

요약/나만의 인사이트

  • 지도학습은 정답값(레이블)을 알려주고 학습시키는 예측모델이다.
  • 그중에서 회귀와 분류가 있다.
  • 회귀는 연속형 결과값을 예측하는 모델이다.
    • 회귀분석에는 선형회귀, 다항회귀, 고급회귀가 있다.
    • 선형회귀는 독립변수와 종속변수가 선형적 관계를 맺고 있는 머신러닝이다.
    • 선형식의 베타를 회귀계수, 파라미터, 가중치라고 표현하는데 이 값이 클수록 종속변수에 미치는 영향이 큼을 뜻한다.
    • 선형회귀분석 이후 성능평가를 해야하는데 예측값과 실제값의 차를 데이터수로 나눠 평균을 나타내는 등 오차를 확인한다.
    • 비선형관계의 경우 다중회귀분석을 하는데, 과적합 문제가 발생할 수 있으니 유의해야 한다.
    • 과적합이란 학습은 우수하게 했으나 실전에 약한 경우를 말한다.
  • 분류는 이산형 결과값을 예측하는 모델이다.
    • 분류에는 로지스틱 회귀와 SVM이 있다.
    • SVM은 데이터를 가장 잘 구분하는 경계를 찾는 알고리즘을 말한다.
    • 분류 역시 모델 평가 방법이 있는데 (오차가 얼마인지 계산) 이때 혼동행렬이 매우 중요하니 유념해야 한다.
    • 혼동행렬은 실제값과 예측값을 행렬관계로 나내낸 것이며 주요 개념은 정밀도와 재현율이 있다.
    • 정밀도는 양성이라 예측한 것 중에 실제로 양성을 맞춘 비율이다.
    • 재현율은 실제 양성 중에서 양성을 맞춘 비율이다.

이하 정리는 노션을 통해...!