기타

250825_시계열 데이터란?

baektree 2025. 8. 25. 23:07

요약/나만의 인사이트

  • 표준편차 : 값들의 흩어짐 정도 (개별 값들이 평균으로부터 얼마나 흩어져 있는가)
  • 표준오차 : 표본평균이 모집단 평균을 얼마나 잘 추정하는가 (평균의 불확실성) (표본평균이 많으면 모집단을 잘 대표하겠죠?)
    ⇒ 표준오차는 평균의 불확실성 (많이 모을수록 평균은 더 믿을 만하다.)
    ⇒표준편차는 데이터 자체의 흩어짐

새롭게 알게 된 것

시계열 데이터란?

  • 연속적인 시간 순서
  • 이전값과 현재값의 상관성
  • 일정한 시간간격 

⚡단 시간간격이 일정하지 않더라도, 작업순서로 봤을 때 연속성을 확보할 수 있다면 시계열성이 있다고 판단, 따라서 어떻게든 균일한 시간으로 바꾸거나, 불규칙한 간격 그대로(0, 1, 2, 3)두고 사용 가능

#1 불규칙한 그대로 사용
0
1
2
3

#2 리셈플로 해서 일정한 간격으로 바꾸기
daily_mean = df.resample('D').mean()

독립성인가 아닌가?

이전값이 다음값의 영향을 준다면 (=누적된 상태에 달라진다면)

출력값 자체보다는 변화량을 예측해야 한다.

예시) 100% → 운전 → 98% → 운전→ 90%

  • 자동차 배터리 량( X )
  • 자동차 배터리의 변화량 예측 ( O )
    ⇒ 모든 조건이 똑같다면, 변화량은 일정할 것 이다.

활용

2차전지, 모빌리티 등 분야에 활용됨.

 

시계열 데이터의 특성

  1. 계절성
    • 고정주기가 있음
    • EX 에어컨 사용량은 특정 계절에 따라 사용량이 올라거거나 줄어든다.
  2. 추세성
    • 시간이 지남에 따라 지속적으로 증가하거나 감소하는 영향
    • EX 연도가 증가할수록 베터리의 성능이 줄어든다.
  3. 계절적 추세변동
    • (과거) 가족 4명 → 차 1대 → 잘산다.
    • (현재) 가족 4명 → 차 여러대 → 잘산다.
    ⇒ 인구수는 감소하지만 차량 수는 증가하면서 출퇴근 시간이 늘어나고 있다.
  4. 순환변동
    • 고정된 주기는 없지만 반복되는 경향
    • 미세먼지 수치가 특정 시기에 따라 불규칙적으로 증가
  5. 우연변동
    • 예측 불가능하고 규칙성없는 무작위 변동
    • 자연재해, 네트워크 트래픽 센서 </aside>

시계열 데이터 피처 엔지니어링

  • Datetime 날짜를 연, 월, 일로 나누어야 함.
  • lag Feature이전 시간의 값들을 복사해서 옆 컬럼에 붙여서 예측에 활용하는 방법
    • 과거가 현재에 영향을 줄 수 있기 때문에 씀
  • Rolling Statistics 데이터를 일정 구간으로 묶어 평균과 표준편차를 구할 수 있음.
    • 실제 공정에서는 특정 순간의 압력, 전류로 전체적인 흐름이나 추세를 파악할 수 있음.
    • 이동평균, 이동표준편차가 비정상적으로 커진다면, 이는 공정 이상 또는 장비 고장의 초기 징후로 해석
    • 윈도우 크기 정하기(나는 어느정도의 데이터로 묶어야 하나요?) - 도메인 지식, 데이터의 주기성으로 판단
    • e.g. 윈도우 크기 3분 단위로 묶는다. → window 3 → 3분단위의 이동평균과 이동표준편차
  • diff() 이전시점과 현재 시점의 차이
    • 변화 자체가 의미있는 데이터인 경우가 많기 때문
      • 전류가 갑자기 증가했다. → 이상 징후
      • 온도가 점점 상승중이다. → 공정 이상 가능성

변화량이 있으면 방향, 속도 등 모델이 추세와 패턴을 파악할 수 있음.

  • 데이터 분석 예시
    • 일자별로 상관관계가 있더라 → 시각화 → 며칠단위로 영향이 있었는지 쪼개보자 → 3일단위로 영향이 있더라 → 롤링단위 3 → 변화 → 상관관계 0.3 이네 어느정도 있네→ 시각화 → 시계열에 대해 다 알아야함.
  • 중요성
    • 시계열 데이터 분석을 하는 회사가 많고 우리 생활에 녹아져 있기 때문에 시계열 데이터를 완벽하게 알고 가자
  •