전체 글 76

LLM(1) RAG(검색, 증강, 생성)란?

RAG(Retrieval-Augmented-Genera란?대규모 언어 모델이 응답을 생성하기 전에 외부 지식 베이스에서 관련 정보를 검색하여 그 내용을 바탕으로 답변을 생성하는 AI 프레임 워크이다. 즉 신뢰할 수 있는 지식소스를 참조하여 정확도 높은 답변을 제공하는데 주력한다. 사용예시명품 주얼리 브랜드와 라인은 다양한 약어와 비표준어로 불려지는데 (EX 오닉스5는 반클리프의 알함브라 라인) LLM은 이런 비정형 텍스트 정보를 학습하지 않아, Hallucination(환각) 즉 존재하지 않는 거짓 정보를 만들어내 응답하는 오류를 범하기 쉽다.RAG(검색 증강 생성) 이 문제를 해결한다. RAG는 사용자의 질문과 관련된 정확한 정보를 외부 지식 베이스에서 ‘검색’한 후, 이 검색된 문서(소스)를 LLM에..

기타/LLM 2025.10.14

[지리 데이터 시각화] folium을 활용해 여행 루트 시각화하기

Folium이란?python에서 지도를 생성하고 시각화하기 위한 라이브러리이다. 파이썬 코드만으로 인터페이스형 지도를 쉽게 만들 수 있는 장점이 있다.즉 지도 위에 다양한 마커와 레이어를 추가하여 풍부한 정보를 표현할 수 있게 해준다. (출처 : 위키독스) Folium을 활용한 여행루트 시각화다가오는 익산 여행을 위해 여행지와 경로를 시각화 해보고자 한다. (1) 라이브러리 불러오기import foliumfrom folium.plugins import BeautifyIconfrom IPython.display import displayfolium : 지도 위에 마커, 경로, 영역 등을 표시할 수 있는 라이브러리BeautifyIcon : folium 기본 마커 대신, 숫자나 색상으로 꾸민 마커를 만들 수..

기타 2025.10.07

[데이터 분석 환경 구축] Visual Studio Code 설치 및 가상환경 세팅

데이터분석을 할 때 가장 많이 사용한 툴 Visual Studio Code 이다.컴퓨터는 0,1 밖에 몰라서 컴퓨터와 소통하기 위한 번역기 프로그램이라고 하면 이해하기 쉬울 것 같다. 데이터 분석을 위한 초기 세팅 과정을 나열해보려고 한다.Visual Studio Code란?마이크로소프트에서 개발한 코드 편집이 가능한 에디터(IDE, Intergrated Development Environment) 이다. python 언어로 코드 작성 시 문법에 맞게 색상으로 구분해주는 사용자 편의성을 가지고 있다.코드 작성, 실행, 디버깅, 버전 관리, 자동완성 등을 한 툴안에서 제공하는 똑똑한 친구이다.설치는 다음 링크에서 쉽게 할 수 있다. (설치는 여기서 자신의 운영체제에 맞게 )이때 Add Python to P..

기타 2025.10.06

250825_시계열 데이터란?

요약/나만의 인사이트표준편차 : 값들의 흩어짐 정도 (개별 값들이 평균으로부터 얼마나 흩어져 있는가)표준오차 : 표본평균이 모집단 평균을 얼마나 잘 추정하는가 (평균의 불확실성) (표본평균이 많으면 모집단을 잘 대표하겠죠?)⇒ 표준오차는 평균의 불확실성 (많이 모을수록 평균은 더 믿을 만하다.)⇒표준편차는 데이터 자체의 흩어짐새롭게 알게 된 것시계열 데이터란?연속적인 시간 순서이전값과 현재값의 상관성일정한 시간간격 ⚡단 시간간격이 일정하지 않더라도, 작업순서로 봤을 때 연속성을 확보할 수 있다면 시계열성이 있다고 판단, 따라서 어떻게든 균일한 시간으로 바꾸거나, 불규칙한 간격 그대로(0, 1, 2, 3)두고 사용 가능#1 불규칙한 그대로 사용0123#2 리셈플로 해서 일정한 간격으로 바꾸기daily_me..

기타 2025.08.25

250821~22_heart_disease 데이터 분석 연습

실력을 향상시키기위해 캐글 데이터를 가져와 전처리를 연습해보았다. Heart_Disease Dataset 데이터 전처리 분석출처 : 캐클 데이터it is composed of 14 attributes which are age, sex, chest pain type, resting blood pressure, serum cholesterol, fasting blood sugar, resting …. 중략 ….One of the major tasks on this dataset is to predict based on the given attributes of a patient that whether that particular person has heart disese or not …환자의 주어진 속성을 ..

250819_실증 데이터로 전처리 연습하기 (24년도 어린이대공원 일일 입장객수)

전처리를 학습하면서 관련 코드를 체화할 수 있는 가장 빠른 방법은 실제 데이터로 실습하는 것이라 한다.그래서 24년도 서울어린이대공원 일일 이용객수 현황으로 전처리를 실습해 보았다. (출처: 공공데이터포털)해당 데이터를 고른 이유는 어린이 대공원을 자주 가보기도 했고, 데이터 현황이 궁금하기도해서이다. 나의 전처리 목표는 두가지 1. 평균 어느 요일에 입장객이 몰릴까?2. 어느 월에 입장객이 가장 많을까? 이를 확인하기 위해 강의를 통해 배운 코드를 적용해보았다. 1. 관련 라이브러리 import, 데이터 불러오기# 데이터 분석을 위해 관련 라이브러리 불러오기 import pandas as pdimport numpy as npimport seaborn as snsimport matplotlib.p..