판다스 데이터 전처리 4단계 흐름 — 개념만 알면 AI 요청이 완성된다
판다스 데이터 전처리를 4단계 흐름으로 정리했다. concat·merge·정렬·요약의 순서와 각 단계에서 AI에게 요청하는 법을 개념 중심으로 설명한다.

판다스 데이터 전처리를 4단계 흐름으로 정리했다. concat·merge·정렬·요약의 순서와 각 단계에서 AI에게 요청하는 법을 개념 중심으로 설명한다.

pandas 데이터프레임은 행과 열로 구성된 2차원 표 구조로 엑셀보다 빠르고 코드로 자유롭게 조작된다. 생성·입출력·조회·결측치·수정 5가지 핵심 영역을 단계별로 이해하면 데이터 분석 전체 흐름이 한눈에 보인다.

pandas DataFrame은 여러 자료형을 하나의 표에 담는 2차원 데이터 컨테이너다. numpy 배열과의 차이, 딕셔너리·리스트·시계열로 만드는 3가지 방법, 속성 조회 5가지와 콜럼 삭제 방법까지 익히면 판다스 기초 활용이 완성된다.

pandas 인덱싱에서 loc과 iloc의 차이는 레이블 기준인지 정수 위치 기준인지에 있다. 범위·비연속 접근, 단일값 at·iat, 불리언 필터링까지 각 방법의 쓰임새를 구분해두면 AI에게 정확한 데이터 요청이 가능해진다.

판다스 Series는 값에 인덱스 레이블을 붙인 1차원 구조다. NumPy와의 차이, Series 생성 3가지 방법, 인덱싱, 결측치 처리(isnull·notnull)까지 한 번에 정리한다.

numpy 활용, AI에게 맡기기 전에 개념부터 잡아야 한다. 배열 구조·인덱싱·집계·난수 생성 4단계에서 무엇을 결정해야 하는지, 그 판단을 AI 요청에 어떻게 녹이는지를 현장 엔지니어 언어로 정리했다.

numpy 배열이 파이썬 리스트와 다른 이유, 80배 빠른 속도의 원리, 1차원부터 4차원까지 차원 개념까지 — 현장 엔지니어 언어로 풀어낸 머신러닝 입문 필수 개념 정리

피벗 언피벗, Wide형·Long형 구조 차이부터 현장에서 언제 쓰는지까지 3단계로 완전 정리. pandas pivot_table·melt 함수 실전 적용과 RAW DATA 수집 원칙까지 엔지니어 언어로 설명한다.

엔지니어 코딩 입문은 웹이 아닌 데이터부터 시작하는 것이 핵심이다. CSV 추출→집계→Slack 전달 3단계 로드맵을 따르면 2~4주 안에 현업에 쓸 수 있는 결과물이 나온다. 도메인 지식이 강한 엔지니어일수록 입문이 더 빠르다.