Seonjin`s Tech Blog
취소

Chapter 8 - 조인

Chapter 8 - 조인 inner_join joinExpression = person["graduate_program"] == graduateProgram['id'] joinDf = person.join(graduateProgram, joinExpression) ## or joinType = 'inner' joinExpression = per...

Chapter 7 - 집계 연산

Chapter 7 - 집계 연산 집계 함수 함수 내용 count 로우 수 카운트 countDistinct 고유 레코드 수 approx_count_distinct 근사치 고유 레코드 수...

Chapter 6 - 다양한 데이터 타입 다루기

Chapter 6 - 다양한 데이터 타입 다루기 불리언 타입 다루기 from pyspark.sql.functions import col ## equal df.where("InvoiceNo = 536365")\ .select("InvoiceNo", "Description")\ .show(5, False) ## not equal df.wher...

Chapter 5 - 구조적 API 기본 연산

Chapter 5 - 구조적 API 기본 연산 Spark DataType - Python DataType 스파크 데이터 타입 파이썬 데이터 타입 데이터 타입 생성/접근용 API ByteType Int, long / (-2^8 ~ 2^8-1) ...

MapReduce란?

MapReduce란? 맵리듀스는 간단한 단위작업을 반복하여 처리할 때 사용하는 프로그래밍 모델이다. 간단한 단위 작업을 처리하는 맵(Map) 작업과 맵 작업의 결과물을 모아서 집계하는 리듀스(Reduce) 단계로 구성된다. 맵, 리듀스 작업은 병렬로 처리가 가능한 작업으로, 여러 컴퓨터에서 동시에 작업을 처리하여 속도를 높일 수 있다. Ma...

HDFS란?

HDFS란? HDFS(Hadoop Distributed File System)는 하둡에서 사용하는 파일 시스템을 말한다. HDFS의 가장 큰 목표는 범용 하드웨어(고가, 저가를 가리지 않는) 분산 파일 시스템을 목표로 한다. 다른 분산 파일 시스템(NFS, CIFS 등)과의 차이는 장애 복구성에 있으며, 별도의 전용 하드웨어는 필요로 하지 않는...

하둡이란?

하둡이란? 2006년 야후의 더그 커팅이 ‘넛치’라는 검색엔진을 개발하는 과정에서 대용량의 비정형 데이터를 기존의 RDB 기술로는 처리가 힘들다는 것을 깨닫고, 새로운 기술을 찾는 중 구글에서 발표한 GFS와 MapReduce 관련 논문을 참고하여 개발하고, 이후 아파치 재단에서 오픈 소스로 공개된 기술이다. 하둡은 하나의 좋은 컴퓨터를 이용하여...

빅데이터란?

빅데이터 분석이란? 빅데이터는 큰사이즈의 데이터로부터 유의미한 지표를 분석해 내는 것으로 정의한다. 데이터 규모에 초점을 맞춘 정의 기존 DB관리도구의 수집, 저장, 관리, 분석 역량을 넘어서는 데이터 업무 수행 방식에 초점을 맞춘 정의 다양한 종류의 대규모 데이터로부터 가치를 추...