pandas.DataFrame.duplicated — pandas 3.0.5 documentation
Only consider certain columns for identifying duplicates, by default use all of the columns.
pandas.pydata.org
DataFrame.duplicated(subset=None, keep='first')
duplicated() -> 중복된 행(데이터)를 찾아서 Boolean(True/False)로 반환
- Option
- subset = 특정 열(columns)만 이용 , default = all column
- keep
- ='first' : 중복된 값 증 처음 등장한 값 : False 그 뒤로는 True
- ='last' : 중복된 값 중 마직막 등장 값 : False 그 앞으로는 True
- =False : 중복이 발생한 값의 모든 위치를 True
예시]
import pandas as pd
s = pd.Series([0.0, 1215.0, 1215.0, 3480.0, 3480.0, 6371.0])
# 1. 기본값 (keep='first') -> 두 번째로 나온 중복값만 True
print(s.duplicated())
# 결과: [False, False, True, False, True, False]
# 2. keep=False -> 중복된 값 전체를 True로 선택
print(s.duplicated(keep=False))
# 결과: [False, True, True, True, True, False]
# 3. 중복된 고유 반경값만 추출
print(s[s.duplicated(keep=False)].unique())
# 결과: array([1215., 3480.])
'Python > pandas' 카테고리의 다른 글
| Pandas - read_csv() -text파일, csv파일 불러오기 (0) | 2026.04.07 |
|---|