Pandas 数据处理入门
DataFrame 创建/筛选/分组、读取 CSV/Excel、数据清洗
Pandas 数据处理入门
Pandas 是 Python 数据分析的基石——DataFrame 让表格数据的筛选、分组、聚合变得像 SQL 一样直观。
学完本章你将: 掌握 DataFrame 创建/筛选/分组、读写 CSV/Excel。
创建 DataFrame
python
import pandas as pd
# 从字典创建
df = pd.DataFrame({
"姓名": ["小明", "小红", "小刚"],
"年龄": [25, 22, 30],
"城市": ["北京", "上海", "北京"],
})
print(df)
筛选数据
python
# 筛选行
adults = df[df["年龄"] >= 22]
# 多条件
beijing_adults = df[(df["城市"] == "北京") & (df["年龄"] >= 25)]
# 选列
names = df["姓名"]
subset = df[["姓名", "年龄"]]
# loc / iloc
row = df.loc[0] # 按标签
row = df.iloc[0] # 按位置
分组聚合
python
# 按城市分组统计
stats = df.groupby("城市").agg(
人数=("姓名", "count"),
平均年龄=("年龄", "mean"),
最大年龄=("年龄", "max"),
)
print(stats)
读写文件
python
# 读
df = pd.read_csv("data.csv", encoding="utf-8")
df = pd.read_excel("data.xlsx", sheet_name="Sheet1")
# 写
df.to_csv("output.csv", index=False, encoding="utf-8-sig") # utf-8-sig Excel 不乱码
df.to_excel("output.xlsx", index=False)
# 快速查看
df.head() # 前 5 行
df.info() # 列类型和缺失值
df.describe() # 数值统计