Python 中的 AWS Boto 入门
Maksim Pecherskiy
Data Engineer
df = pd.read_csv('https://gid-staging.potholes.csv')

下载文件
s3.download_file(
Filename='potholes_local.csv',
Bucket='gid-staging',
Key='2019/potholes_private.csv')
从磁盘读取
pd.read_csv('./potholes_local.csv')
使用 '.get_object()'
obj = s3.get_object(Bucket='gid-requests', Key='2019/potholes.csv')
print(obj)

获取对象
obj = s3.get_object(
Bucket='gid-requests',
Key='2019/potholes.csv')
将 StreamingBody 读入 Pandas
pd.read_csv(obj['Body'])
示例
https://?AWSAccessKeyId=12345&Signature=rBmnrwutb6VkJ9hE8Uub%2BBYA9mY%3D&Expires=1557624801
上传文件
s3.upload_file(
Filename='./potholes.csv',
Key='potholes.csv',
Bucket='gid-requests')
生成预签名 URL
share_url = s3.generate_presigned_url(
ClientMethod='get_object',
ExpiresIn=3600,
Params={'Bucket': 'gid-requests','Key': 'potholes.csv'}
)
在 Pandas 中打开
pd.read_csv(share_url)
# 创建列表保存各个 DataFrame df_list = []# 从 S3 获取带前缀的 csv 列表;取内容 response = s3.list_objects( Bucket='gid-requests', Prefix='2019/')# 获取返回内容 request_files = response['Contents']
# 遍历每个对象 for file in request_files: obj = s3.get_object(Bucket='gid-requests', Key=file['Key'])# 读为 DataFrame obj_df = pd.read_csv(obj['Body'])# 追加到列表 df_list.append(obj_df)
# 合并列表中的所有 DataFrame df = pd.concat(df_list)# 预览 DataFrame df.head()

先下载再打开
s3.download_file()
直接打开
s3.get_object()
生成预签名 URL
s3.generate_presigned_url()
用 .format() 生成
'https://{bucket}.{key}'
用 .get_presigned_url() 生成
'https://?AWSAccessKeyId=12345&Signature=rBmnrwutb6VkJ9hE8Uub%2BBYA9mY%3D&Expires=1557624801'
Python 中的 AWS Boto 入门