Seskupování a zachytávání

Regular Expressions in Python

Maria Eugenia Inzaugarat

Data Scientist

Seskupování znaků

 

Regular Expressions in Python

Seskupování znaků

 

 

re.findall(r'[A-Za-z]+\s\w+\s\d+\s\w+', text)
['Clary has 2 friends', 'Susan has 3 brothers', 'John has 4 sisters']
Regular Expressions in Python

Zachytávající skupiny

 

  • Pomocí závorek lze znaky seskupovat a zachytávat dohromady

 

Regular Expressions in Python

Zachytávající skupiny

 

  • Pomocí závorek lze znaky seskupovat a zachytávat dohromady

 

re.findall(r'([A-Za-z]+)\s\w+\s\d+\s\w+', text)
['Clary', 'Susan', 'John']
Regular Expressions in Python

Zachytávající skupiny

 

 

Regular Expressions in Python

Zachytávající skupiny

 

 

re.findall(r'([A-Za-z]+)\s\w+\s(\d+)\s(\w+)', text)
[('Clary', '2', 'friends'),
 ('Susan', '3', 'brothers'),
 ('John', '4', 'sisters')]
Regular Expressions in Python

Zachytávající skupiny

  • Zachytit konkrétní podvzor v rámci vzoru
  • Použít jej pro další zpracování
Regular Expressions in Python

Zachytávající skupiny

  • Uspořádat data
pets = re.findall(r'([A-Za-z]+)\s\w+\s(\d+)\s(\w+)', "Clary has 2 dogs but John has 3 cats")

pets[0][0]
'Clary'
Regular Expressions in Python

Zachytávající skupiny

  • Bezprostředně vlevo

    • r"apple+": + se vztahuje na e, nikoli na apple

 

  • Použít kvantifikátor na celou skupinu
re.search(r"(\d[A-Za-z])+", "My user name is 3e4r5fg")
<re.Match object; span=(16, 22), match='3e4r5f'>
Regular Expressions in Python

Zachytávající skupiny

  • Zachytit opakující se skupinu (\d+) vs. opakovat zachytávající skupinu (\d)+
my_string = "My lucky numbers are 8755 and 33"
re.findall(r"(\d)+", my_string)
['5', '3']

 

re.findall(r"(\d+)", my_string)
['8755', '33']
Regular Expressions in Python

Lass uns üben!

Regular Expressions in Python

Preparing Video For Download...