Vizuální odpovídání na otázky (VQA)

Multi-Modal Models with Hugging Face

James Chapman

Curriculum Manager, DataCamp

Multimodální úlohy QA

Diagram znázorňující zpracování obrazu a textu v modelu VQA

  1. Oddělené kódování textu otázky a jiné modality
Multi-Modal Models with Hugging Face

Multimodální úlohy QA

Diagram znázorňující zpracování obrazu a textu v modelu VQA

  1. Oddělené kódování textu otázky a jiné modality
  2. Kombinace zakódovaných příznaků
Multi-Modal Models with Hugging Face

Multimodální úlohy QA

Diagram znázorňující zpracování obrazu a textu v modelu VQA

  1. Oddělené kódování textu otázky a jiné modality
  2. Kombinace zakódovaných příznaků
  3. Další vrstvy modelu pro predikci tokenů odpovědi
Multi-Modal Models with Hugging Face

VQA

import requests
from PIL import Image

url = "https://www.worldanimalprotection
.org/cdn-cgi/image/width=1920,format=
auto/globalassets/images/elephants/1
033551-elephant.jpg"


image = Image.open(requests.get(url, stream=True).raw)
text = "What animal is in this photo?"

Fotografie slona v přírodě

Multi-Modal Models with Hugging Face

VQA

 

  • Model zná obrazové i textové vlastnosti mnoha objektů
  • Znovupoužitelné modely bez dalšího doladění

Diagram znázorňující zaměření na zvíře a jeho identifikaci

Multi-Modal Models with Hugging Face

VQA

from transformers import ViltProcessor, ViltForQuestionAnswering


processor = ViltProcessor.from_pretrained("dandelin/vilt-b32-finetuned-vqa") model = ViltForQuestionAnswering.from_pretrained("dandelin/vilt-b32-finetuned-vqa")
encoding = processor(image, text, return_tensors="pt")
outputs = model(**encoding)
idx = outputs.logits.argmax(-1).item()
print("Predicted answer:", model.config.id2label[idx])
Predicted answer: elephant
Multi-Modal Models with Hugging Face

Dokumentové VQA

  • Rozšíření VQA pro detekci grafů, tabulek a textu (OCR) v obrázcích
from datasets import load_dataset
from transformers import pipeline

dataset = load_dataset("lmms-lab/DocVQA")


import matplotlib.pyplot as plt plt.imshow(dataset["test"][2]["image"]) plt.show()

Obrázek dokumentu s grafy a pruhovými diagramy

Multi-Modal Models with Hugging Face

Dokumentové VQA

Logo Google Tesseract

  • Pro spuštění OCR jsou nutné další závislosti
  • pytesseract se instaluje přes pip
  • Tesseract OCR přes instalační program (např. apt-get, exe nebo homebrew/macports)

Fotografie cedule kavárny s výsledkem OCR

Multi-Modal Models with Hugging Face

Dokumentové VQA

from transformers import pipeline
pipe = pipeline("document-question-answering", "impira/layoutlm-document-qa")

result = pipe( dataset["test"][2]["image"], "What was the gross income in 2011-2012?" )
Multi-Modal Models with Hugging Face

Dokumentové VQA

print(result)
[{'score': 0.05149758607149124,
  'answer': '3 36073 Crores', ...}]

Obrázek dokumentu s grafy a pruhovými diagramy

Multi-Modal Models with Hugging Face

Pojďme si procvičit!

Multi-Modal Models with Hugging Face

Preparing Video For Download...