Dotazování s agentem Databricks SQL

Databricks with the Python SDK

Avi Steinberg

Senior Software Engineer

Databricks Unity Catalog

  • Hlavní způsob ukládání dat v Databricks
  • Obsahuje schémata, která mohou zahrnovat více tabulek
  • Tabulky lze vytvářet z různých zdrojů
  • Vzorový katalog obsahuje několik open-source schémat

Databricks Unity Catalog

1 https://docs.databricks.com/aws/en/catalogs/
Databricks with the Python SDK

LangChain

  • Knihovna pro tvorbu a nasazení LLM aplikací
  • Umožňuje vytvářet AI agenty dotazující se na data pomocí SQL LangChain
Databricks with the Python SDK

Závislosti LangChain pro Python

Instalace závislostí Pythonu:

pip install --upgrade databricks-langchain langchain-community langchain 
                      databricks-sql-connector databricks-sqlalchemy

Import knihoven:

from langchain_community.agent_toolkits import create_sql_agent
from langchain_community.agent_toolkits import SQLDatabaseToolkit
from langchain_community.utilities import SQLDatabase
from databricks_langchain import ChatDatabricks
Databricks with the Python SDK

ID SQL Warehouse v Databricks

Detaily připojení k SQL Warehouse v Databricks

Databricks with the Python SDK

Ověření LangChain v pracovním prostoru Databricks

Export proměnných prostředí:

os.environ["DATABRICKS_TOKEN"] = "<Your-Access-Token>"
os.environ["DATABRICKS_HOST"] = "<your-workspace-id>.cloud.databricks.com"
Databricks with the Python SDK

Agent Databricks SQL

  • Dotazování AI agenta na data ve schématu katalogu Databricks
  • Agent dokáže odpovídat na otázky o datech pomocí SQL
  • Pomocí verbose=True zobrazíte postup agenta

Výstup dotazu LangChain

Databricks with the Python SDK

Dotazování katalogu pomocí agenta Databricks SQL

db = SQLDatabase.from_databricks(
    catalog="samples", 
    schema="nyctaxi",
    warehouse_id=warehouse_id)
llm = ChatDatabricks(
    endpoint="databricks-meta-llama-3-3-70b-instruct",
    temperature=0.1,
    max_tokens=100)
toolkit = SQLDatabaseToolkit(db=db, llm=llm)
agent = create_sql_agent(llm=llm, toolkit=toolkit, verbose=True)
# Query the Databricks SQL Agent
result = agent.run("What's the time and distance of the longest trip?")
print(result)
1 https://docs.databricks.com/aws/en/large-language-models/langchain#databricks-sql-agent
Databricks with the Python SDK

Vytvoření SQL databáze LangChain z katalogu Databricks

db = SQLDatabase.from_databricks(
    catalog="samples", 
    schema="nyctaxi",
    warehouse_id="<your-warehouse-id>"
)
1 api.python.langchain.com/en/latest/utilities/langchain_community.utilities.sql_database.SQLDatabase.html
Databricks with the Python SDK

Vytvoření LLM v LangChain pomocí základního modelu

llm = ChatDatabricks(

endpoint="databricks-meta-llama-3-3-70b-instruct",
temperature=0.1, max_tokens=100, )
  • temperature: desetinné číslo od 0 do 1 určující náhodnost odpovědí modelu
  • max_tokens: maximální počet tokenů v odpovědi
1 https://docs.databricks.com/aws/en/large-language-models/langchain
Databricks with the Python SDK

Vytvoření sady nástrojů SQL databáze v LangChain

toolkit = SQLDatabaseToolkit(db=db, llm=llm)
1 https://docs.databricks.com/aws/en/large-language-models/langchain
Databricks with the Python SDK

Vytvoření agenta Databricks SQL

agent = create_sql_agent(llm=llm, toolkit=toolkit, verbose=True)

result = agent.run("What's the time and distance of the longest trip?") display(result)
The average trip takes approximately 15 minutes.
1 https://docs.databricks.com/aws/en/large-language-models/langchain
Databricks with the Python SDK

Pojďme dotazovat data v Databricks!

Databricks with the Python SDK

Preparing Video For Download...