ハイブリッド検索の例
このデモでは、ベクトル検索と全文検索を組み合わせて、ドキュメント集合に対する検索品質を向上させる方法を示します。
TiDB Hybrid Search Demo
前提条件
開始する前に、以下を確認してください。
- Python (>=3.10): Python 3.10 以降のバージョンをインストールします。
- TiDB Cloud Starter インスタンス: TiDB Cloud で無料の TiDB Cloud Starter インスタンスを作成できます。
- OpenAI APIキー: OpenAI から OpenAI APIキーを取得します。
実行方法
ステップ 1. pytidb リポジトリをクローンする
pytidb は TiDB の公式 Python SDK であり、開発者が AI アプリケーションを効率的に構築できるように設計されています。
git clone https://github.com/pingcap/pytidb.git
cd pytidb/examples/hybrid_search
ステップ 2. 必要なパッケージをインストールし、環境をセットアップする
python -m venv .venv
source .venv/bin/activate
pip install -r reqs.txt
ステップ 3. 環境変数を設定する
- TiDB Cloud console で My TiDB ページに移動し、対象の TiDB Cloud Starter インスタンス名をクリックして概要ページを開きます。
- 右上の Connect をクリックします。接続ダイアログが表示され、接続パラメータが一覧表示されます。
- 次のように、接続パラメータに従って環境変数を設定します。
cat > .env <<EOF
TIDB_HOST={gateway-region}.prod.aws.tidbcloud.com
TIDB_PORT=4000
TIDB_USERNAME={prefix}.root
TIDB_PASSWORD={password}
TIDB_DATABASE=pytidb_hybrid_demo
OPENAI_API_KEY=<your-openai-api-key>
EOF
ステップ 4. デモを実行する
オプション 1. Streamlit アプリを実行する
Web UI でデモを確認したい場合は、次のコマンドを実行します。
streamlit run app.py
ブラウザを開いて http://localhost:8501 にアクセスします。
オプション 2. デモスクリプトを実行する
スクリプトでデモを確認したい場合は、次のコマンドを実行します。
python example.py
想定される出力:
=== CONNECT TO TIDB ===
Connected to TiDB.
=== CREATE TABLE ===
Table created.
=== INSERT SAMPLE DATA ===
Inserted 3 rows.
=== PERFORM HYBRID SEARCH ===
Search results:
[
{
"_distance": 0.4740166257687124,
"_match_score": 1.6804268,
"_score": 0.03278688524590164,
"id": 60013,
"text": "TiDB is a distributed database that supports OLTP, OLAP, HTAP and AI workloads."
},
{
"_distance": 0.6428459116216618,
"_match_score": 0.78427225,
"_score": 0.03200204813108039,
"id": 60015,
"text": "LlamaIndex is a Python library for building AI-powered applications."
},
{
"_distance": 0.641581407158715,
"_match_score": null,
"_score": 0.016129032258064516,
"id": 60014,
"text": "PyTiDB is a Python library for developers to connect to TiDB."
}
]
関連リソース
- ソースコード: GitHub で見る
