Hybrid Search kombiniert zwei Suchstrategien: die klassische Schlüsselwortsuche (Volltext, etwa BM25) und die semantische Suche über Vektoren. Beide decken die Schwächen der jeweils anderen ab – exakte Begriffe, IDs und Fachtermini findet der Volltext, Synonyme und Umschreibungen findet die Vektorsuche.

So funktioniert die Kombination

Eine Anfrage läuft parallel gegen beide Indizes: einmal gegen den lexikalischen Index (BM25) und einmal gegen eine Vektordatenbank (etwa mit HNSW oder pgvector). Die beiden Trefferlisten werden anschließend zu einer gemeinsamen Rangfolge fusioniert.

Reciprocal Rank Fusion (RRF)

Die häufigste Fusionsmethode ist RRF (Cormack, Clarke, Büttcher, SIGIR 2009): jedes Dokument erhält pro Liste den Beitrag 1 / (k + Rang) mit typischem k = 60. Die Beiträge werden über alle Listen summiert, dann wird nach der Summe sortiert. RRF benötigt keine normalisierten Scores und funktioniert mit beliebig vielen Listen.

Einsatz in der Praxis

Hybrid Search ist Standard in RAG-Pipelines: Nach der Fusion folgt oft ein Reranking mit einem Cross-Encoder. Implementierungen bieten Elasticsearch, OpenSearch, Weaviate, Qdrant, Azure AI Search und Pinecone an.

Verwandte Grundlagen: Semantische Suche, Chunking, Top-k-Retrieval, Reranking.