Skip to content

Learning path · Embeddings & Representation · 36

Vector Similarity

Scoring how close two embeddings are—usually cosine similarity or dot product—to rank candidates for retrieval.

Why it matters

  • Similarity threshold choices control precision-recall tradeoffs.
  • Normalization affects comparability across indexes.
  • Hybrid search combines similarity with lexical scores.

Key ideas

  • Cosine similarity
  • Dot product
  • Distance metrics

Vector similarity turns geometry into ranking. Cosine similarity ignores magnitude—good when embeddings are normalized. Dot product favors longer vectors—common in some ANN libraries. Calibrate thresholds on labeled query sets; a single global cutoff rarely works across product areas. Log similarity scores in observability pipelines to debug "why didn't we retrieve the obvious doc?". Visualize score distributions per collection during index health checks; sudden shifts often precede user complaints about "search feels broken.". Ship only after eval gates pass on representative production failures.

Updated 2026-08-09 · Full learning path