Two-Tower Neural Recommenders
Dual-Encoder Query & Candidate Networks for Billions of Interactions
#Deep Learning#Recommenders#Dual-Encoder#Vector Search#Candidate Generation
Choose Presentation Mode:
STAGE 1 / 7— Anti-Pattern
Section 1: The LLM Anti-Pattern vs Right-Sized Model
The Naive Generative LLM Approach:
Deploying an LLM as a live recommendation ranking engine evaluating every candidate item sequentially with a prompt.
Why It Fails in Production:
LLMs cannot score 1,000,000 items in real time. Two-Tower models separate candidate computation offline, enabling instant millisecond vector retrieval.
Targeted Algorithm (Two-Tower Neural Recommenders)
Latency:2ms (ANN index)
Cost / 1M Ops:$0.00
Determinism:100% Vector Metric
Generative LLM Alternative
Latency:5,000ms
Cost / 1M Ops:$35,000
Determinism:Slow & Unscalable