nvidia/llama-nemoretriever-colembed-3b-v1
Primitive: /encode · Encode ·
llama_nemoretrievercolembed
The nvidia/llama-nemoretriever-colembed-3b-v1 is a late interaction embedding model fine-tuned for query-document retrieval. Users can input `queries`, which are text, or `documents` which are page images, to the model.
Overview
Hardware: — drives latency, throughput & cost
| Size | 4.4B params |
|---|---|
| Tasks | /encode |
| License | other |
| Languages | multilingual |
| Latency | 6.1 s |
| Throughput | 0.7 img/s |
| Cost | — /1M tok |
Cost is approximate — computed from list GPU prices; your actual price depends on the provider you deploy SIE with.
Embedding
| Output types | Multi-Vec |
|---|---|
| Dimensions | multivector: 128 |
| Max sequence length | 8,192 |
| Inputs | text · image |
Benchmarks
Vidore3ComputerScienceRetrieval
Visual document retrieval on computer science papers and slides
Vidore3FinanceEnRetrieval
Visual document retrieval on financial reports
Vidore3HrRetrieval
Visual document retrieval on HR-related documents
Vidore3PharmaceuticalsRetrieval
Visual document retrieval on pharmaceutical documents