Why did we open-source our inference engine? Read the post

← Catalog

lightonai/GTE-ModernColBERT-v1

Open comparison →

Primitive: /score · Score · ModernBERT

This is a PyLate model trained on the ms-marco-en-bge-gemma dataset. It maps sentences & paragraphs to sequences of 128-dimensional dense vectors and can be used for semantic textual similarity using the MaxSim operator.

Long context

Overview

Hardware: — drives latency, throughput & cost

Size149M params
Tasks /encode · /score
Licenseapache-2.0
Latency313 ms
Throughput231 tok/s
Cost$0.961 /1M tok

Cost is approximate — computed from list GPU prices; your actual price depends on the provider you deploy SIE with.

Scoring

Inputstext
Max sequence length8,192

Benchmarks

AskUbuntuDupQuestions

technology reranking en

Duplicate question detection from AskUbuntu

Corpus: 6,743 Queries: 360
default
Quality
map at 10 0.4711
mrr at 10 0.7123
muvera
Quality
ndcg at 10 0.6091
map at 10 0.4490
mrr at 10 0.6981
Reference →

CMedQAv1-reranking

medical reranking zh

Chinese medical question answering reranking (v1)

Corpus: 100,000 Queries: 2,000
default
Quality
map at 10 0.4742
mrr at 10 0.5620
muvera
Quality
ndcg at 10 0.4464
map at 10 0.3840
mrr at 10 0.4724
Reference →

CMedQAv2-reranking

medical reranking zh

Chinese medical question answering reranking (v2)

Corpus: 108,000 Queries: 4,000
default
Quality
map at 10 0.4919
mrr at 10 0.5774
muvera
Quality
ndcg at 10 0.4603
map at 10 0.3978
mrr at 10 0.4863
Reference →

CQADupstackPhysicsRetrieval

scientific retrieval en

Duplicate question retrieval from StackExchange Physics

Corpus: 38,314 Queries: 1,039
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.3527
mrr at 10 0.4063
ndcg at 10 0.4071
Performance L4-SPOT b1 c16
Corpus 1.9K tok/s
Corpus p50 509.4ms
Query 131 tok/s
Query p50 573.4ms
Performance L4 b1 c16
Corpus 1.9K tok/s
Corpus p50 509.4ms
Query 131 tok/s
Query p50 573.4ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.3031
mrr at 10 0.3561
ndcg at 10 0.3542
Reference →

CosQA

technology retrieval en

Code search with natural language queries

Corpus: 6,267 Queries: 500
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.2619
mrr at 10 0.2569
ndcg at 10 0.3448
Performance L4-SPOT b1 c16
Corpus 890 tok/s
Corpus p50 454.2ms
Query 75 tok/s
Query p50 566.6ms
Performance L4 b1 c16
Corpus 890 tok/s
Corpus p50 454.2ms
Query 75 tok/s
Query p50 566.6ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.1943
mrr at 10 0.2420
ndcg at 10 0.2579
Reference →

FiQA2018

finance retrieval en

Financial opinion mining and question answering

Corpus: 57,599 Queries: 648
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.3767
mrr at 10 0.5466
ndcg at 10 0.4593
Performance L4-SPOT b1 c16
Corpus 2.6K tok/s
Corpus p50 469.6ms
Query 303 tok/s
Query p50 278.2ms
Performance L4 b1 c16
Corpus 2.6K tok/s
Corpus p50 469.6ms
Query 303 tok/s
Query p50 278.2ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.2284
mrr at 10 0.3627
ndcg at 10 0.2968
Reference →

LegalBenchConsumerContractsQA

legal retrieval en

Question answering on consumer contracts

Corpus: 153 Queries: 396
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.7913
mrr at 10 0.7933
ndcg at 10 0.8332
Performance L4-SPOT b1 c16
Corpus 6.2K tok/s
Corpus p50 532.8ms
Query 278 tok/s
Query p50 327.3ms
Performance L4 b1 c16
Corpus 6.2K tok/s
Corpus p50 532.8ms
Query 278 tok/s
Query p50 327.3ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.6226
mrr at 10 0.6237
ndcg at 10 0.6863
Reference →

MMarcoReranking

general reranking zh

Multilingual MARCO passage reranking (Chinese)

default
Quality
map at 10 0.1688
mrr at 10 0.1735
muvera
Quality
ndcg at 10 0.1365
map at 10 0.1122
mrr at 10 0.1155
Reference →

NFCorpus

medical retrieval en

Biomedical literature search from NutritionFacts.org

Corpus: 3,593 Queries: 323
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.1392
mrr at 10 0.5808
ndcg at 10 0.3618
Performance L4-SPOT b1 c16
Corpus 4.4K tok/s
Corpus p50 463.3ms
Query 111 tok/s
Query p50 299.7ms
Performance L4 b1 c16
Corpus 4.4K tok/s
Corpus p50 463.3ms
Query 111 tok/s
Query p50 299.7ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.0932
mrr at 10 0.4580
ndcg at 10 0.2689
Reference →

SCIDOCS

scientific retrieval en

Citation prediction, document classification, and recommendation for scientific papers

Corpus: 25,656 Queries: 1,000
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.1070
mrr at 10 0.3116
ndcg at 10 0.1816
Performance L4-SPOT b1 c16
Corpus 4.4K tok/s
Corpus p50 257.6ms
Query 184 tok/s
Query p50 327.2ms
Performance L4 b1 c16
Corpus 4.4K tok/s
Corpus p50 257.6ms
Query 184 tok/s
Query p50 327.2ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.0873
mrr at 10 0.2673
ndcg at 10 0.1509
Reference →

SciFact

scientific retrieval en

Scientific claim verification using research literature

Corpus: 5,183 Queries: 300
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.7121
mrr at 10 0.7278
ndcg at 10 0.7520
Performance L4-SPOT b1 c16
Corpus 9.2K tok/s
Corpus p50 241.6ms
Query 396 tok/s
Query p50 265.9ms
Performance L4 b1 c16
Corpus 9.2K tok/s
Corpus p50 241.6ms
Query 396 tok/s
Query p50 265.9ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.6695
mrr at 10 0.6865
ndcg at 10 0.7150
Reference →

StackOverflowQA

technology retrieval en

Programming question answering from Stack Overflow

Corpus: 19,931 Queries: 1,994
default_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.5696
mrr at 10 0.5696
ndcg at 10 0.6050
Performance L4-SPOT b1 c16
Corpus 3.8K tok/s
Corpus p50 458.1ms
Query 9.2K tok/s
Query p50 222.9ms
Performance L4 b1 c16
Corpus 3.8K tok/s
Corpus p50 458.1ms
Query 9.2K tok/s
Query p50 222.9ms
muvera_candidates-k-50_candidates-model-Alibaba-NLP__gte-multilingual-base
Quality
map at 10 0.4749
mrr at 10 0.4749
ndcg at 10 0.5113
Reference →

Open source inference for agents

Open-source inference for the models behind your agents. Run it yourself, or let us run it for you.

Github 2.8K

Contact us

Tell us about your use case and we'll get back to you shortly.

Apply for an inference grant

Free capacity on our hosted cluster for selected projects. Tell us what you run and we reply by email.