diff --git a/fastembed/text/pooled_embedding.py b/fastembed/text/pooled_embedding.py index f3fe607e..83364457 100644 --- a/fastembed/text/pooled_embedding.py +++ b/fastembed/text/pooled_embedding.py @@ -70,6 +70,20 @@ sources=ModelSource(hf="xenova/paraphrase-multilingual-mpnet-base-v2"), model_file="onnx/model.onnx", ), + DenseModelDescription( + model="intfloat/multilingual-e5-small", + dim=384, + description=( + "Text embeddings, Unimodal (text), Multilingual (~100 languages), 512 input tokens truncation, " + "Prefixes for queries/documents: necessary, 2024 year." + ), + license="mit", + size_in_GB=0.47, + sources=ModelSource( + hf="intfloat/multilingual-e5-small", + ), + model_file="onnx/model.onnx", + ), DenseModelDescription( model="intfloat/multilingual-e5-large", dim=1024, diff --git a/tests/test_text_onnx_embeddings.py b/tests/test_text_onnx_embeddings.py index 8744b617..a726b51d 100644 --- a/tests/test_text_onnx_embeddings.py +++ b/tests/test_text_onnx_embeddings.py @@ -37,6 +37,7 @@ "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2": np.array( [0.0361, 0.1862, 0.2776, 0.2461, -0.1904] ), + "intfloat/multilingual-e5-small": np.array([0.1460, 0.1443, -0.1638, -0.3137, 0.3968]), "intfloat/multilingual-e5-large": np.array([0.4544, -0.0968, 0.1054, -1.3753, 0.1500]), "sentence-transformers/paraphrase-multilingual-mpnet-base-v2": np.array( [0.0047, 0.1334, -0.0102, 0.0714, 0.1930]