From fd0b26f009c425edf95d51cb41b5efc9bde2cfbf Mon Sep 17 00:00:00 2001 From: Klaus Hueck Date: Fri, 14 Jun 2024 13:39:13 +0200 Subject: [PATCH] Add support for jinaai/jina-embeddings-v2-base-de (#270) * feat: add support for SOTA german embedding model with long context length jinaai/jina-embeddings-v2-base-de * Fix jina de model weight --------- Co-authored-by: George --- fastembed/text/jina_onnx_embedding.py | 8 ++++++++ tests/test_text_onnx_embeddings.py | 1 + 2 files changed, 9 insertions(+) diff --git a/fastembed/text/jina_onnx_embedding.py b/fastembed/text/jina_onnx_embedding.py index a5a0806..4237847 100644 --- a/fastembed/text/jina_onnx_embedding.py +++ b/fastembed/text/jina_onnx_embedding.py @@ -24,6 +24,14 @@ supported_jina_models = [ "sources": {"hf": "xenova/jina-embeddings-v2-small-en"}, "model_file": "onnx/model.onnx", }, + { + "model": "jinaai/jina-embeddings-v2-base-de", + "dim": 768, + "description": "German embedding model supporting 8192 sequence length", + "size_in_GB": 0.32, + "sources": {"hf": "jinaai/jina-embeddings-v2-base-de"}, + "model_file": "onnx/model_fp16.onnx", + }, ] diff --git a/tests/test_text_onnx_embeddings.py b/tests/test_text_onnx_embeddings.py index 31751c9..6a420b6 100644 --- a/tests/test_text_onnx_embeddings.py +++ b/tests/test_text_onnx_embeddings.py @@ -36,6 +36,7 @@ CANONICAL_VECTOR_VALUES = { ), "jinaai/jina-embeddings-v2-small-en": np.array([-0.0455, -0.0428, -0.0122, 0.0613, 0.0015]), "jinaai/jina-embeddings-v2-base-en": np.array([-0.0332, -0.0509, 0.0287, -0.0043, -0.0077]), + "jinaai/jina-embeddings-v2-base-de": np.array([-0.0085, 0.0417, 0.0342, 0.0309, -0.0149]), "nomic-ai/nomic-embed-text-v1": np.array([0.0061, 0.0103, -0.0296, -0.0242, -0.0170]), "nomic-ai/nomic-embed-text-v1.5": np.array( [-1.6531514e-02, 8.5380634e-05, -1.8171231e-01, -3.9333291e-03, 1.2763254e-02]