{ "cells": [ { "cell_type": "code", "execution_count": 1, "metadata": {}, "outputs": [], "source": [ "%load_ext autoreload\n", "%autoreload 2" ] }, { "cell_type": "code", "execution_count": 6, "metadata": {}, "outputs": [ { "data": { "text/html": [ "
\n", "\n", "\n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", " \n", "
modeldimdescriptionsize_in_GBsources
0BAAI/bge-base-en768Base English model0.50{'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-base-en.tar.gz'}
1BAAI/bge-base-en-v1.5768Base English model, v1.50.44{'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-base-en-v1.5.tar.gz', 'hf': 'qdrant/bge-base-en-v1.5-onnx-q'}
2BAAI/bge-large-en-v1.5-quantized1024Large English model, v1.51.34{'hf': 'qdrant/bge-large-en-v1.5-onnx-q'}
3BAAI/bge-large-en-v1.51024Large English model, v1.51.34{'hf': 'qdrant/bge-large-en-v1.5-onnx'}
4BAAI/bge-small-en384Fast English model0.20{'url': 'https://storage.googleapis.com/qdrant-fastembed/BAAI-bge-small-en.tar.gz'}
5BAAI/bge-small-en-v1.5384Fast and Default English model0.13{'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-small-en-v1.5.tar.gz', 'hf': 'qdrant/bge-small-en-v1.5-onnx-q'}
6BAAI/bge-small-zh-v1.5512Fast and recommended Chinese model0.10{'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-small-zh-v1.5.tar.gz'}
7sentence-transformers/all-MiniLM-L6-v2384Sentence Transformer model, MiniLM-L6-v20.09{'url': 'https://storage.googleapis.com/qdrant-fastembed/sentence-transformers-all-MiniLM-L6-v2.tar.gz', 'hf': 'qdrant/all-MiniLM-L6-v2-onnx'}
8nomic-ai/nomic-embed-text-v17688192 context length english model0.54{'hf': 'nomic-ai/nomic-embed-text-v1'}
9nomic-ai/nomic-embed-text-v1.57688192 context length english model0.54{'hf': 'nomic-ai/nomic-embed-text-v1.5'}
10thenlper/gte-large1024Large general text embeddings model1.34{'hf': 'qdrant/gte-large-onnx'}
11intfloat/multilingual-e5-large1024Multilingual model, e5-large. Recommend using this model for non-English languages2.24{'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-multilingual-e5-large.tar.gz', 'hf': 'qdrant/multilingual-e5-large-onnx'}
12sentence-transformers/paraphrase-multilingual-mpnet-base-v2768Sentence-transformers model for tasks like clustering or semantic search1.11{'hf': 'xenova/paraphrase-multilingual-mpnet-base-v2'}
13sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2384Sentence Transformer model, paraphrase-multilingual-MiniLM-L12-v20.46{'hf': 'qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q'}
14jinaai/jina-embeddings-v2-base-en768English embedding model supporting 8192 sequence length0.55{'hf': 'xenova/jina-embeddings-v2-base-en'}
15jinaai/jina-embeddings-v2-small-en512English embedding model supporting 8192 sequence length0.13{'hf': 'xenova/jina-embeddings-v2-small-en'}
\n", "
" ], "text/plain": [ " model dim \\\n", "0 BAAI/bge-base-en 768 \n", "1 BAAI/bge-base-en-v1.5 768 \n", "2 BAAI/bge-large-en-v1.5-quantized 1024 \n", "3 BAAI/bge-large-en-v1.5 1024 \n", "4 BAAI/bge-small-en 384 \n", "5 BAAI/bge-small-en-v1.5 384 \n", "6 BAAI/bge-small-zh-v1.5 512 \n", "7 sentence-transformers/all-MiniLM-L6-v2 384 \n", "8 nomic-ai/nomic-embed-text-v1 768 \n", "9 nomic-ai/nomic-embed-text-v1.5 768 \n", "10 thenlper/gte-large 1024 \n", "11 intfloat/multilingual-e5-large 1024 \n", "12 sentence-transformers/paraphrase-multilingual-mpnet-base-v2 768 \n", "13 sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 384 \n", "14 jinaai/jina-embeddings-v2-base-en 768 \n", "15 jinaai/jina-embeddings-v2-small-en 512 \n", "\n", " description \\\n", "0 Base English model \n", "1 Base English model, v1.5 \n", "2 Large English model, v1.5 \n", "3 Large English model, v1.5 \n", "4 Fast English model \n", "5 Fast and Default English model \n", "6 Fast and recommended Chinese model \n", "7 Sentence Transformer model, MiniLM-L6-v2 \n", "8 8192 context length english model \n", "9 8192 context length english model \n", "10 Large general text embeddings model \n", "11 Multilingual model, e5-large. Recommend using this model for non-English languages \n", "12 Sentence-transformers model for tasks like clustering or semantic search \n", "13 Sentence Transformer model, paraphrase-multilingual-MiniLM-L12-v2 \n", "14 English embedding model supporting 8192 sequence length \n", "15 English embedding model supporting 8192 sequence length \n", "\n", " size_in_GB \\\n", "0 0.50 \n", "1 0.44 \n", "2 1.34 \n", "3 1.34 \n", "4 0.20 \n", "5 0.13 \n", "6 0.10 \n", "7 0.09 \n", "8 0.54 \n", "9 0.54 \n", "10 1.34 \n", "11 2.24 \n", "12 1.11 \n", "13 0.46 \n", "14 0.55 \n", "15 0.13 \n", "\n", " sources \n", "0 {'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-base-en.tar.gz'} \n", "1 {'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-base-en-v1.5.tar.gz', 'hf': 'qdrant/bge-base-en-v1.5-onnx-q'} \n", "2 {'hf': 'qdrant/bge-large-en-v1.5-onnx-q'} \n", "3 {'hf': 'qdrant/bge-large-en-v1.5-onnx'} \n", "4 {'url': 'https://storage.googleapis.com/qdrant-fastembed/BAAI-bge-small-en.tar.gz'} \n", "5 {'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-small-en-v1.5.tar.gz', 'hf': 'qdrant/bge-small-en-v1.5-onnx-q'} \n", "6 {'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-bge-small-zh-v1.5.tar.gz'} \n", "7 {'url': 'https://storage.googleapis.com/qdrant-fastembed/sentence-transformers-all-MiniLM-L6-v2.tar.gz', 'hf': 'qdrant/all-MiniLM-L6-v2-onnx'} \n", "8 {'hf': 'nomic-ai/nomic-embed-text-v1'} \n", "9 {'hf': 'nomic-ai/nomic-embed-text-v1.5'} \n", "10 {'hf': 'qdrant/gte-large-onnx'} \n", "11 {'url': 'https://storage.googleapis.com/qdrant-fastembed/fast-multilingual-e5-large.tar.gz', 'hf': 'qdrant/multilingual-e5-large-onnx'} \n", "12 {'hf': 'xenova/paraphrase-multilingual-mpnet-base-v2'} \n", "13 {'hf': 'qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q'} \n", "14 {'hf': 'xenova/jina-embeddings-v2-base-en'} \n", "15 {'hf': 'xenova/jina-embeddings-v2-small-en'} " ] }, "execution_count": 6, "metadata": {}, "output_type": "execute_result" } ], "source": [ "from fastembed import TextEmbedding\n", "import pandas as pd\n", "\n", "pd.set_option(\"display.max_colwidth\", None)\n", "pd.DataFrame(TextEmbedding.list_supported_models())" ] } ], "metadata": { "kernelspec": { "display_name": "fst", "language": "python", "name": "python3" }, "language_info": { "codemirror_mode": { "name": "ipython", "version": 3 }, "file_extension": ".py", "mimetype": "text/x-python", "name": "python", "nbconvert_exporter": "python", "pygments_lexer": "ipython3", "version": "3.10.13" }, "orig_nbformat": 4 }, "nbformat": 4, "nbformat_minor": 2 }