Embeddings multilingual-e5-large pour un RAG en français
multilingual-e5-large pour un RAG en français : 1024 dimensions, 512 tokens, préfixes query:/passage: obligatoires, distance cosinus. Licence MIT.
| Modelo | intfloat/multilingual-e5-large |
|---|---|
| Dimensiones | 1024 |
| Tokens máx. | 512 |
| Distancia | cosine |
| Idiomas | fr, en, de, es, it, nl, pt |
| Prefijos | query: / passage: |
| Tamaño de fragmento | 350 |
Notas
Les préfixes « query: » et « passage: » sont obligatoires : sans eux, la recherche est nettement moins bonne. 512 tokens maximum par texte : découper les documents en morceaux d'environ 350 mots. Normaliser les vecteurs et utiliser la distance cosinus. Modèle publié par Microsoft (intfloat) sous licence MIT.
Coste estimado
Tokens de entrada por llamada : ≈ 249
| Modelo | Por llamada | Por 1.000 llamadas |
|---|---|---|
| Mistral Large · Mistral AI | 0,00011 € | 0,11 € |
| DeepSeek Flash · DeepSeek | 0,00007 € | 0,07 € |
| DeepSeek V4 Pro · DeepSeek | 0,00029 € | 0,29 € |
| GPT-6 Luna · OpenAI | 0,00002 € | 0,02 € |
| GPT-6 Sol · OpenAI | 0,00044 € | 0,44 € |
| Claude Sonnet 5.5 · Anthropic | 0,00044 € | 0,44 € |
| Claude Opus 5.5 · Anthropic | 0,00088 € | 0,88 € |
| Modelo de código abierto autoalojado (Ollama, vLLM) | 0 € de API (solo el coste del servidor) | |
Solo coste de entrada, sin la respuesta del modelo. Precios públicos estándar de los proveedores (Mistral AI, DeepSeek, OpenAI, Anthropic) convertidos de USD a euros al tipo del BCE del 29 de septiembre de 2026. Estimación: 1 token ≈ 3,6 caracteres.
Common to all 3 regions
Sources under a compatible licence.
Sources : Modèle intfloat/multilingual-e5-large, licence MIT (fiche Hugging Face)
Commercial use allowed · credit the author · changes allowed.
Text or data only: no access to files, network or commands.
Hosted in France (Scaleway, Paris). No transfer outside the EU.
European Union · 5/5
No personal data.
No training data: no summary required.
United States · 5/5
No personal data.
No training data: no documentation to publish.
China · 5/5
No personal data.
No training data; AI-generated content published in China must be labelled (2025).
Indicative summary as of 30/09/2026, not a legal certification. Method and sources →
Estadísticas
Me gusta : 0 · Comentarios : 0
Haz clic en un contador para mostrarlo u ocultarlo; pasa el ratón por el gráfico para ver el detalle. Una visita por visitante y día, sin robots; recuento iniciado el 30 de septiembre de 2026.
- Identificador
- contextetech--multilingual-e5-large
- Tipo
- Embeddings
- Archivo
- multilingual-e5-large.embedding.json
- Formato
- JSON (application/json)
- Tamaño
- 686 bytes
- Codificación
- UTF-8
- Tokens estimados
- ≈ 190
- Idioma
- Francés
- Licencia
- MIT
- Uso comercial
- Permitido
- Datos personales
- Ninguno
- Versión
- 1.0
- Publicado el
- 1 de octubre de 2026 a las 18:21
- Actualizado el
- 1 de octubre de 2026 a las 18:21
- Almacenamiento
- en base de datos
- Usos
- 0
- Me gusta
- 0
multilingual-e5-large.embedding.json
{
"format": "contextetech/embedding/v1",
"id": "contextetech/multilingual-e5-large",
"description": "multilingual-e5-large pour un RAG en français : 1024 dimensions, 512 tokens, préfixes query:/passage: obligatoires, distance cosinus. Licence MIT.",
"tags": [
"rag",
"multilingue",
"recherche-semantique"
],
"license": "MIT",
"language": "fr",
"model": "intfloat/multilingual-e5-large",
"dimensions": 1024,
"maxTokens": 512,
"distance": "cosine",
"languages": [
"fr",
"en",
"de",
"es",
"it",
"nl",
"pt"
],
"prefixes": {
"query": "query: ",
"passage": "passage: "
},
"chunkSize": 350,
"benchmarks": []
}Vectorizar (Python)
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("intfloat/multilingual-e5-large")
q = model.encode(["query: tu entrada aquí"], normalize_embeddings=True)
docs = model.encode(["passage: …"], normalize_embeddings=True)
print(q.shape) # (1, 1024)
print(q @ docs.T) # similarité
Comunidad
Aún no hay comentarios. Comparte tu opinión, ayudará a los siguientes.