Embeddings multilingual-e5-large para un RAG en español
multilingual-e5-large para un RAG en español: 1024 dimensiones, 512 tokens, prefijos query:/passage: obligatorios, distancia coseno. Licencia MIT.
| Modelo | intfloat/multilingual-e5-large |
|---|---|
| Dimensiones | 1024 |
| Tokens máx. | 512 |
| Distancia | cosine |
| Idiomas | es, en, fr, de, it, pt |
| Prefijos | query: / passage: |
| Tamaño de fragmento | 350 |
Notas
Los prefijos «query: » y «passage: » son obligatorios: sin ellos, la búsqueda empeora mucho. 512 tokens como máximo por texto: divide los documentos en fragmentos de unas 350 palabras. Normaliza los vectores y usa la distancia coseno. Modelo publicado por Microsoft (intfloat) con licencia MIT.
Coste estimado
Tokens de entrada por llamada : ≈ 249
| Modelo | Por llamada | Por 1.000 llamadas |
|---|---|---|
| Mistral Large · Mistral AI | 0,00011 € | 0,11 € |
| DeepSeek Flash · DeepSeek | 0,00007 € | 0,07 € |
| DeepSeek V4 Pro · DeepSeek | 0,00029 € | 0,29 € |
| GPT-6 Luna · OpenAI | 0,00002 € | 0,02 € |
| GPT-6 Sol · OpenAI | 0,00044 € | 0,44 € |
| Claude Sonnet 5.5 · Anthropic | 0,00044 € | 0,44 € |
| Claude Opus 5.5 · Anthropic | 0,00088 € | 0,88 € |
| Modelo de código abierto autoalojado (Ollama, vLLM) | 0 € de API (solo el coste del servidor) | |
Solo coste de entrada, sin la respuesta del modelo. Precios públicos estándar de los proveedores (Mistral AI, DeepSeek, OpenAI, Anthropic) convertidos de USD a euros al tipo del BCE del 29 de septiembre de 2026. Estimación: 1 token ≈ 3,6 caracteres.
Common to all 3 regions
Sources under a compatible licence.
Sources : Modelo intfloat/multilingual-e5-large, licencia MIT (ficha de Hugging Face)
Commercial use allowed · credit the author · changes allowed.
Text or data only: no access to files, network or commands.
Hosted in France (Scaleway, Paris). No transfer outside the EU.
European Union · 5/5
No personal data.
No training data: no summary required.
United States · 5/5
No personal data.
No training data: no documentation to publish.
China · 5/5
No personal data.
No training data; AI-generated content published in China must be labelled (2025).
Indicative summary as of 30/09/2026, not a legal certification. Method and sources →
Estadísticas
Me gusta : 0 · Comentarios : 0
Haz clic en un contador para mostrarlo u ocultarlo; pasa el ratón por el gráfico para ver el detalle. Una visita por visitante y día, sin robots; recuento iniciado el 30 de septiembre de 2026.
- Identificador
- contextetech--multilingual-e5-large-rag-espanol
- Tipo
- Embeddings
- Archivo
- multilingual-e5-large-rag-espanol.embedding.json
- Formato
- JSON (application/json)
- Tamaño
- 685 bytes
- Codificación
- UTF-8
- Tokens estimados
- ≈ 190
- Idioma
- Español
- Licencia
- MIT
- Uso comercial
- Permitido
- Datos personales
- Ninguno
- Versión
- 1.0
- Publicado el
- 3 de octubre de 2026 a las 5:20
- Actualizado el
- 3 de octubre de 2026 a las 5:20
- Almacenamiento
- en base de datos
- Usos
- 0
- Me gusta
- 0
multilingual-e5-large-rag-espanol.embedding.json
{
"format": "contextetech/embedding/v1",
"id": "contextetech/multilingual-e5-large-rag-espanol",
"description": "multilingual-e5-large para un RAG en español: 1024 dimensiones, 512 tokens, prefijos query:/passage: obligatorios, distancia coseno. Licencia MIT.",
"tags": [
"rag",
"multilingue",
"busqueda-semantica"
],
"license": "MIT",
"language": "es",
"model": "intfloat/multilingual-e5-large",
"dimensions": 1024,
"maxTokens": 512,
"distance": "cosine",
"languages": [
"es",
"en",
"fr",
"de",
"it",
"pt"
],
"prefixes": {
"query": "query: ",
"passage": "passage: "
},
"chunkSize": 350,
"benchmarks": []
}Vectorizar (Python)
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("intfloat/multilingual-e5-large")
q = model.encode(["query: tu entrada aquí"], normalize_embeddings=True)
docs = model.encode(["passage: …"], normalize_embeddings=True)
print(q.shape) # (1, 1024)
print(q @ docs.T) # similarité
Comunidad
Aún no hay comentarios. Comparte tu opinión, ayudará a los siguientes.