Embeddings multilingual-e5-large para un RAG en español
multilingual-e5-large para un RAG en español: 1024 dimensiones, 512 tokens, prefijos query:/passage: obligatorios, distancia coseno. Licencia MIT.
| Modèle | intfloat/multilingual-e5-large |
|---|---|
| Dimensions | 1024 |
| Tokens max | 512 |
| Distance | cosine |
| Langues | es, en, fr, de, it, pt |
| Préfixes | query: / passage: |
| Taille des morceaux | 350 |
Notes
Los prefijos «query: » y «passage: » son obligatorios: sin ellos, la búsqueda empeora mucho. 512 tokens como máximo por texto: divide los documentos en fragmentos de unas 350 palabras. Normaliza los vectores y usa la distancia coseno. Modelo publicado por Microsoft (intfloat) con licencia MIT.
Coût estimé
Tokens d'entrée par appel : ≈ 249
| Modèle | Par appel | Pour 1 000 appels |
|---|---|---|
| Mistral Large · Mistral AI | 0,00011 € | 0,11 € |
| DeepSeek Flash · DeepSeek | 0,00007 € | 0,07 € |
| DeepSeek V4 Pro · DeepSeek | 0,00029 € | 0,29 € |
| GPT-6 Luna · OpenAI | 0,00002 € | 0,02 € |
| GPT-6 Sol · OpenAI | 0,00044 € | 0,44 € |
| Claude Sonnet 5.5 · Anthropic | 0,00044 € | 0,44 € |
| Claude Opus 5.5 · Anthropic | 0,00088 € | 0,88 € |
| Modèle open source hébergé chez soi (Ollama, vLLM) | 0 € d'API (coût du serveur seulement) | |
Coût d'entrée seulement, sans la réponse du modèle. Prix publics des fournisseurs (Mistral AI, DeepSeek, OpenAI, Anthropic), tarif standard en dollars converti en euros au taux BCE du 29 septembre 2026. Estimation : 1 token ≈ 3,6 caractères.
Commun aux 3 régions
Sources sous licence compatible.
Sources : Modelo intfloat/multilingual-e5-large, licencia MIT (ficha de Hugging Face)
Usage commercial autorisé · citer l'auteur · modifications permises.
Texte ou données seuls : aucun accès aux fichiers, au réseau ni aux commandes.
Hébergé en France (Scaleway, Paris). Aucun transfert hors UE.
Union européenne · 5/5
Aucune donnée personnelle.
Pas de données d'entraînement : pas de résumé à fournir.
États-Unis · 5/5
Aucune donnée personnelle.
Pas de données d'entraînement : pas de documentation à publier.
Chine · 5/5
Aucune donnée personnelle.
Pas de données d'entraînement ; les contenus générés par IA diffusés en Chine doivent être marqués (2025).
Synthèse indicative au 30/09/2026, sans valeur de certification juridique. Méthode et sources →
Statistiques
J'aime : 0 · Commentaires : 0
Cliquez sur un compteur pour l’afficher ou le masquer, survolez le graphique pour le détail. Une vue par visiteur et par jour, robots exclus ; décompte commencé le 30 septembre 2026.
- Identifiant
- contextetech--multilingual-e5-large-rag-espanol
- Type
- Embeddings
- Fichier
- multilingual-e5-large-rag-espanol.embedding.json
- Format
- JSON (application/json)
- Taille
- 685 octets
- Encodage
- UTF-8
- Tokens estimés
- ≈ 190
- Langue
- Espagnol
- Licence
- MIT
- Usage commercial
- Autorisé
- Données personnelles
- Aucune
- Version
- 1.0
- Publié le
- 3 octobre 2026 à 05:20
- Mis à jour le
- 3 octobre 2026 à 05:20
- Stockage
- en base
- Utilisations
- 0
- J'aime
- 0
multilingual-e5-large-rag-espanol.embedding.json
{
"format": "contextetech/embedding/v1",
"id": "contextetech/multilingual-e5-large-rag-espanol",
"description": "multilingual-e5-large para un RAG en español: 1024 dimensiones, 512 tokens, prefijos query:/passage: obligatorios, distancia coseno. Licencia MIT.",
"tags": [
"rag",
"multilingue",
"busqueda-semantica"
],
"license": "MIT",
"language": "es",
"model": "intfloat/multilingual-e5-large",
"dimensions": 1024,
"maxTokens": 512,
"distance": "cosine",
"languages": [
"es",
"en",
"fr",
"de",
"it",
"pt"
],
"prefixes": {
"query": "query: ",
"passage": "passage: "
},
"chunkSize": 350,
"benchmarks": []
}Vectoriser (Python)
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("intfloat/multilingual-e5-large")
q = model.encode(["query: votre entrée ici"], normalize_embeddings=True)
docs = model.encode(["passage: …"], normalize_embeddings=True)
print(q.shape) # (1, 1024)
print(q @ docs.T) # similarité
Communauté
Pas encore de commentaire. Partagez votre retour, il aidera les suivants.