LLM
Create embeddings
POST
Crée des vecteurs d’embedding à partir d’entrées texte ou média. Les requêtes contenant uniquement du texte retournent un vecteur par entrée, utile pour le retrieval, la recherche sémantique, le clustering, la classification et le RAG. Les requêtes contenant des médias (images, audio ou vidéo sous forme de data URIs base64) fusionnent toutes les entrées en un seul vecteur cross-modal — encodez chaque asset dans sa propre requête si vous avez besoin d’un vecteur par asset. Compatible avec le format de l’API OpenAI Embeddings. Le streaming n’est pas pris en charge sur cet endpoint.
Authentification
Jeton Bearer. Utilisez votre clé API comme jeton Bearer dans l’en-tête Authorization.Format :
Bearer <SUNRA_KEY>Requête
Cet endpoint attend un objet.ID du modèle d’embedding à utiliser, par exemple
google/gemini-embedding-2. Consultez la page des modèles pour les modèles d’embedding disponibles.Entrées à encoder, sous forme d’une chaîne de caractères unique ou d’un tableau de chaînes. Les entrées uniquement textuelles sont encodées indépendamment et retournent un vecteur par entrée, dans l’ordre des entrées. Les entrées média sont transmises sous forme de data URIs base64 (
data:image/png;base64,…, data:audio/mpeg;base64,…, data:video/mp4;base64,…) et peuvent être mélangées avec du texte — mais toute requête contenant des médias retourne un seul vecteur fusionné pour l’ensemble des entrées. Limites (côté amont) : au plus 6 images par requête, vidéo jusqu’à 120 secondes, et un budget combiné de 8 192 tokens toutes modalités confondues (tokens de texte ; les images comptent 258 tokens chacune, l’audio 25 tokens/seconde, la vidéo 66 tokens/seconde).Le nombre de dimensions des embeddings en sortie. Pris en charge uniquement par les modèles à dimensions de sortie flexibles (Matryoshka Representation Learning). Pour
google/gemini-embedding-2, la valeur par défaut est 3072, et les valeurs de 128 à 3072 sont prises en charge. Des valeurs plus petites tronquent le vecteur tout en préservant l’essentiel de la qualité sémantique.Le format des embeddings retournés. Soit
float (par défaut), soit base64.Réponse
Toujours
list.Une liste d’objets embedding, un par entrée, dans l’ordre des entrées.
Le modèle utilisé pour créer les embeddings.
Utilisation des tokens pour la requête. Les embeddings sont facturés uniquement sur les tokens d’entrée, avec des tarifs propres à chaque modalité (consultez la page du modèle pour les tarifs). Les requêtes contenant des médias incluent le décompte de tokens par modalité.