Qwen Flash est le modèle le plus rapide et le moins coûteux de la famille Qwen d'Alibaba, servi via Dashscope et conçu pour les tâches sensibles à la latence. Il offre une inférence ultrarapide tout en prenant en charge l'appel d'outils (function calling), la mise en cache des prompts et la recherche web, au tarif de $0.022/M tokens en entrée et $0.22/M en sortie. Fenêtre de contexte : 1M tokens, sortie : 32K. Disponible via les protocoles OpenAI et Anthropic.
Fenêtre de contexte
1M
Tokens de sortie max
32K
Publié
2025-07-28
Capacités
Function CallingPrompt CachingRecherche web
Fournisseurs disponibles
Aliyun
Protocoles supportés
openaianthropic
Providers
Aliyun
Tokens d'entrée
$0.022/M
Tokens de sortie
$0.22/M
Lecture cache
$0.0043/M
Écriture cache
$0.027/M
Recherche web
$0.01/R
Protocols
openai
/v1/chat/completions/v1/responsesanthropic
Exemples de code
from openai import OpenAIclient = OpenAI(base_url="https://api.ofox.ai/v1",api_key="YOUR_OFOX_API_KEY",)response = client.chat.completions.create(model="bailian/qwen-flash",messages=[{"role": "user", "content": "Hello!"}],)print(response.choices[0].message.content)
Modèles associés
Questions fréquentes
Qwen Flash sur Ofox.ai coûte $0.022/M par million de tokens d'entrée et $0.22/M par million de tokens de sortie. Paiement à l'usage, sans frais mensuels.
Qwen Flash supporte une fenêtre de contexte de 1M tokens avec un maximum de 32K tokens en sortie, permettant de traiter de longs documents et de maintenir des conversations prolongées.
Configurez simplement votre URL de base sur https://api.ofox.ai/v1 et utilisez votre clé API Ofox. L'API est compatible OpenAI — changez simplement l'URL de base et la clé API dans votre code existant.
Qwen Flash supporte les capacités suivantes : Function Calling, Prompt Caching, Recherche web. Accédez à toutes les fonctionnalités via l'API unifiée Ofox.ai.