Xorbits Inference: rendere semplice il deploy dei modelli 🤖
July 19, 2026 · View on GitHub
Xorbits Inference: rendere semplice il deploy dei modelli 🤖
Xorbits Inference (Xinference) è una libreria potente e versatile per modelli di linguaggio, riconoscimento vocale e modelli multimodali. Con Xinference puoi distribuire il tuo modello o modelli integrati di ultima generazione con un solo comando e servirli come servizio. Ricercatori, sviluppatori e data scientist possono sfruttare appieno le capacità dei moderni modelli di IA.
🔥 Novità in evidenza
Miglioramenti del framework
- Xinference 3.0.0 è disponibile con note di migrazione e modifiche incompatibili: Note di rilascio
- Deploy nativo per agenti: Xinference si integra con Xagent fornendo pianificazione dinamica, utilizzo di tool e inferenze multi-step autonome, superando i limiti delle pipeline statiche.
- Batching automatico: più richieste concorrenti vengono raggruppate automaticamente per aumentare significativamente il throughput. : #4197
- Xllamacpp: nuove binding Python per llama.cpp, mantenute dal team Xinference, che supportano il batching continuo e sono più adatte alla produzione. : #2997
- Inferenza distribuita: i modelli possono essere eseguiti attraverso più worker: #2877
- Miglioramenti per vLLM: condivisione del KV-cache tra più repliche: #2732
Nuovi modelli
- Integrazione della serie VibeThinker (1.5B, 3B) : #5085
- Integrazione della serie Nex-N2 (mini, Pro, Pro-fp8) : #5094
- Integrazione di Unlimited-OCR : #5103
- Integrazione di Ornith-1.0-35B : #5119
- Integrazione di MiniCPM5-1B : #5010
- Integrazione della serie jina-embeddings-v5 (text-nano, text-small, omni-nano, omni-small) : #5018
- Integrazione della serie MiniCPM-V-4.6 (MiniCPM-V-4.6, MiniCPM-V-4.6-Thinking) : #5025
- Integrazione della serie Tencent Hy-MT2 (1.8B, 7B, 30B-A3B) : #5029
Integrazioni
- Xagent: piattaforma enterprise per agenti con pianificazione, memoria e integrazione di tool.
- Dify: piattaforma LLMOps per costruire rapidamente applicazioni con visualizzazione e controllo.
- FastGPT: piattaforma di conoscenza basata su LLM per l'elaborazione dei dati e le chiamate ai modelli.
- RAGFlow: motore RAG open-source per una comprensione profonda dei documenti.
- MaxKB: assistente open-source per basi di conoscenza con integrazione RAG.
Funzionalità principali
🌟 Deploy di modelli semplificato: semplifica l'esposizione di LLM, modelli di riconoscimento vocale e modelli multimodali. I modelli di sperimentazione e produzione possono essere configurati e distribuiti con un unico comando.
⚡️ Modelli all'avanguardia facilmente accessibili: prova i modelli integrati con un solo comando. Xinference offre accesso a modelli open source di ultima generazione.
🖥 Supporto per hardware eterogeneo: sfrutta GPU e CPU in modo efficiente (es. tramite ggml) per accelerare l'inferenza.
⚙️ API e interfacce flessibili: API RESTful compatibile OpenAI (incluso Function Calling), RPC, CLI, Web UI, ecc.
🌐 Deploy distribuito: facilita la distribuzione dell'inferenza su più dispositivi e macchine.
🔌 Integrazioni di terze parti: integrazione con LangChain, [LlamaIndex], [Dify], [Chatbox], ecc.
Perché Xinference
| Funzionalità | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| API RESTful compatibile OpenAI | ✅ | ✅ | ✅ | ✅ |
| Integrazione vLLM | ✅ | ✅ | ✅ | ✅ |
| Diversi motori di inferenza (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Diverse piattaforme (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Deploy in cluster multi-nodo | ✅ | ❌ | ❌ | ✅ |
| Modelli immagine (Testo→Immagine) | ✅ | ✅ | ❌ | ❌ |
| Modelli di embedding testo | ✅ | ❌ | ❌ | ❌ |
| Modelli multimodali | ✅ | ❌ | ❌ | ❌ |
| Modelli vocali | ✅ | ❌ | ❌ | ❌ |
| Funzionalità OpenAI (Function Calling) | ✅ | ❌ | ❌ | ❌ |
Come usare Xinference
-
Self-Hosting Xinference Community Edition Segui la guida di avvio per lanciare Xinference localmente. Dettagli nella documentazione: https://inference.readthedocs.io/.
-
Xinference per le aziende Sono disponibili funzionalità enterprise; per richieste contatta: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
Rimani aggiornato
Dai una stella a Xinference su GitHub per ricevere aggiornamenti sulle release.

Getting started
Docker
Gli utenti con GPU NVIDIA possono usare l'immagine Docker di Xinference. Verifica che Docker e CUDA siano installati prima dell'uso.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0
K8s (Helm)
Dopo aver abilitato le GPU nel cluster Kubernetes, installa con:
# Aggiungi repository
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Aggiorna indice e controlla le versioni
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Installa Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Ulteriori opzioni K8s nella documentazione.
Quickstart
Installa Xinference con pip:
pip install "xinference[all]"
Avvia un'istanza locale con:
$ xinference-local
Poi puoi usare la Web UI, cURL, la CLI o il client Python.

Contribuire
| Piattaforma | Scopo |
|---|---|
| Github Issues | Segnalazione bug e richieste di feature |
| Discord | Collaborazione con altri utenti |
| Telegram | Discussioni con la community |
| Novità e annunci |
Citazione
Se questo progetto ti è stato utile, citane il lavoro così:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}