Xorbits Inference: rendere semplice il deploy dei modelli 🤖

July 19, 2026 · View on GitHub

xorbits

Xorbits Inference: rendere semplice il deploy dei modelli 🤖

Xinference Enterprise · Self-Hosting · Documentazione

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference (Xinference) è una libreria potente e versatile per modelli di linguaggio, riconoscimento vocale e modelli multimodali. Con Xinference puoi distribuire il tuo modello o modelli integrati di ultima generazione con un solo comando e servirli come servizio. Ricercatori, sviluppatori e data scientist possono sfruttare appieno le capacità dei moderni modelli di IA.

👉 Unisciti alla nostra community Discord! · Unisciti al nostro gruppo Telegram

🔥 Novità in evidenza

Miglioramenti del framework

  • Xinference 3.0.0 è disponibile con note di migrazione e modifiche incompatibili: Note di rilascio
  • Deploy nativo per agenti: Xinference si integra con Xagent fornendo pianificazione dinamica, utilizzo di tool e inferenze multi-step autonome, superando i limiti delle pipeline statiche.
  • Batching automatico: più richieste concorrenti vengono raggruppate automaticamente per aumentare significativamente il throughput. : #4197
  • Xllamacpp: nuove binding Python per llama.cpp, mantenute dal team Xinference, che supportano il batching continuo e sono più adatte alla produzione. : #2997
  • Inferenza distribuita: i modelli possono essere eseguiti attraverso più worker: #2877
  • Miglioramenti per vLLM: condivisione del KV-cache tra più repliche: #2732

Nuovi modelli

Integrazioni

  • Xagent: piattaforma enterprise per agenti con pianificazione, memoria e integrazione di tool.
  • Dify: piattaforma LLMOps per costruire rapidamente applicazioni con visualizzazione e controllo.
  • FastGPT: piattaforma di conoscenza basata su LLM per l'elaborazione dei dati e le chiamate ai modelli.
  • RAGFlow: motore RAG open-source per una comprensione profonda dei documenti.
  • MaxKB: assistente open-source per basi di conoscenza con integrazione RAG.

Funzionalità principali

🌟 Deploy di modelli semplificato: semplifica l'esposizione di LLM, modelli di riconoscimento vocale e modelli multimodali. I modelli di sperimentazione e produzione possono essere configurati e distribuiti con un unico comando.

⚡️ Modelli all'avanguardia facilmente accessibili: prova i modelli integrati con un solo comando. Xinference offre accesso a modelli open source di ultima generazione.

🖥 Supporto per hardware eterogeneo: sfrutta GPU e CPU in modo efficiente (es. tramite ggml) per accelerare l'inferenza.

⚙️ API e interfacce flessibili: API RESTful compatibile OpenAI (incluso Function Calling), RPC, CLI, Web UI, ecc.

🌐 Deploy distribuito: facilita la distribuzione dell'inferenza su più dispositivi e macchine.

🔌 Integrazioni di terze parti: integrazione con LangChain, [LlamaIndex], [Dify], [Chatbox], ecc.

Perché Xinference

FunzionalitàXinferenceFastChatOpenLLMRayLLM
API RESTful compatibile OpenAI
Integrazione vLLM
Diversi motori di inferenza (GGML, TensorRT)
Diverse piattaforme (CPU, Metal)
Deploy in cluster multi-nodo
Modelli immagine (Testo→Immagine)
Modelli di embedding testo
Modelli multimodali
Modelli vocali
Funzionalità OpenAI (Function Calling)

Come usare Xinference

  • Self-Hosting Xinference Community Edition Segui la guida di avvio per lanciare Xinference localmente. Dettagli nella documentazione: https://inference.readthedocs.io/.

  • Xinference per le aziende Sono disponibili funzionalità enterprise; per richieste contatta: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry

Rimani aggiornato

Dai una stella a Xinference su GitHub per ricevere aggiornamenti sulle release.

star-us

Getting started

Docker

Gli utenti con GPU NVIDIA possono usare l'immagine Docker di Xinference. Verifica che Docker e CUDA siano installati prima dell'uso.

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (Helm)

Dopo aver abilitato le GPU nel cluster Kubernetes, installa con:

# Aggiungi repository
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# Aggiorna indice e controlla le versioni
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# Installa Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

Ulteriori opzioni K8s nella documentazione.

Quickstart

Installa Xinference con pip:

pip install "xinference[all]"

Avvia un'istanza locale con:

$ xinference-local

Poi puoi usare la Web UI, cURL, la CLI o il client Python.

web UI

Contribuire

PiattaformaScopo
Github IssuesSegnalazione bug e richieste di feature
DiscordCollaborazione con altri utenti
TelegramDiscussioni con la community
TwitterNovità e annunci

Citazione

Se questo progetto ti è stato utile, citane il lavoro così:

@inproceedings{lu2024xinference,
    title = "Xinference: Making Large Model Serving Easy",
    author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
    booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = nov,
    year = "2024",
    address = "Miami, Florida, USA",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.emnlp-demo.30",
    pages = "291--300",
}

Collaboratori

Storico stelle

Star History Chart