LocalAI: alternativa open source pentru IA complet locală

  • LocalAI oferă o API compatibilă cu OpenAI pentru a rula LLM-uri, sisteme de vizualizare, audio și agenți complet local și fără a depinde de cloud.
  • Arhitectura sa modulară descarcă doar backend-urile necesare, detectează automat hardware-ul și oferă suport pentru CPU, GPU, Metal, Jetson și accelerare distribuită.
  • Ecosistemul include LocalAGI, LocalRecall și o interfață WebUI reînnoită cu suport MCP, agenți cu instrumente externe și gestionare avansată a modelelor.
  • Comunitatea derulează o foaie de parcurs foarte activă și aplicații derivate, cum ar fi clienți mobili de chat local cu inteligență artificială, orientați spre confidențialitate și utilizabili offline.

LocalAI

Dacă ești interesat să-ți configurezi propria inteligență artificială acasă sau pe serverele tale, fără să depinzi de nimeni, LocalAI a devenit una dintre referințele cheie în ecosistemul open sourceNu este doar un alt proiect: este O întreagă familie de instrumente concepute pentru a servi drept înlocuitor direct pentru API-ul OpenAI și alte platforme comercialedar rulând local, cu control deplin asupra datelor dvs. și fără cerințe obligatorii de GPU.

Departe de a fi doar un server model, LocalAI a evoluat într-un Platformă completă de agenți, memorie semantică, generare multimodală și implementare distribuităToate acestea cu o arhitectură modulară care se adaptează atât la hardware foarte modest, cât și la infrastructuri avansate cu GPU-uri, Jetson sau clustere distribuite.

Ce este LocalAI și de ce se vorbește atât de mult despre ea?

LocalAI este un proiect open-source sub licența MIT care acționează ca API REST compatibil cu specificația OpenAI (și servicii similare precum Anthropic sau Elevenlabs)Dar rulează în întregime pe propriul calculator sau pe infrastructura locală. Este întreținut de Ettore Di Giacinto și de o comunitate foarte activă și a acumulat deja zeci de mii de stele pe GitHub, reflectând un interes enorm pentru soluțiile de inteligență artificială fără cloud.

Ideea principală este că poți Folosește-ți clienții, SDK-urile și instrumentele concepute pentru API-ul OpenAI fără a fi nevoie să modifici codulPur și simplu îndreptați punctele de acces către instanța LocalAI. De acolo, puteți rula LLM-uri, genera imagini și audio, utiliza TTS, efectua căutări semantice, detectarea obiectelor și multe altele, toate local, fără a trimite date în exterior.

Unul dintre cele mai izbitoare avantaje este că Nu ai neapărat nevoie de un GPUMulte modele pot rula doar pe procesor, ceea ce deschide calea pentru montarea lor pe un NAS, un NUC, un server vechi sau orice mașină cu resurse minime, ajustând dimensiunea și cuantizarea modelelor la limitările hardware-ului.

Familia Local Stack: LocalAI, LocalAGI și LocalRecall

Pe măsură ce proiectul a crescut, s-a transformat într-un „familie” de instrumente interconectate care acoperă mult mai mult decât simpla inferență a modeluluiAstăzi, așa-numita „Local Stack” este alcătuită în principal din trei componente cheie care pot funcționa împreună sau separat.

Pe de o parte, LocalAI rămâne pilon central ca API compatibilă cu OpenAI pentru text, imagini, audio și alte modalitățiAcesta gestionează comunicarea cu diverse backend-uri de inferență (llama.cpp, vLLM, transformers, diffusers etc.) și expune o interfață standard care acceptă chat, completări, generare de imagini, TTS, încorporări, reranking și chiar endpoint-uri experimentale, cum ar fi text-video.

Alături de el apare LocalAGI, care acționează ca Platformă de gestionare a agenților prin inteligență artificială cu suport avansat pentru instrumente și fluxuri de lucru pentru agențiFuncționează ca un înlocuitor îmbunătățit pentru API-ul Response al OpenAI, permițându-vă să definiți agenți care pot raționa, planifica pași, invoca instrumente externe și coordona sarcini complexe în mod autonom, dar rulând întotdeauna local.

Al treilea element este LocalRecall, conceput ca API REST și sistem de gestionare a cunoștințelor cu memorie persistentă pentru agențiPractic, oferă stratul de stocare semantică, baza de date vectorială și gestionarea contextului pe termen lung, astfel încât agenții și modelele să își poată aminti informații, documente și stări de conversație în timp, fără a fi nevoiți să depindă de servicii externe.

Capacități cheie: dincolo de un simplu LLM local

Unul dintre motivele pentru care LocalAI a câștigat atât de multă popularitate este acela că Nu se limitează la servirea modelelor lingvistice mariProiectul acoperă o gamă foarte largă de capabilități ale inteligenței artificiale, ceea ce îl transformă într-un fel de „infrastructură generică” pentru aplicații inteligente auto-găzduite.

În domeniul limbajului, LocalAI permite rulează LLM-uri compatibile cu mai multe familii de modele (Llama, Gemma, Qwen, Phi, Mistral, SmollVLM și altele), cu suport pentru modele în format GGUF prin llama.cpp sau prin backend-uri precum transformers sau vLLM, în funcție de hardware-ul disponibil și de nevoile de performanță.

În ceea ce privește viziunea și generarea multimodală, LocalAI oferă suport pentru modelele de difuzie, editarea imaginilor, modele de limbaj vizual și detectarea obiectelor în timp realAceasta include integrarea cu proiecte precum stable-diffusion.cpp, difuzoare HuggingFace, modele precum FLUX, WAN sau Qwen 3 VL și o API dedicată pentru detectarea obiectelor, susținută de rf-detr, care poate rula foarte eficient chiar și pe CPU.

Sunetul este un alt punct forte: se integrează LocalAI backend-uri de voce în timp real, text-vorbire și recunoaștere vocală cu clonareAm găsit totul, de la whisper.cpp și faster-whisper pentru transcriere, la motoare TTS precum Bark, Bark-cpp, Coqui, Kokoro, KittenTTS, Piper, Chatterbox, neutrts sau Vibevoice, precum și modele de detectare a activității vocale (VAD), precum silero-vad, pentru a controla momentul în care se vorbește sau se întrerupe tăcerile.

Arhitectură modulară: binare ușoare și backend-uri la cerere

Una dintre cele mai importante revoluții recente ale proiectului a fost trecerea la un arhitectură complet modulară în care fișierul binar principal LocalAI este separat de backend-uriAnterior, imaginile „all-in-one” erau mari și conțineau standard toate motoarele posibile, ceea ce complica implementările și actualizările ușoare.

Cu această nouă filozofie, imaginea Docker de bază și fișierul binar LocalAI sunt mult mai mici și descarcă backend-urile necesare doar atunci când este nevoieCând instalați un model din galerie sau prin fișiere YAML, LocalAI detectează automat hardware-ul (CPU, GPU NVIDIA, AMD sau Intel) și descarcă varianta corespunzătoare a backend-ului de care are nevoie modelul.

În plus, datorită acestui design, acum Poți gestiona backend-urile independent dintr-o galerie dedicată, chiar și folosind versiuni de dezvoltare.Asta înseamnă că nu trebuie să aștepți o nouă versiune LocalAI pentru a încerca cele mai recente versiuni llama.cpp, whisper.cpp sau diffusers: pur și simplu actualizează componenta respectivă, iar sistemul o va folosi din mers.

Un alt detaliu practic foarte apreciat de cei care lucrează în medii izolate sau cu cerințe foarte specifice este capacitatea de a încărca backend-uri personalizate prin simpla copiere a fișierelor binare într-un folder desemnatFără a recompila containere întregi, puteți testa versiuni optimizate, variante pentru arhitecturi specifice sau versiuni de backend-uri cu patch-uri actualizate fără a afecta întregul sistem.

Compatibilitate cu mai multe backend-uri AI

LocalAI integrează o listă cu adevărat extinsă de backend-uri pentru a acoperi diferite tipuri de modele și cazuri de utilizare, cu suport pentru accelerare adaptat fiecărui hardwareInima LLM-urilor se învârte de obicei în jurul llama.cpp, vLLM și transformers, dar există mult mai multe.

În secțiunea generală LLM-uri, llama.cpp oferă Inferență eficientă în C/C++ cu suport pentru CUDA, ROCM, Intel SYCL, Vulkan, Metal și CPU purpermițând rularea modelelor cuantizate pe mașini fără GPU-uri. vLLM aduce PagedAttention și optimizări orientate spre debit, cu accelerare pentru CUDA și ROCm, în timp ce transformers deschide ușa către colecția extinsă de modele HuggingFace pe CUDA, ROCm, Intel și CPU.

Pentru audio, backend-uri precum whisper.cpp și faster-whisper sunt combinate pentru a Recunoaștere vocală rapidă și portabilă pe CPU sau GPUși o gamă largă de motoare TTS: Bark și Bark-cpp, Coqui, Kokoro, Kitten-TTS, Piper, Chatterbox, neutrts și Vibevoice, fiecare cu propriul echilibru între calitate, latență și cerințe hardware, de la CPU pur la CUDA, ROCM, Metal sau Intel.

În ceea ce privește viziunea și diseminarea, proiectul sprijină stablediffusion.cpp ca implementare C/C++ a Stable Diffusionprecum și biblioteca de difuzoare HuggingFace pentru modele mai noi de generare și editare a imaginilor. În funcție de backend, se poate utiliza CUDA, ROCM, Intel SYCL, Metal sau pur și simplu CPU.

Dincolo de LLM-uri, audio și imagini, LocalAI se integrează Backend-uri specifice, cum ar fi rfdetr pentru detectarea obiectelor, motoare de reclasificare a documentelor și un depozit vectorial localÎn plus, se integrează cu API-ul HuggingFace pentru a combina inferența locală și la distanță atunci când este nevoie. Acest lucru face ca platforma să fie foarte cuprinzătoare pentru construirea de sisteme de căutare augmentată, asistenți de navigare în documente sau conducte MLOps locale.

Accelerare: De la optimizare CPU la GPU, Metal și Jetson

Pentru a se asigura că nimeni nu este omis, LocalAI oferă un nivel de Accelerare extrem de flexibilă, cu configurații pentru aproape orice tip de hardware modernDacă aveți un GPU NVIDIA, puteți profita de CUDA 12 sau 13 în majoritatea backend-urilor compatibile, de la llama.cpp la diffusers sau coqui, ajustând numărul de straturi GPU sau încărcarea în funcție de resursele dvs.

În cazul plăcilor grafice AMD, LocalAI se bazează pe ROCm pentru a Accelerează backend-uri cheie precum llama.cpp, whisper, vLLM, transformers, diffusers, rerankers și diverse TTSAcest lucru este foarte interesant pentru cei care își configurează homelab-uri cu plăci Radeon. Pentru hardware-ul Intel, suportul vine prin oneAPI și alte tehnologii, implementând accelerare în backend-uri precum llama.cpp, whisper, stablediffusion, vLLM, diffusers, rfdetr, rerankers și motoare vocale precum Coqui sau Bark.

Dacă lucrați cu un Mac, platforma se integrează cu Metal și backend-urile native MLX și MLX-VLM de la Apple, oferind Inferență optimizată pe cipurile M1, M2 și M3+ atât pentru LLM-uri, cât și pentru modele multimodale, pe lângă suport pentru bark-cpp și alte componente compatibile cu Metal.

Nici de scenariile încorporate nu au uitat: există suport specific pentru acestea. NVIDIA Jetson cu CUDA 12 și 13Acest lucru permite rularea comenzilor llama.cpp, whisper, stablediffusion, diffusers și rfdetr pe dispozitive ARM64 precum AGX Orin sau platforme de edge computing, ceea ce este foarte util pentru proiecte de robotică, securitate sau IoT inteligent.

Și, bineînțeles, toate acestea sunt completate de Executabile optimizate pentru procesor, cu suport pentru seturi de instrucțiuni precum AVX, AVX2 și AVX512Pe lângă variantele backend, cum ar fi whisper.cpp, compilate special în funcție de capacitățile procesorului, evitând erorile de „instrucțiuni ilegale” pe mașinile mai vechi sau cu putere redusă.

Instalare: binare, script, Docker și AIO

La nivel practic, echipa LocalAI a depus mult efort pentru a se asigura că Punerea în funcțiune nu ar trebui să fie o odiseeExistă mai multe metode de instalare în funcție de mediu și nivelul de experiență, atât pentru teste rapide, cât și pentru implementări mai serioase.

Pe de o parte, poți începe cu o script de instalare care descarcă fișierul binar corespunzător și configurează elementele de bazăExistă și fișiere binare directe pentru diverse platforme desktop, deși pe macOS, de exemplu, fișierele DMG nu sunt semnate de Apple, ceea ce poate determina sistemul să le marcheze ca „în carantină” și să necesite o mică deviere pentru a le deschide (echipa se ocupă de problemele de urmărire cu soluții și posibile îmbunătățiri).

O altă metodă foarte comună este utilizarea Docker pentru a implementa LocalAI ca container independent, fie pentru imagini CPU, GPU sau AIO cu modele predescărcatePuteți alege imagini doar CPU, imagini combinate CPU+GPU sau imagini All-In-One care includ un set inițial de modele gata de utilizare, deși acestea din urmă ocupă mai mult spațiu și s-a avertizat că, în viitor, unele variante „suplimentare” ar putea fi depreciate în favoarea noului sistem de gestionare backend.

Când lucrați cu Docker, este important să faceți diferența între rulare docker, care creează și pornește un container nouȘi `docker start`, care pur și simplu pornește unul existent. Dacă ați lansat deja LocalAI și doriți să îl reporniți, metoda corectă este să utilizați ceva de genul `docker start -i local-ai` pentru a evita duplicarea containerelor sau crearea de conflicte cu nume deja înregistrate.

Încărcarea modelului și detectarea automată a backend-ului

După ce LocalAI este configurat și funcționează, următorul pas este Încărcați modelele pe care le veți folosi, fie din galeria oficială, fie prin intermediul fișierelor de configurare YAMLAceasta este faza în care intră în joc logica detectării automate a hardware-ului și a backend-ului.

Când selectați un model în WebUI sau definiți unul în YAML, LocalAI Analizează capacitățile mașinii tale (tipul de GPU, dacă este NVIDIA, AMD sau Intel, suportul CPU etc.) și descarcă backend-ul corespunzător. pentru combinația respectivă de model și dispozitiv. În acest fel, evitați să aflați manual de ce fișier binar llama.cpp, diffusers sau whisper.cpp aveți nevoie pentru mediul dvs. specific.

Dacă aveți nevoie de mai mult control, configurația YAML vă permite Ajustați parametri precum dimensiunea contextului, numărul de straturi GPU, utilizarea mmap-ului, cuantizările sau definiția instrumentelor agentuluiȘi, datorită reînnoirii WebUI, acum este posibil să editați tot acel fișier YAML direct din interfața grafică, fără a fi nevoie să vă conectați la server prin SSH sau să editați manual fișierele.

Interfață Web reproiectată: Gestionare vizuală a modelelor, chat-ului și agenților în LocalAI

Interfața web a suferit o reproiectare majoră, orientată către utilizatorii avansați, rămânând în același timp accesibilă celor care doresc pur și simplu să exploreze vizual. Migrarea de la HTML la o combinație de Alpine.js și JavaScript nativ au îmbunătățit considerabil viteza și fluiditatea. din experiență, în special în medii cu multe configurații sau modele.

Din această interfață web puteți accesa interfețe de chat, generare de imagini, audio, gestionarea modelelor și configurare internăExistă o listă de modele cu căutare fuzzy, astfel încât, chiar dacă greșiți la tastare (de exemplu, „gema” în loc de „gemma”), sistemul vă va afișa rezultatele corecte fără a vă chinui să rafinați termenul exact.

Unul dintre cele mai practice aspecte este că WebUI permite Vizualizați și editați configurația YAML completă pentru fiecare model Din browser, fără a părăsi aplicația. Acolo puteți modifica contextul maxim, activa sau dezactiva suportul multimodal, ajusta parametrii de performanță sau defini instrumente și servere MCP pentru agenți, toate cu efect imediat după salvarea modificărilor.

Agenți și asistență MCP: inteligență artificială care utilizează instrumente local

În versiunile sale recente, LocalAI a făcut un salt semnificativ prin încorporarea Suport complet pentru Protocol Context Model (PCM) și capabilități agențice avansateAcest lucru permite construirea de agenți care nu numai că răspund la întrebări, dar pot utiliza și instrumente externe, planifica pași și orchestra sarcini complexe.

Integrarea MCP se bazează pe framework-ul dezvoltat din LocalAGI și proiecte conexe precum Cogito, rezultând o modalitate simplă de a Definiți „serverele MCP” ca fiind containere sau servicii externe care expun instrumenteDe exemplu, ați putea avea un server MCP care efectuează căutări pe DuckDuckGo, un altul care interoghează API-urile interne ale companiei dvs. sau unul care rulează scripturi pe mașina dvs. locală.

Din punctul de vedere al dezvoltatorului, este suficient să Configurați aceste servere MCP în YAML-ul modelului, fără a fi nevoie să scrieți cod Python sau să utilizați biblioteci specifice.Odată configurat, puteți utiliza endpoint-ul /mcp/v1/chat/completions, compatibil cu API-ul OpenAI, sau puteți activa direct „MCP Agent Mode” din interfața web a chat-ului, astfel încât modelul să înceapă să invoce instrumentele atunci când consideră necesar.

Echipa a investit, de asemenea, eforturi în Îmbunătățiți robustețea apelurilor de funcții și gestionarea schemelor JSONAcest lucru corectează erorile și panicile care puteau apărea atunci când modelele generau definiții imperfecte ale instrumentelor. Cu aceste îmbunătățiri, utilizarea instrumentelor și fluxul de lucru agentic sunt mult mai stabile în producție.

Foaia de parcurs LocalAI și evoluția constantă a proiectului

LocalAI se mișcă foarte rapid, cu un foaie de parcurs publică sub formă de probleme etichetate unde puteți urmări cele mai recente actualizări și pe cele planificate pentru lunile următoare. Foaia de parcurs prezintă o secvență continuă de îmbunătățiri care acoperă atât noi capabilități, cât și rafinări interne.

În ultimii ani, au fost adăugate următoarele Funcții precum inferența distribuită, modul federat, P2P pentru rularea LLM-urilor într-o rețea, tablouri de bord pentru gestionarea roiurilor de instanțe și suport pentru modele și backend-uri noi. (Flux, MLX-Audio, WAN, SANA, Bark.cpp, stablediffusion.cpp etc.), precum și o API Reranker și o API integrată pentru descoperirea de obiecte.

Au avut loc și momente importante, cum ar fi Migrarea tuturor backend-urilor din fișierul binar principal pentru a reduce greutateaSosirea unui nou launcher pentru macOS și Linux, îmbunătățirea continuă a interfeței WebUI și adăugarea unor API-uri experimentale, cum ar fi text-to-video prin /v1/videos, care se conectează la instrumente locale de inteligență artificială, cum ar fi editarea video locală, fac parte din planul de acțiune. Planurile viitoare includ o gestionare mai dinamică a memoriei, un suport îmbunătățit pentru mai multe GPU-uri, noi integrări agențice și un ecosistem extins de instrumente MCP.

Exemple de utilizare în comunitate și în aplicația mobilă Local AI Chatbot

Spiritul LocalAI este strâns legat de comunitate, așa cum se reflectă în propriile postări ale creatorului pe forumuri precum r/selfhosted sau/LocalLLaMAAcest forum este locul unde evoluția arhitecturii este împărtășită direct și unde se răspund la întrebările utilizatorilor. Multe comentarii se învârt în jurul modului de integrare a LocalAI ca un „creier” privat pentru automatizări și proiecte personale.

Unul dintre cazurile care ilustrează abordarea „total locală” este apariția Aplicații mobile precum Local AI Chatbot de la Software Tailor, care oferă chat cu modele avansate direct pe dispozitiv, fără conexiune la internet.Această aplicație vă permite să comunicați cu modele precum DeepSeek R1, Qwen, Mistral, Llama 3 sau Phi complet offline, păstrând 100% confidențialitatea și profitând de hardware-ul telefonului.

Printre caracteristicile sale se numără Suport pentru mai multe modele cu comutare rapidă între ele, un design axat pe consumul eficient de resurse și o interfață curată pentru chat fără probleme.Este destinat utilizatorilor preocupați de confidențialitate, profesioniștilor care gestionează informații sensibile, persoanelor din zone cu conectivitate slabă și entuziaștilor de inteligență artificială interesați să experimenteze cu modele locale.

Aceste tipuri de soluții demonstrează cum ecosistemul din jurul LocalAI și al IA locală depășește serverul principal, aducând filosofia „totul pe dispozitivul tău” pe mobil, desktop și alte formate, cu scopul ca oricine să se poată bucura de asistenți avansați fără a se baza pe servicii la distanță.

Proiectul LocalAI și familia sa de instrumente arată cum se poate realiza acest lucru Să construim o stivă completă de inteligență artificială privată, extensibilă, modulară și multimodală, capabilă să acopere totul, de la chat simplu până la agenți complecși cu memorie și instrumente, fără a renunța la libertatea software-ului gratuit sau la controlul total asupra datelor., poziționându-se ca o alternativă foarte serioasă pentru cei care nu doresc ca inteligența artificială a proiectelor lor să depindă de terți.

Fundația Agentic AI
Articol asociat:
Fundația Agentic AI: noul front comun pentru IA agentică deschisă, la care colaborează Fundația Linux.

Adăugați ca sursă preferată în Google