오픈 웨이트 모델을 직접 하드웨어에서 실행합니다. 프런티어 API보다 느리고 작지만, 프라이빗하고 오프라인에서 동작하며 토큰당 비용이 없습니다.
조건에 맞는 도구가 없습니다.
LM Studio
로컬 LLM을 찾고 실행·서빙하는 데스크톱 앱 — OpenAI 호환 서버 내장
Ollama
명령 한 줄로 오픈 LLM을 로컬에서 실행 — 오프라인·프라이빗 에이전트를 위한 OpenAI 호환 API
PyTorch Foundation
OpenAI 호환 API로 오픈 LLM을 구동하는 고처리량 서빙 엔진