llama.cpp — движок инференса с открытым исходным кодом на C++, разработанный для эффективного локального запуска больших языковых моделей (LLM). Предоставляет лёгкое высокопроизводительное решение для работы с моделями, такими как Qwen3.5 35B-A3B, на потребительском железе с поддержкой CPU и GPU. Ключевые возможности: загрузка моделей, генерация текста и управление диалогами через веб-интерфейс. Движок оптимизирован для низкой задержки и экономии ресурсов, что делает его подходящим для разработчиков и исследователей, которым нужен офлайн или приватный инференс AI. Типичные сценарии: локальные чат-боты, прототипирование исследований и приложения с требованиями к конфиденциальности данных без облачных зависимостей.
