Back to Search View Original Cite This Article

Abstract

<jats:p xml:lang="ru">Растущий спрос на Большие Языковые Модели (LLM) и другие AI-сервисы в корпоративной среде сдерживается высокими затратами на инфраструктуру, проблемами конфиденциальности данных и недостаточным использованием существующих вычислительных ресурсов. В этой работе представлена новая архитектура промежуточного ПО — Децентрализованная Маршрутизация на основе Политик (PBDR). Она превращает гетерогенный парк стандартных рабочих станций в отказоустойчивый, приватный и экономически эффективный инференс-кластер. В отличие от централизованных систем, PBDR работает без глобального планировщика или общей очереди запросов. Вместо этого она использует управляемый клиентом механизм маршрутизации на основе политик, где каждый клиент независимо вычисляет Вектор Стоимости и применяет Вектор Весов Политики через скалярное произведение для выбора оптимального вычислительного узла. В этой работе представлена формальная математическая модель системы, задача маршрутизации определена как задача оптимизации с ограничениями, а также доказаны ключевые свойства алгоритма, включая корректность, отказоустойчивость и монотонность. Мы приводим детальную архитектурную спецификацию, включая формальный Monitor API (OpenAPI v3), UML-диаграммы, строгую модель функции стоимости и всесторонний анализ сложности. Мы демонстрируем с помощью математических моделей сетевого трафика и сценариев отказов, что подход PBDR линейно масштабируется, обладает высокой устойчивостью и вносит пренебрежимо малые накладные расходы. PBDR v2.0 расширяет эту основу возможностями гибридной облачной маршрутизации, внедряя двухуровневый механизм принятия решений, который динамически выбирает между локальными GPU-кластерами и 40 + 40+ облачными LLM-провайдерами (OpenAI, Anthropic, Google, Azure, AWS и другие). Расширение добавляет модель экономической стоимости, сравнивающую затраты на локальное электричество (через мониторинг мощности GPU в реальном времени) с затратами на облачные API-токены, что позволяет принимать решения с учетом стоимости. Мы доказываем оптимальность иерархических решений (Теорема 5) и демонстрируем с помощью практических экспериментов, что система достигает 60% снижения затрат и ускорения в 3.4 раза для запросов, направляемых в облако. Эта работа позиционирует Оптимизатор на основе Политик как новый класс промежуточного ПО для корпоративного ИИ с приложениями, выходящими за рамки LLM и охватывающими гибкие политики маршрутизации с учетом приложений как в локальной, так и в облачной инфраструктуре.</jats:p>

Show More

Keywords

на pbdr маршрутизации основе для

Related Articles

PORE

About

Connect