<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Nvidia Triton Inference Server: строим production ML без разработчиков | Антон Алексеев</title>
        <link>https://peertube.lightnode.ru/videos/watch/ce3e740b-1647-43be-95a7-33fbd972f57f</link>
        <description>Подписывайтесь на наш канал здесь и в телеграм https://t.me/meetups_evrone, чтобы быть в курсе будущих митапов и не пропускать полезные доклады! Антон Алексеев из Selectel делится опытом построения масштабируемой inference-платформы на базе Nvidia Triton Inference Server и Kubernetes. В докладе рассматриваются причины отказа от Seldon, особенности реализации канареечного деплоя с Istio, построение inference-графа с Ray и оптимизации Triton, которые позволили увеличить пропускную способность в 10 раз. Вы узнаете, как автоматизировать развёртывание моделей без участия разработчиков, обеспечить отказоустойчивость и повысить эффективность ML-инфраструктуры с помощью open source-решений. Доклад будет особенно полезен ML-инженерам, техлидам и СТО. Полезные ссылки: Группа MLечный путь: https://slc.tl/zhcsl Канал спикера про инфраструктуру для ML: https://t.me/+_MMkDq57oKczZGYy 00:00 - Введение 01:31 - Требования к Inference-платформе 04:44 - Варианты реализации 05:20 - Кастомное решение 06:26 - Наш опыт реализации с помощью open-source решения 07:21 - Triton 08:55 - В начале был Seldon 10:59 - Взяли Istio + Triton 11:54 - Фича 1: Istio и Canary deploy 14:32 - Фича 2: Автоскейлинг 15:44 - Автоскейлинг в кластере K8S 18:38 - Как решали проблему весов моделей 19:46 - Как решали проблему больших образов 20:31 - ZSTD-формат 21:43 - Шеринг ГПУ 23:12 - А что по стоимости? 24:22 - Фича 3: Inference Graph 27:32 - Фича 4: Оптимизация Triton 31:49 - Фича 5: Дух UI 34:12 - Инфраструктура платформы 35:15 - Планы на будущее 36:16 - Заключение</description>
        <lastBuildDate>Mon, 27 Jul 2026 01:59:41 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>PeerTube - https://peertube.lightnode.ru</generator>
        <image>
            <title>Nvidia Triton Inference Server: строим production ML без разработчиков | Антон Алексеев</title>
            <url>https://peertube.lightnode.ru/client/assets/images/icons/icon-96x96.png</url>
            <link>https://peertube.lightnode.ru/videos/watch/ce3e740b-1647-43be-95a7-33fbd972f57f</link>
        </image>
        <copyright>All rights reserved, unless otherwise specified in the terms specified at https://peertube.lightnode.ru/about and potential licenses granted by each content's rightholder.</copyright>
        <atom:link href="https://peertube.lightnode.ru/feeds/video-comments.xml?videoId=ce3e740b-1647-43be-95a7-33fbd972f57f" rel="self" type="application/rss+xml"/>
    </channel>
</rss>