<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Как измерить AI | Бенчмарки, тестирование и обучение LLM | Podlodka Podcast #433</title>
        <link>https://peertube.lightnode.ru/videos/watch/0c27e9ce-74ad-4c49-85ae-40025ce02404</link>
        <description>Когда-то для оценки AI мы использовали только тест Тьюринга – человек общался с собеседником через чат, а потом пытался определить, кожаным или кремниевым был его собеседник. Сегодня мы видим, что оценка качества работы LLM – гораздо более сложная задача. Вместе с Пашей Чижовым из PleIAs мы закопались в то, как вообще сегодня оценивается AI, и обсудили все виды бенчмарков, арен, метрик, их врожденные недостатки, а заодно и как быть, когда по капоту вашего КАМАЗа ползет черт. Полезные ссылки: — Бенчмарки https://huggingface.co/datasets/cais/mmlu https://huggingface.co/datasets/MMMU/MMMU https://huggingface.co/datasets/allenai/ai2_arc https://huggingface.co/datasets/Rowan/hellaswag https://huggingface.co/datasets/allenai/winogrande https://huggingface.co/datasets/Idavidrein/gpqa https://lastexam.ai/ https://www.swebench.com/ https://arcprize.org/arc-agi https://github.com/t3dotgg/SnitchBench — Арена https://lmarena.ai/ — Фреймворк для эвалов https://github.com/EleutherAI/lm-evaluation-harness — Бумаги https://arxiv.org/abs/2504.07825 https://arxiv.org/abs/2311.12022 https://arxiv.org/abs/2406.12045 — Тех репорты с таблицами https://www.anthropic.com/news/claude-4 https://ai.meta.com/blog/llama-4-multimodal-intelligence/ https://blog.google/technology/google-deepmind/gemini-model-thinking-updates-march-2025/#gemini-2-5-pro https://openai.com/index/introducing-o3-and-o4-mini/ ❓ Хочешь обсудить выпуск или задать вопрос эксперту? Вступай в наш Telegram-чат: https://t.me/podlodka 📰  Не любишь чаты, но хочешь оставаться в курсе дел и прокачивать свой IT кругозор? Подписывайся на наш Telegram-канал: там публикуются анонсы новых выпусков, а в комментах идут ценные и горячие обсуждения! 5 тысяч опытных IT-специалистов уже с нами: https://t.me/podlodkanews 👉Предложить себя в подкаст https://forms.gle/NtmaZmeDAa3MHSra7 Тайм-коды: 00:00 О чем выпуск 05:15 Зачем и кому нужны бенчмарки 11:48 Подходы к оценке качества моделей 16:53 Популярные бенчмарки 19:24 Оценка бенчмарков 27:12 Оценка моделей 35:34 Открытость задач в бенчмарках 39:09 Проблема доступности данных в интернете 58:12 Безопасность моделей 01:03:00 Актуальность теста Тьюринга 01:05:30 Технические аспекты оценки моделей 01:10:56 Проблемы при оценке моделей 01:15:55 В чём суть арен 01:24:10 Реальные результаты моделей 01:27:20 Создание собственного бенчмарка 01:31:35 Критерии хорошего бенчмарка 01:38:30 Будущее LLM 01:43:40 Заключение</description>
        <lastBuildDate>Mon, 27 Jul 2026 01:55:43 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>PeerTube - https://peertube.lightnode.ru</generator>
        <image>
            <title>Как измерить AI | Бенчмарки, тестирование и обучение LLM | Podlodka Podcast #433</title>
            <url>https://peertube.lightnode.ru/client/assets/images/icons/icon-96x96.png</url>
            <link>https://peertube.lightnode.ru/videos/watch/0c27e9ce-74ad-4c49-85ae-40025ce02404</link>
        </image>
        <copyright>All rights reserved, unless otherwise specified in the terms specified at https://peertube.lightnode.ru/about and potential licenses granted by each content's rightholder.</copyright>
        <atom:link href="https://peertube.lightnode.ru/feeds/video-comments.xml?videoId=0c27e9ce-74ad-4c49-85ae-40025ce02404" rel="self" type="application/rss+xml"/>
    </channel>
</rss>