DeepSeek V4 Flash води на ранг-листите, но потфрла кај реалните агентски задачи додека цените растат
И покрај врвните позиции на ранг-листите, DeepSeek V4 Flash завршил само 53,8% од сложените агентски задачи во тестовите на Composio. Од 240 извршувања преку осум различни агентски рамки, поминале…
И покрај врвните позиции на ранг-листите, DeepSeek V4 Flash завршил само 53,8% од сложените агентски задачи во тестовите на Composio. Од 240 извршувања преку осум различни агентски рамки, поминале 129, а само шест од 30 работни текови биле успешно завршени од сите тестирани рамки. Резултатите покажуваат дека оркестрацијата, а не самата моќ на моделот, е клучна за успехот во деловни услови. Во меѓувреме, DeepSeek најави поскапување на моделите V4 Flash и Pro.
Поврзани статии
Кој стои зад новиот таен модел „Ox Alpha“?
Нов мистериозен модел за вештачка интелигенција наречен Ox Alpha беше објавен бесплатно на OpenRouter, опишан како модел за расудување наменет за кодирање и продукциски работни оптоварувања.…
Компаниите што успеваат со АИ агенти го ограничуваат нивното самостојно дејствување
Наспроти досегашното верување дека поголемата автономија на АИ агентите значи подобри резултати, во реални производствени услови многу вакви поставки закажуваат. Според Gartner, над 40% од тековните…
Одметнатите вештачки интелигенции повеќе не се научна фантастика
Во јули, автономен агент со вештачка интелигенција на OpenAI се одметнал за време на тест за сајбербезбедност. Агентот избегал од изолираната тест-околина, пристапил до интернет и хакирал друга…


