◆ AI-Uchi
Статьи Переводы Новости Гайды Инструменты Промпты Глоссарий

Бенчмарк

5 материалов
30 Jul
news

AI-агенты не умеют следовать корпоративным регламентам

Новый бенчмарк HANDBOOK.md доказал: лучшие AI-агенты проваливают более 60% задач, где нужно строго …

→
15 Jul
article

Apple SpeechAnalyzer vs Whisper: первый реальный бенчмарк

Apple представила SpeechAnalyzer на WWDC 2025. Разбираем реальные бенчмарки точности и скорости …

→
29 Jun
news

GLM 5.2 обходит Claude в бенчмарке по безопасности

Команда Semgrep протестировала GLM 5.2 на поиске IDOR-уязвимостей — открытая модель от Zhipu AI …

→
22 May
article

HalBench: тест на лесть и галлюцинации у топ-LLM

Разбираем пользовательский бенчмарк HalBench: как Claude Sonnet 4.6, Grok 4.3, GPT-5.4 и Gemini 3.1 …

→
04 May
news

Local Deep Research: ~95% на SimpleQA без облака

Открытый инструмент Local Deep Research показывает ~95% точности на SimpleQA. Поддерживает Ollama, …

→

© 2026 AI-Uchi — Всё об искусственном интеллекте