MentalHealthBench: как OpenAI оценивает ИИ в психологии
OpenAI выпустила MentalHealthBench — открытый бенчмарк из 1 215 сценариев для оценки ИИ в реальных …
OpenAI выпустила MentalHealthBench — открытый бенчмарк из 1 215 сценариев для оценки ИИ в реальных …
Команда Armature (YC P26) измерила 16 893 сессии Claude Code, Codex и Cursor. Что агенты реально …
OpenAI GPT-6 Astra набрал 99,9% на сложнейшем бенчмарке ARC-AGI-3 и превзошёл людей по эффективности …
Новый бенчмарк HANDBOOK.md доказал: лучшие AI-агенты проваливают более 60% задач, где нужно строго …
Apple представила SpeechAnalyzer на WWDC 2025. Разбираем реальные бенчмарки точности и скорости …
Команда Semgrep протестировала GLM 5.2 на поиске IDOR-уязвимостей — открытая модель от Zhipu AI …
Разбираем пользовательский бенчмарк HalBench: как Claude Sonnet 4.6, Grok 4.3, GPT-5.4 и Gemini 3.1 …
Открытый инструмент Local Deep Research показывает ~95% точности на SimpleQA. Поддерживает Ollama, …