30
Jul
news
AI-агенты не умеют следовать корпоративным регламентам
Новый бенчмарк HANDBOOK.md доказал: лучшие AI-агенты проваливают более 60% задач, где нужно строго …
→
Новый бенчмарк HANDBOOK.md доказал: лучшие AI-агенты проваливают более 60% задач, где нужно строго …
Apple представила SpeechAnalyzer на WWDC 2025. Разбираем реальные бенчмарки точности и скорости …
Команда Semgrep протестировала GLM 5.2 на поиске IDOR-уязвимостей — открытая модель от Zhipu AI …
Разбираем пользовательский бенчмарк HalBench: как Claude Sonnet 4.6, Grok 4.3, GPT-5.4 и Gemini 3.1 …
Открытый инструмент Local Deep Research показывает ~95% точности на SimpleQA. Поддерживает Ollama, …