Claude Sonnet 4.5 发布
Anthropic 称 Sonnet 4.5 能在复杂任务上持续专注超过 30 小时,发布时在编程和电脑操作评测中领先。
模型摘要
- 开发方
- Anthropic
公布的评测成绩
| SWE-bench Verified | 77.2% | |
| OSWorld | 61.4% | 四个月前的 Sonnet 4:42.2% |
数据口径:Anthropic 官方公告。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。
Anthropic 称 Sonnet 4.5 能在复杂任务上持续专注超过 30 小时,发布时在编程和电脑操作评测中领先。
| SWE-bench Verified | 77.2% | |
| OSWorld | 61.4% | 四个月前的 Sonnet 4:42.2% |
数据口径:Anthropic 官方公告。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。