GPT-6 Astra发布,AI科研迎来新纪元
今天,人工智能科技界沸腾不已。凌晨时分,OpenAI推出了其新一代的旗舰模型GPT-6 Astra,声称这是当今最强大的AI大型模型。该模型在多个领域,包括计算机应用、网页浏览、软件开发、网络安全、科学研究等方面,均刷新了最新的技术标准。OpenAI副总裁Greg Brockman表示,这次发布标志着“代际跃迁”,甚至可能开启通向通用人工智能(AGI)的新阶段。然而,尽管大量报道集中于其生成代码和视频的能力,关于AI如何进行科学研究的讨论却相对稀少。不过,如果将焦点从AGI的叙述转移,关注GPT-6 Astra的具体能力数据,就会发现一个更值得AI4S界关注的转变,AI模型正在跨越全新的门槛。Greg Burnham形容这一变化为“一个时代的结束,另一个时代的开始”。
科研代理的力量大幅增强。首先,需要提到Terminal-Bench这个评估基准,它已成为评估AI智能体能力的重要标尺,几乎所有前沿的实验室都在使用它追踪和比较各自智能体的表现。而“Terminal-Bench Science 0.1”则是专门针对科学研究流程的智能体评测,涵盖了生命科学、物理科学、地球科学、数学和工程科学五大领域,共设置了70个由领域专家设计的任务。在这一评估中,Astra以64.6%的成绩刷新了之前的记录,而Claude Fable 5.1则为52.6%。更为重要的是,Astra在获得这一成绩时的API成本预估较对照组低了约31%,意味着它在能力和效率上均保持领先。
将这一切放入AI4S的场景中理解,以往“文献调研→提出假设→模拟实验→核对数据→建议下一步”这一流程需要多轮对话和人工衔接,而现在则有机会由一个智能体自行完成。某位科学家使用Astra研发了一个复杂的生物医学应用,专门分析流式细胞术的数据,这是一种使研究者能够同时分析成千上万个单细胞的核心技术。过去,这一领域完全由商业软件主导,而这位科研人员表示,实验室每年都需花费数千美元用于商业软件的订购和授权,但如今他已全面取消这些订阅,因为通过Astra,他已能自建出一个完整的研究级别应用。更令人惊喜的是,他发现Astra的用户界面和用户体验甚至优于许多他之前使用的商业工具。这意味着,过去我们讨论AI4S时仅仅关注AI是否能提升科研效率,但此案例显示,科学家通过编写提示,直接绕过了整个商业软件公司,这对依靠销售分析软件获利的公司无疑是一记沉重的打击。
除此之外,代理成本的显著降低意味着,过去只有大型制药公司和顶尖实验室能够负担得起的科研代理能力,现在或许中小型团队也能够参与其中。关于科研成果报告中专门有一节提到推动科学发现的章节,GPT-6 Astra在这一章中获得了一系列优异成绩。GPQA Diamond用于测试研究生水平的科学推理,Astra在这一测试中以96.0%的成绩创造新高。而HealthBench Professional则评估大语言模型在实际临床场景中的表现,Astra以63.4%的得分领先,较上一代车型Sol的60.5%亦有提升。虽然这两个项目较为传统,而真正引人注目的是接下来的几个,在此之前很少有模型尝试过的高难度评估基准。LifeSciBench评估AI在生命科学研究中的实用性,而GeneBench-Pro则专注于计算生物学与基因组学高阶统计推理能力。MedChemBench则专注于药物化学中的推理与决策能力。GPT-6 Astra在这三个基准中分别得到了60.3%、37.8%和49.3%的成绩,虽有小幅提升,但成本明显降低。不过,OpenAI在备注中提到Claude Fable 5和5.1未能参与这三项评估的对比,因为它们在这些问题上大多选择拒答,而不是错误回答。这说明两者在安全策略上采取了截然不同的方向,Anthropic选择更加保守,宁愿不回答敏感问题以规避风险,而OpenAI则在监管框架内尽量提供答案,这将对科学家未来选择AI模型产生实际影响。
桌面操作能力的提升则更为显著,一组容易被忽略的数据将对AI4S行业产生深远影响。
威少宣布新篇章!加入崭新篮球联赛,NBA辉煌时代谢幕
运动不仅是目标的实现,更是过程中的享受与成长!...
郑钦文与教练重聚,再创新高,纽约赛场的感人一幕
运动不仅是目标的实现,更是过程中的享受与成长!...