ManXis团队的这项研究,揭示了AI发展的一个全新维度。未来的AI,其能力的上限或许不再只取决于模型的「脑容量」,更取决于它能否根据任务的认知结构,持续动态地塑造自己的「大脑」。 当我们惊叹于大语言模型能写诗、会编程时,科学家们正面临一个更棘手的问题:如何让AI像真正的科研工作者一样,去解决那些需要数月甚至数年持续思考、且充满未知的科学难题? 传统的做法是,给AI一个预设好的「大脑结构」(即固定 ...
宾夕法尼亚大学统计学教授、北大07级校友苏炜杰发了一条推,说他亲眼看着这个模型把一个他崇敬了二十多年的数学问题,往前推了一步。 GPT-6 Astra刚发布,首个科研成果来了! 宾夕法尼亚大学统计学教授、北大07级校友苏炜杰发了一条推,说他亲眼看着这个模型把一个他崇敬了二十多年的数学问题,往前推了一步。 这个问题就是孪生素数猜想,苏炜杰在9岁时第一次听说,张益唐的故事从那时起就刻在他的心里。 现在 ...
2025年10月Atlas发布时的Agent模式:Instacart网页占主体,ChatGPT嵌在右侧侧栏,下方还有「Take control」接管按钮。一年后,这个主次关系整个翻了过来。 ChatGPT桌面版的内置浏览器虽然用着独立的浏览状态,绝不会乱碰你的Chrome配置,但它在官方文档里,仍然为自己留了一个后门: ...
主流 AI 编码 Agent 的选型核心,从来不是 “谁更强”,而是 “谁更适配当下任务”。 现如今,AI 编码 Agent 已成为开发者的日常刚需,无论是快速写功能、修复 Bug、重构代码库,还是批量处理开发任务,一款好用的 AI 编码工具,能直接翻倍提升开发效率。 目前,市面上主流的两大顶尖编码 Agent,就是 OpenAI Codex 和Anthropic Claude Code。 短短半 ...
GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。 先来看ARC-AGI-3,Astra直接拿下99.9%,暴击Claude Opus 5(30.2%)。 这个测试考的是,Agent在陌生的互动式任务里边玩边学的能力,人类测试者平均只有48%。
不少团队可能都有类似经历:一开始自己写 Agent Loop,后来接入 LangChain、LangGraph 等框架,再后来又开始关注模型公司提供的 Agent SDK 和 Harness Runtime。每一次模型能力升级,似乎都伴随着一次架构调整。 过去一两年,Agent 开发的变化速度,可能超过了很多团队的预期。 不少团队可能都有类似经历:一开始自己写 Agent Loop,后来接入 La ...
在极短时间内,AGI大概率就会比全人类中最聪明的人还要聪明;而再往后,地球上的数字算力总和将呈指数级超越生物算力(全人类大脑)的总和。 马斯克警告: The AI riptide is already underway.(AI激流,已经袭来。) 过去一年,全球AI推理Token用量暴增了25倍。 对此,方舟投资ARK Invest首席未来学家Brett Winton,语出惊人,描述了他所想到的一个 ...
Linus赢了他所在意的那场争论。他的单内核统治了看得见的世界:服务器、手机、超级计算机、云端,整个现代经济都建立在这上面。Tanenbaum在意的是优雅的设计,Linus在意的是实际的可用性。 有这样一个故事,一位操作系统领域的权威教授,曾当众批评一名毫无学术成果的学生:“你的内核架构思路早已过时!” 次日,学生公开回击,教授寸步不让,争论激烈,争持不下。 当时谁也不曾料到,这位学生开发的操作系 ...
黄仁勋把整个AI产业分成五层:能源、芯片、基础设施、模型和应用。开发者通常站在最上面的应用层,调用失败、延迟波动和算力成本却会从下面几层一路传上来。Agent进入真实设备后,这种联系会更直接。
Meta刚刚端出的新模型Muse Spark 1.3,已经和Fable 5掰上手腕了。 小扎去年撒出去的那些钱,好像终于开始听见响了…… Meta刚刚端出的新模型Muse Spark 1.3,已经和Fable 5掰上手腕了。 Artificial Analysis最新榜单里,Muse Spark 1.3 Max拿到62分。 跟Fable 5、5.1 xhigh打了个平手。 再往细项里扒,Codin ...
AI 正在变得极其强大;没有人完全理解其后果。将一个拥有丰富而强大 AI 的世界转型管理好,以优化安全性和对人们有益的结果,这应该是世界上最高的优先事项之一。这是 OpenAI 的最高优先事项。 我们已经有一段时间生活在对进步既兴奋又焦虑的张力之中,这对我们来说仍然是矛盾的。我们知道,这对其他人来说矛盾程度要大得多。然而,我们坚信世界需要了解 AI 的发展方向以及模型在现实世界中的表现。更重要的是 ...
系统按照对齐、插入、压合、就位等子任务进行信用分配。一次轨迹即使中间发生失败,只要机器人随后成功回撤、重新对齐并完成当前阶段,这段恢复行为仍然可以得到正向评价,而不会因为整条轨迹曾经出错就被一起丢弃。