2026年全球AI人工智能领域最前沿新闻资讯
我们会持续更新全球AI领域的重磅新闻,直击ChatGPT、Claude、Gemini和Grok等热门大模型的最新动向。欢迎大家收藏本页面,以便及时了解人工智能行业最前沿、最准确的资讯。
2026年7月9日:OpenAI正式开放GPT-5.6系列,并将其接入ChatGPT、ChatGPT Work、Codex和OpenAI API。GPT-5.6分为Sol、Terra和Luna三个版本,其中Sol是旗舰模型,Terra更偏向低成本使用,但整体能力接近GPT-5.5,Luna则主打更快速度和更低价格。在ChatGPT中,Plus、Pro、Business和Enterprise用户可以使用Sol,Pro和Enterprise用户还可以选择Sol Pro;API价格方面,Sol每百万输入Token收费5美元、输出30美元,Terra每百万输入Token收费2.5美元、输出15美元,Luna每百万输入Token收费1美元、输出6美元。与6月26日的有限预览不同,这次发布代表GPT-5.6正式进入开放阶段,OpenAI也将代码、科学研究、网络安全、长上下文处理和工具调用能力作为这一代模型的重点。
2026年7月9日:OpenAI推出ChatGPT Work,把ChatGPT进一步升级为可以跨应用、跨文件和跨工作流执行任务的Agent。ChatGPT Work可以生成表格、幻灯片、文档和网页应用,也可以围绕复杂项目持续工作数小时,并在执行过程中自动拆分步骤、调用工具和整理资料;该功能内置Codex技术,目前Codex每周已有超过500万用户,其中超过100万人将其用于非软件开发场景。这个更新的重点并不是简单提升ChatGPT的回答质量,而是让ChatGPT从聊天窗口进一步变成可以协助完成完整任务的AI工作入口。
2026年7月9日:Anthropic上线Claude使用反思功能,让用户可以查看自己过去使用Claude的情况。该功能目前处于Beta阶段,支持Claude网页版和桌面端,用户可以回顾过去1个月、3个月、6个月或12个月的使用记录,了解自己主要使用Claude处理哪些主题和任务,同时还可以设置安静时间或使用提醒。该功能面向开启记忆功能的Free、Pro和Max用户开放,并且不会读取incognito聊天、连接工具中的原始文件或健康类集成内容。这个更新说明Claude开始从模型能力竞争进一步延伸到用户使用习惯、AI协作方式和长期使用体验的优化。
2026年7月8日:OpenAI发布GPT-Live,用于升级ChatGPT Voice语音体验。GPT-Live采用全双工语音架构,可以在对话过程中同时听和说,支持用户打断、停顿、追问以及更加自然的连续交流;首批推出GPT-Live-1和GPT-Live-1 mini两个版本,并开始面向全球ChatGPT用户开放,同时计划后续支持API调用。当用户需要搜索、深度推理或处理复杂任务时,GPT-Live会在后台调用更强的模型完成处理,发布初期后台使用GPT-5.5,同时ChatGPT原有9种语音也进行了优化。这个更新说明ChatGPT语音功能已经不只是简单朗读答案,而是在向实时语音助手和语音Agent方向发展。
2026年7月8日:xAI发布Grok 4.5,这是Grok面向代码、Agentic AI任务和知识工作场景的一次重要升级。Grok 4.5已经成为Grok Build默认模型,并接入Cursor和xAI API,重点提升真实工程任务、端到端应用开发、Excel模型、Word文档和PowerPoint内容生成能力。官方数据显示,Grok 4.5在SWE Marathon中的通过率为29.0%,Terminal Bench 2.1得分为83.3%,SWE Bench Pro解决率为64.7%,同时推理速度达到80 TPS。价格方面,Grok 4.5为每百万输入Token收费2美元、输出6美元,官方表示其在同类任务中具备约2倍Token效率,不过欧盟地区暂未开放,预计7月中旬上线。这个节点说明Grok已经不再只是X平台里的聊天助手,而是在继续向代码代理、办公插件和企业任务场景扩展。
2026年7月7日:Google扩展Gemini API中的Managed Agents能力,新增后台执行、远程MCP服务器接入、自定义函数调用和跨交互凭证刷新等功能。开发者现在可以通过一个接口,让Gemini完成推理、代码执行、依赖安装、文件管理和网页信息检索,并在隔离的云沙盒环境中运行长时间任务;当任务需要持续执行时,API可以先返回任务ID,之后让应用查询状态、接收进度或重新连接任务。这个更新说明Gemini不仅是在继续升级聊天模型,也是在完善面向开发者的Agent基础设施,让Gemini更适合构建可以长期运行、连接外部工具并处理真实项目的AI应用。
2026年7月6日:xAI为Grok Voice发布21个新的旗舰语音,同时升级原有5个语音的自然度。新增语音全部支持多语言,并可以用于Grok实时Voice Agent API、Text to Speech API以及Grok Voice Agent Builder;原有Ara、Eve、Leo、Rex和Sal也进行了重新训练,让语速、停顿、语气和重音表现更加自然。Grok Voice目前支持25种以上语言,用户还可以通过约1分钟音频克隆自己的声音。这个更新说明xAI正在进一步增强Grok的语音交互能力,为客服、销售、教育、角色扮演和品牌语音Agent等场景提供支持。
2026年7月2日:Anthropic公布Claude Fable 5的网络安全防护细节,并提出Cyber Jailbreak Severity(CJS)越狱严重性评分框架。Anthropic将网络安全相关请求分为禁止使用、高风险双重用途、低风险双重用途和良性使用四类,其中恶意软件、勒索软件、数据窃取、命令控制以及规避安全工具等高风险请求会被阻断,高风险双重用途请求也会在缺少更强访问控制前进行限制;CJS评分则分为CJS-0到CJS-4,用于判断越狱方法从信息级风险到严重级、关键级风险的程度。这个事件说明Claude Fable 5这类高能力模型的竞争已经不只是性能表现,还需要同时解决网络安全、模型越狱、滥用防护以及政府监管等问题。
2026年7月1日:Anthropic恢复Claude Fable 5和Claude Mythos 5的访问权限。此前美国政府在6月12日对Claude Fable 5和Claude Mythos 5实施出口管制,Anthropic由于无法实时确认用户身份,因此暂停了所有用户访问;限制解除后,Fable 5从7月1日起重新向全球用户开放,可以用于Claude Platform、Claude.ai、Claude Code和Claude Cowork,并在Pro、Max、Team和部分Enterprise计划中提供最高50%的周使用额度。Mythos 5则先恢复给获得批准的部分美国机构使用。这个节点说明Claude高能力模型的开放已经和出口管制、可信合作伙伴机制以及模型安全审查结合得更加紧密,不再只是普通产品上线。
2026年7月1日:xAI推出Voice Agent Builder,让用户可以在无需编写代码的情况下创建Grok语音智能体。该功能基于Grok Voice,目前处于Beta阶段,官方表示用户可以在2分钟内创建一个语音Agent,并直接获得电话接入、知识库检索、工具调用、护栏、MCP、通话记录和可观测能力。它支持SIP接入已有号码,也支持通过WebSocket连接自定义客户端,价格为音频每分钟0.05美元,使用平台提供的电话号码还需额外支付每分钟0.01美元。这个节点说明Grok正在把语音能力从模型接口进一步推进到客服、销售、预约、订单查询以及企业电话等实际应用场景。
2026年6月30日:Google更新Gemini Spark,将其带入macOS应用,并加入更多连接应用和实时任务跟踪能力。Gemini Spark现在可以在Mac上处理桌面文件和本地任务,例如整理下载文件夹、读取电脑中的发票并生成预算表,同时还能连接Google Tasks、Google Keep、Canva、Dropbox、Instacart、OpenTable和Zillow Rentals等应用,并支持自定义MCP接入。Gemini Spark for macOS目前以Beta形式面向美国18岁以上Google AI Ultra用户开放,网页端和移动端的连接应用也会陆续上线。这个更新说明Gemini正在从普通聊天助手转向可以跨应用、跨设备、跨文件执行任务的个人Agent。
2026年6月30日:Google发布Nano Banana 2 Lite和Gemini Omni Flash开发者版本,进一步增强Gemini在图像和视频生成领域的能力。Nano Banana 2 Lite是Gemini图像模型家族中速度最快、成本最低的版本,支持约4秒生成1K图像,价格为每张1K图像0.034美元,并开放到Google AI Studio、Gemini API和Gemini Enterprise Agent Platform,同时也会进入Search AI Mode、Gemini App、NotebookLM、Google Photos、Stitch、Google Flow和Google Ads等产品。Gemini Omni Flash则面向高质量视频生成和自然语言视频编辑,支持文字、图片和视频输入,价格为每秒视频输出0.10美元,目前支持10秒视频生成。这个节点说明Gemini的竞争重点已经不只是文字模型,而是在继续扩大到图像、视频、多模态创作以及开发者应用场景。
2026年6月30日:Anthropic在同一天把Claude的产品线往前推了一大步,一边发布Claude Sonnet 5,一边推出面向科研场景的Claude Science。Sonnet 5的重点不是单纯把回答写得更漂亮,而是把Sonnet系列的“代理能力”补上来,它可以制定计划、调用浏览器和终端等工具,并在多步骤任务里保持更长时间的执行状态。Anthropic明确把它定位为更接近Opus 4.8、但价格更低的Sonnet模型,发布时还给出了每百万输入2美元、每百万输出10美元的限时价格。Claude Science则把Claude从聊天窗口进一步带到科研工作台里,支持文献分析、代码执行、图表生成、计算过程追踪和结果复现,目标用户很明确,就是生命科学、基因组学、蛋白结构、化学信息学等研究场景里的科研人员。这个节点说明Claude已经不只是和ChatGPT拼聊天体验,而是在代码、科研、企业工作流这些更高价值场景里继续加码。
2026年6月26日:OpenAI预览GPT-5.6系列,其中旗舰模型叫GPT-5.6 Sol,另外还有Terra和Luna两个定位不同的版本。和之前直接发布给大众用户不同,这次GPT-5.6先进入有限预览,开放给少量受信任合作方和组织,重点原因是模型在代码、生物、网络安全等高风险能力上又往前走了一步。OpenAI提到GPT-5.6 Sol是当时最强模型,并引入了新的max推理档位和ultra模式,后者不只是让一个模型多想一会儿,而是通过子代理协同来处理更复杂的任务。价格上,Sol为每百万输入5美元、输出30美元,Terra和Luna则分别对应更平衡和更低成本的使用需求。这个事件值得单独列出来,因为它代表OpenAI开始把“更强模型”和“分级安全发布”绑得更紧,不再只是比谁先把模型放出来,而是开始考虑不同能力层级该怎么开放。
2026年6月24日:Google给Gemini 3.5 Flash加入了内置的computer use能力,也就是让模型可以作为代理去理解界面、调用工具,并在不同平台上执行任务。这个更新表面上只是Gemini API的一个能力增强,但它实际代表Google把“模型会回答问题”推进到“模型能操作环境”的阶段。此前Gemini 3.5 Flash已经被Google用在AI Mode、开发者平台和代理类产品里,这次把电脑操作能力做成内置工具,意味着开发者不用再从零搭一套复杂的屏幕理解、按钮识别、网页交互和状态管理流程。对普通用户来说,它暂时未必马上变成一个独立爆款功能;但对开发者和企业来说,这类能力会直接影响客服自动化、后台运营、软件测试、网页任务处理和内部工具流转。这个节点也说明Google在追赶ChatGPT Agent、Claude Computer Use和Grok代理能力时,选择的是把Gemini深度接入自家搜索、云和开发者生态。
2026年5月19日:Google在I/O 2026上正式把Gemini 3.5推到台前,并把“agentic Gemini era”作为主线。Gemini 3.5 Flash被放进Google Search的AI Mode,成为全球默认模型之一,Google还提到AI Mode月活已经超过10亿,并且查询量连续按季度大幅增长。这个节点之所以重要,不只是因为Google发布了一个新模型,而是因为Gemini不再只待在Gemini App或开发者后台里,而是直接进入搜索、购物、Android、Google Home、Antigravity等大量入口。Google的打法很清楚:它不一定要求用户主动打开一个新聊天机器人,而是把Gemini放进用户原本就会用的产品里。对ChatGPT来说,这意味着竞争不再只是模型能力的竞争,而是入口、场景、分发和生态的竞争。Google手里有搜索、安卓、浏览器、邮箱、云服务和硬件,这让Gemini的扩散路径和OpenAI、Anthropic、xAI都不一样。
2026年4月23日:OpenAI发布GPT-5.5,并把它称为当时最聪明、最容易使用的模型之一。GPT-5.5继续沿着GPT-5系列的方向往前走,重点放在更强的推理、更好的直觉式交互、更稳定的编码能力和更高水平的任务执行上。API价格也随之提高,普通GPT-5.5为每百万输入5美元、输出30美元,GPT-5.5 Pro则达到每百万输入30美元、输出180美元。这个价格差距很值得注意,因为它说明OpenAI已经把模型能力分层做得更细,不再只有“普通用户模型”和“开发者模型”的区别,而是用不同价格对应不同强度、不同可靠性和不同任务难度。对用户来说,GPT-5.5的价值不只是答案更好,而是它开始更像一个能持续处理复杂任务的系统;对行业来说,这也是高端模型进入高价、高门槛、高价值场景的又一个信号。
2026年3月5日:OpenAI发布GPT-5.4,这个版本的重点是把主线模型和Codex的高级编码能力进一步合并。OpenAI在介绍里提到,GPT-5.4是第一个吸收GPT-5.3-Codex前沿编码能力的主线推理模型,并同步滚动到ChatGPT、API和Codex。这个变化很关键,因为过去很多用户会在“通用聊天模型”和“专门写代码的模型”之间切换,GPT-5.4则试图减少这种割裂,让一个主线模型既能处理日常问题,也能承担更复杂的软件工程任务。它背后的方向很明确:未来的ChatGPT不只是会写函数、改代码片段,而是要能理解项目、调用工具、持续执行、修复错误,并在较长时间里保持上下文。对开发者来说,这类模型真正的竞争点已经不是“能不能写一段代码”,而是能不能在真实仓库和真实工作流里把事情做完。
2026年2月17日:Anthropic发布Claude Sonnet 4.6,把Sonnet系列继续往“可规模化使用的强模型”方向推进。Anthropic给出的定位很清楚:Sonnet 4.6是当时最强的Sonnet模型,能力覆盖编码、电脑操作、长上下文推理、代理规划、知识工作和设计等多个方向,并且开放了100万token上下文窗口的测试能力。这个点非常有价值,因为Claude的核心优势一直是长文、代码、复杂任务和较稳的表达,100万token上下文意味着它可以处理更大的代码库、更长的合同、更复杂的研究资料和更完整的企业知识库。与Opus这种更重、更贵的模型相比,Sonnet的意义在于平衡成本和能力,让企业和开发者可以更频繁地调用。这个发布也说明Claude的产品策略不是只推一个最强模型,而是把Opus、Sonnet、Haiku分层,用不同模型覆盖不同成本和任务难度。
2025年12月11日:OpenAI发布GPT-5.2,并把它定位为面向专业工作的更强模型系列。GPT-5.2在ChatGPT中包括Instant、Thinking和Pro三种体验,同时API里也对应不同调用方式。OpenAI提到,GPT-5.2更擅长处理表格、演示文稿、代码、图像理解、长上下文、工具使用和多步骤项目,这说明它已经不是单纯服务聊天问答,而是在争夺真实工作流程。价格上,GPT-5.2普通版本为每百万输入1.75美元、输出14美元,Pro版本则高到每百万输入21美元、输出168美元。这个节点值得关注,是因为OpenAI明确把“更贵但更省步骤、更稳定”的逻辑讲了出来:强模型虽然单token价格高,但如果它能用更少返工、更少人工检查完成复杂任务,整体成本反而可能下降。对企业用户来说,这种计算方式比单纯比较订阅费更现实。
2025年11月18日:Google发布Gemini 3,并且从第一天起就把它嵌入Google Search、Gemini App、AI Studio、Vertex AI等核心产品。这个发布和之前很多模型更新不一样,Google没有把它先放在实验室或小范围测试里,而是直接进入搜索这样的核心入口,说明Google对模型稳定性和商业化已经更有信心。Gemini 3的重点是更强的推理、多模态理解、代码能力和代理能力,Google同时推出Antigravity这类面向开发者的代理式开发工具,让AI可以在编辑器、终端和浏览器环境里协同完成任务。这个事件对行业冲击很大,因为Google把模型发布、搜索入口、开发平台和应用生态打包推进,等于告诉市场:Gemini不只是一个聊天机器人,而是Google全系产品的底层智能能力。
2025年11月17日:xAI发布Grok 4.1,并且把它开放给grok.com、X以及iOS、Android App用户使用。Grok 4.1的重点不是再单独强调“更会做题”,而是提升真实对话里的可用性,包括创意、情绪理解、协作感、意图识别和人格一致性。xAI提到,Grok 4.1在静默上线测试期间参与了真实流量盲测,并且相较此前生产模型获得更高偏好率;在LMArena文本榜单里,Grok 4.1 Thinking也拿到很高的Elo分。这个节点说明Grok的方向正在从“有实时X数据、说话更尖锐”逐步走向更成熟的通用助手。相比ChatGPT和Claude,Grok的差异仍然是和X平台深度绑定,能利用社交平台里的实时信息;但从Grok 4.1开始,xAI也明显在补对话质量、稳定性和可控性这些基础能力。
2025年9月29日:Anthropic发布Claude Sonnet 4.5,并把它推成面向编码、复杂代理和电脑操作的核心模型。这个版本在开发者圈影响很大,因为Claude Sonnet 3.5之后,很多人已经把Claude当成写代码和理解大型项目的常用选择,Sonnet 4.5则进一步加强了长任务执行、代码修改、推理和工具使用。Anthropic在发布中强调它适合构建复杂代理,也提到在代码、金融、法律、医学和STEM等领域都有明显改进。这个节点的重要性不在于单个跑分,而是Claude开始在“AI代理做真实工作”这个方向形成明确口碑:它不只是回答开发问题,而是能理解上下文、执行计划、修改文件、检查错误,并且在长时间任务里不容易乱跑。对OpenAI来说,Claude Sonnet 4.5是一个非常现实的压力点,因为它直接打到了Codex、ChatGPT Agent和企业代码场景。
2025年8月7日:OpenAI发布GPT-5,并把它设为ChatGPT登录用户的新默认模型,取代GPT-4o、o3、o4-mini、GPT-4.1和GPT-4.5等多个旧入口。这个动作非常关键,因为GPT-5不只是一个新模型,而是一次产品形态整理:用户不再需要频繁思考该选哪个模型,系统会根据问题难度决定是快速回答,还是使用更强的推理能力。OpenAI同时把GPT-5推给Free、Plus、Pro、Team等用户,企业和教育版随后跟进。对普通用户来说,这意味着ChatGPT的默认体验再次升级;对老用户来说,也意味着很多熟悉的模型入口被合并,部分使用习惯需要改变。GPT-5这个节点可以看成OpenAI从“多模型选择器时代”转向“统一智能系统时代”的标志,它试图降低用户选择成本,让模型能力隐藏在产品体验后面。
2025年7月9日:xAI发布Grok 4,并推出SuperGrok Heavy,对应更高一级的重度使用方案。Grok 4被xAI定位为当时最强的Grok模型,支持原生工具使用和实时搜索,也开放给SuperGrok、X Premium+订阅用户以及API开发者。更值得注意的是Grok 4 Heavy,这个版本被放在新的SuperGrok Heavy套餐里,说明xAI也开始像OpenAI、Anthropic一样,把普通用户、高阶用户、开发者和企业用户区分开来。Grok的优势仍然是实时数据和X生态,尤其适合追踪新闻、社交舆论、金融市场和突发事件。Grok 4发布后,xAI不再只是“马斯克做的ChatGPT对手”,而是正式进入前沿模型竞争区间,开始在推理、搜索、工具调用和订阅商业化上全面追赶。
2025年5月22日:Anthropic发布Claude 4,包含Claude Opus 4和Claude Sonnet 4。这个节点是Claude系列从3.x迈入4代的关键更新,也进一步强化了Claude在编码、推理和代理任务里的定位。Anthropic把Opus 4称为适合复杂、长时间任务和代理工作流的顶级模型,而Sonnet 4则是面向更大规模使用的升级版,重点是比Sonnet 3.7更强的编码和推理能力,同时更精准地执行指令。Claude 4的发布让Anthropic在2025年的模型竞争里重新站到前排,尤其是在开发者场景,它和OpenAI o3、GPT-4.1、Gemini 2.5、Grok 3形成了直接竞争。这个事件也让“AI代理”从概念变成更具体的产品能力:模型不只是会回答,而是要能规划、调用工具、持续操作和交付结果。
2025年5月20日:Google在I/O 2025上继续加码Gemini 2.5,并展示Deep Think、Gemini 2.5 Flash、原生音频输出、Project Mariner的电脑使用能力等一批更新。Gemini 2.5 Pro在开发者群体里被重点推向代码、数学、科学和多模态推理场景,Deep Think则面向更复杂的数学和代码任务,让模型用更强的推理模式处理难题。这个节点和单纯发布一个模型不同,它体现的是Google把Gemini打造成一整套能力平台:有面向高难任务的Pro,有更快更便宜的Flash,有语音交互,有电脑操作能力,还有和Vertex AI、AI Studio、Android、Search的连接。Google的优势在这里开始显现,因为它可以把同一套Gemini能力分发到搜索、云、手机、浏览器和办公生态里。
2025年5月16日:OpenAI发布新版Codex,把它做成云端软件工程代理,而不是早期那种只会补全代码的工具。Codex可以在独立云沙箱里执行任务,包括写功能、回答代码库问题、修复Bug、提出Pull Request,并且支持并行处理多个任务。这个变化很重要,因为它标志着OpenAI对“程序员如何使用AI”的理解发生了变化:AI不再只是IDE里的自动补全,也不只是问答窗口里的代码顾问,而是可以像一个初级工程协作者一样接任务、读项目、改文件、跑测试、提交结果。这个方向直接影响GitHub Copilot、Cursor、Claude Code、Google Antigravity等产品的竞争格局。对开发者来说,真正节省时间的不再是生成一段代码,而是让AI完成一整个小型工程闭环。
2025年4月16日:OpenAI发布o3和o4-mini,把推理模型进一步推向主流用户和开发者。o3被定位为当时最强的推理模型之一,在代码、数学、科学、视觉理解等复杂任务上表现突出;o4-mini则是更轻、更快、成本更低的推理模型,让更多用户可以在ChatGPT中通过“Think”这类入口体验推理能力。这个发布的重点不只是模型变强,而是OpenAI开始把“推理”从少数高端用户的功能,变成更普遍的产品能力。过去用户会把ChatGPT当成一个快速回答工具,但从o1到o3,OpenAI一直在训练用户接受另一种模式:有些问题不该急着答,模型需要花时间分析、检查、推导和比较。这个变化直接影响了后面GPT-5的统一路由思路。
2025年3月25日:Google发布Gemini 2.5 Pro Experimental,把它定位为当时最强的复杂任务模型之一。Gemini 2.5 Pro的核心卖点是“会思考”,重点覆盖推理、代码、数学和科学任务,并且在LMArena等人类偏好榜单里取得很高排名。这个节点对Google很重要,因为Gemini 1.5主要靠超长上下文出圈,而Gemini 2.5则开始补“深度推理”和“开发者好用度”。从这个版本开始,Gemini不再只是靠接入Google生态和多模态能力与ChatGPT竞争,而是开始正面争夺前沿模型能力。对开发者来说,Gemini 2.5 Pro的出现意味着Google AI Studio和Vertex AI变得更有吸引力;对普通用户来说,它也为后续Gemini App、Deep Research、AI Mode和代理能力升级打下了基础。
2025年2月27日:OpenAI发布GPT-4.5研究预览,把它称为当时最强的聊天模型之一。GPT-4.5的重点不是像o1、o3那样展示长时间推理,而是继续沿着预训练和后训练扩展,让模型在模式识别、知识连接、创意表达和自然对话方面更强。这个版本有点特殊,因为它夹在GPT-4o和后续GPT-5之间,既不是纯推理模型,也不是廉价小模型,而是一次对“大模型本身能力上限”的继续探索。它的发布说明OpenAI当时并没有把所有希望都押在推理链路上,而是认为大规模预训练和推理能力会并行发展。对用户来说,GPT-4.5的价值更多体现在写作、沟通、复杂理解和开放式问题上;对行业来说,它说明前沿模型路线还没有完全收敛。
2025年2月24日:Anthropic发布Claude 3.7 Sonnet和Claude Code,这是Claude进入“混合推理模型”和“代码代理工具”阶段的重要节点。Claude 3.7 Sonnet被Anthropic称为市场上首个混合推理模型,既可以快速回答,也可以开启extended thinking,让模型在复杂问题上花更多时间思考。对API用户来说,还可以控制模型思考预算,这让企业和开发者能够在速度、成本、质量之间做更细的取舍。Claude Code则把Claude推向命令行和软件工程场景,让它不只是写代码,而是参与真实项目修改。这个节点很重要,因为Claude从这一刻开始更明显地抢占开发者心智,也把“可见思考”“长任务”“代码执行”这些特征合在了一起。
2025年2月19日:xAI发布Grok 3 Beta,并把它称为进入“推理代理时代”的一次升级。Grok 3由xAI的Colossus超级集群训练,官方提到训练计算量达到此前一代先进模型的10倍,并在推理、数学、代码、世界知识和指令遵循上明显提升。Grok 3同时引入Grok 3 mini,以及Grok 3 Think、Grok 3 mini Think这样的推理版本,让模型可以根据问题难度花几秒到几分钟不等的时间思考。这个节点说明xAI不再只强调Grok有X平台实时信息,而是开始正面追赶OpenAI o系列、Claude Sonnet和Gemini Pro的推理能力。Grok 3的发布也让xAI在短时间内从“新入局者”变成了前沿模型牌桌上的固定玩家。
2025年2月2日:OpenAI在ChatGPT中推出Deep Research,这是ChatGPT从聊天助手走向研究代理的关键一步。Deep Research的设计目标不是回答一个简单问题,而是自动在互联网上进行多步骤检索、阅读、筛选、交叉验证和整理,最后输出结构化研究结果。OpenAI宣称它可以在几十分钟里完成原本人类可能要花很多小时做的复杂资料工作。这个功能的出现非常重要,因为它把ChatGPT的使用场景从“问一句答一句”扩展到“交给它一个研究任务”。对内容创作者、咨询、投研、市场分析、学术准备和企业信息搜集来说,Deep Research代表的是一种新的工作方式:用户不再只需要模型生成文字,而是需要模型自己找资料、理解资料、判断资料价值,再把结果组织出来。
2025年1月23日:OpenAI发布Operator研究预览,让ChatGPT开始具备直接使用网页和图形界面的能力。Operator背后的模型叫Computer-Using Agent,它结合了GPT-4o的视觉能力和强化学习训练出来的操作能力,可以理解屏幕截图里的按钮、菜单、输入框,并像人一样在网页上执行任务。这个节点很重要,因为它是OpenAI把“代理”从抽象概念推向普通用户界面的早期代表。过去ChatGPT最多告诉你该怎么做,Operator则尝试替你去做,例如填写表单、查找信息、操作网页服务。虽然早期能力和安全限制都不少,但它明确展示了一个方向:未来的AI助手不只是给建议,而是能在授权范围内操作软件和网页。后来ChatGPT Agent的整合,也是在这个基础上继续推进。
2024年12月11日:Google发布Gemini 2.0,并把它称为面向代理时代的新一代模型。第一款开放的是Gemini 2.0 Flash实验版本,特点是低延迟、更强多模态能力和更适合规模化使用。Gemini 2.0的关键不只是“比1.5更强”,而是Google开始明确谈“agentic era”,也就是让模型不只理解文字、图片、音频和视频,还要能调用工具、执行动作、参与现实任务。这个发布承接了Project Astra、Project Mariner等原型能力,说明Google的目标是把Gemini做成通用AI助手的底层系统。对普通用户来说,Gemini 2.0后续会影响搜索、安卓和Gemini App的体验;对开发者来说,它意味着Google在低延迟多模态和代理工具链上开始认真发力。
2024年12月9日:OpenAI正式开放Sora,把这个年初展示过的文本生成视频模型从研究预览推向实际产品。Sora可以根据文本提示生成视频,也支持动画、混剪和不同镜头的创作,面向ChatGPT Plus和Pro用户提供不同额度与清晰度的使用方式。当时ChatGPT Pro的推出也和Sora强绑定,200美元/月的高端订阅让OpenAI第一次把普通消费者订阅价格拉到非常高的位置。这个节点虽然不是ChatGPT本体模型更新,但它对OpenAI产品体系影响很大:ChatGPT不再只是文本、图片和语音工具,而是开始进入视频生成和创意制作。它也把影视、广告、短视频和设计行业的讨论推到新高度,同时带来版权、真假视频、人物肖像和内容安全等一系列争议。
2024年10月31日:OpenAI推出ChatGPT Search,让ChatGPT开始以更直接的方式挑战传统搜索引擎。此前ChatGPT虽然也能联网或浏览,但体验更像一个附加能力;ChatGPT Search则把实时信息、网页来源、新闻、股票、体育比分等内容整合进自然语言回答里。这个变化的核心是用户不需要先打开搜索框、输入关键词、点开多个链接再自己整理答案,而是可以直接提出完整问题,让ChatGPT根据互联网信息给出整理后的结果。对OpenAI来说,这是补足事实时效性的关键一步;对Google来说,这是最敏感的竞争,因为搜索长期是Google的核心入口和广告基础。ChatGPT Search的发布也说明聊天机器人和搜索引擎的边界开始变得模糊,未来用户获取信息的方式可能会从“搜链接”转向“问答案”。
2024年10月22日:Anthropic发布升级版Claude 3.5 Sonnet、Claude 3.5 Haiku,并开放computer use测试能力。这个更新最受关注的地方,是Claude可以通过API在一定程度上使用电脑,也就是根据屏幕内容移动光标、点击按钮、输入文字,尝试完成软件和网页里的任务。Anthropic同时公布升级版Claude 3.5 Sonnet在代码和工具使用方面有明显提升,例如SWE-bench Verified从33.4%提升到49.0%。这个节点非常重要,因为Claude是最早把“电脑操作”作为模型能力公开展示的主流前沿模型之一。它把AI代理从调用API往真实界面操作推进了一步,也让外界第一次更清楚地看到:未来AI不一定只通过标准接口工作,它也可能像人一样直接使用现有软件。
2024年9月12日:OpenAI发布o1-preview和o1-mini,正式把“推理模型”作为一条独立路线推到台前。o1系列的特点是回答前会花更多时间思考,特别适合科学、数学、代码和复杂推理任务。OpenAI提到,o1在一些高难推理评测中接近甚至超过人类专家表现;o1-mini则更便宜,面向STEM推理场景,API成本比o1-preview低很多。这个节点是大模型竞争史上的分水岭之一,因为此前大家更多比较模型参数、上下文、知识和多模态能力,而o1之后,“测试时计算”和“思考时间”变成新的竞争维度。用户也开始接受这样一种体验:有些问题模型答得慢一点是正常的,因为它不是在闲聊,而是在推导、验证和修正。
2024年8月13日:xAI发布Grok-2和Grok-2 mini,并把它们接入X平台测试。Grok-2相比Grok-1.5在聊天、代码和推理方面都有明显提升,xAI还提到早期版本曾以“sus-column-r”的名字出现在LMArena榜单,并在当时超过Claude 3.5 Sonnet和GPT-4 Turbo的部分排名。Grok-2还开始结合图像生成能力,xAI与Black Forest Labs合作,把FLUX.1模型接入Grok体验里。这次发布让Grok从一个依赖X实时信息的新奇聊天机器人,逐渐变成真正的多模态AI助手。它也让Grok的产品特点更鲜明:一方面能接入X的实时内容,另一方面开始补齐视觉、推理、代码和创作能力。对xAI来说,Grok-2是进入主流模型竞争的第一个明显信号。
2024年7月18日:OpenAI发布GPT-4o mini,并用它取代ChatGPT里的GPT-3.5。这个事件看起来像是一个“小模型”发布,但实际影响很大。GPT-4o mini支持文本和视觉,API上下文窗口达到128K token,单次输出最多16K token,知识截止到2023年10月,价格也比大模型低很多。OpenAI把它提供给Free、Plus、Team用户,企业用户随后开放,这意味着免费用户也能用到比GPT-3.5更现代的模型能力。这个节点代表OpenAI的普及策略:不是所有场景都需要最贵的旗舰模型,便宜、快速、够聪明的小模型同样重要。对开发者来说,GPT-4o mini降低了把AI接入产品的成本;对普通用户来说,它让免费ChatGPT的底线能力明显提高。
2024年6月21日:Anthropic发布Claude 3.5 Sonnet,这个版本后来成为Claude系列真正破圈的关键模型之一。它在速度上达到Claude 3 Opus的两倍,同时价格仍按中端Sonnet模型计算,在代码、视觉、长文理解和复杂任务方面表现突出。Anthropic提到,在内部代理式编码评测中,Claude 3.5 Sonnet解决了64%的问题,而Claude 3 Opus为38%。这个差距让很多开发者开始把Claude当成代码和长上下文任务的首选模型之一。更重要的是,Claude 3.5 Sonnet不是靠“最大模型”取胜,而是靠能力、速度和成本的平衡取胜。它让Anthropic在2024年下半年拥有了非常强的产品抓手,也为后来的Claude Code、Computer Use和Sonnet 4.x系列打下口碑基础。
2024年5月13日:OpenAI发布GPT-4o,其中“o”代表omni,强调它可以在文本、视觉和音频之间进行实时推理。GPT-4o的出现让ChatGPT的交互方式发生明显变化,它不再只是打字聊天,而是可以更自然地看图、听声音、说话,并在语音对话中保持更低延迟。OpenAI还把更多GPT-4级别能力开放给免费用户,这在当时对市场刺激很大,因为它降低了高阶模型能力的使用门槛。GPT-4o的意义不只是模型跑分,它更像一次产品体验升级:用户开始觉得AI可以像实时助理一样交流,而不是一个慢慢输出文字的网页工具。后来的实时语音、多模态聊天、桌面端体验和GPT-4o mini,都可以看作这次发布后的延伸。
2024年3月28日:xAI发布Grok-1.5,把Grok的上下文窗口提升到128K token,并重点改善数学、代码和长文本理解能力。xAI公布的测试显示,Grok-1.5在MATH上达到50.6%,GSM8K达到90%,HumanEval达到74.1%,相比Grok-1有明显提升。这个版本的重要性在于,它把Grok从“有趣、有实时信息”的聊天机器人,往更严肃的推理模型方向推进了一步。128K上下文也让Grok可以处理更长的文档、对话和代码输入,不再局限于短问短答。对于当时刚起步不久的xAI来说,Grok-1.5是展示研发速度的关键节点:从2023年11月Grok-1到2024年3月128K长上下文版本,中间只隔了几个月。
2024年3月17日:xAI开源Grok-1的模型权重和网络架构,发布的是一个3140亿参数的MoE基座模型,并采用Apache 2.0许可。这个事件在当时很受关注,因为前沿闭源模型公司很少公开这么大规模模型的权重。需要注意的是,开源的Grok-1是预训练阶段的原始基座模型,不是已经针对聊天调好的成品模型,也不代表普通电脑可以直接轻松运行。它的意义更多在研究和生态层面:开发者可以研究模型结构,企业和研究机构也能围绕它做优化、部署和实验。对xAI来说,开源Grok-1既是技术展示,也是品牌动作,它把自己和完全闭源的OpenAI、Anthropic做出区分,同时也向开源社区释放了一个信号:xAI不想只做X里的聊天机器人,也想在基础模型层面争取话语权。
2024年3月4日:Anthropic发布Claude 3模型家族,包括Haiku、Sonnet和Opus三个版本。Claude 3的发布让Anthropic第一次以完整模型家族的形式和GPT-4、Gemini正面竞争:Haiku负责速度和低成本,Sonnet负责平衡,Opus则主打最强能力。Claude 3同时支持更好的视觉理解和更强的多语言、推理、代码、长文处理能力,并且Claude API面向更多国家和地区开放。这个节点非常重要,因为Claude不再只是一个“比较安全、比较会写长文”的ChatGPT替代品,而是形成了清晰的产品分层和商业化路径。后来用户熟悉的Opus、Sonnet、Haiku命名体系,也是在这个阶段真正固定下来。Claude 3让Anthropic在2024年开始进入前沿模型第一梯队。
2024年2月15日:Google发布Gemini 1.5,并率先推出Gemini 1.5 Pro供早期测试。这个版本最突出的地方是超长上下文能力,Google展示了Gemini 1.5 Pro可以处理大规模文本、代码、音频和视频输入,并通过Mixture-of-Experts架构提升训练和服务效率。Gemini 1.5的出现,让Google在长上下文这条赛道上突然变得非常强势,因为它不仅能看长文,还能跨模态理解大量信息。对用户来说,这意味着AI可以一次性读完整本书、长代码库、长视频或大量资料,而不是被迫切成很多段慢慢喂。这个节点也让行业对“上下文长度”的重视程度明显上升,此后OpenAI、Anthropic、xAI都在不同阶段加强长上下文能力。Gemini 1.5可以说是Google在ChatGPT压力下打出的第一张真正有技术辨识度的牌。
2024年2月8日:Google把Bard正式改名为Gemini,并推出Gemini Advanced,背后使用的是Gemini Ultra级别能力。这个动作不是简单换名字,而是Google重新整理AI产品品牌的一次关键转向。Bard这个名字在2023年带着很强的实验性质,外界也经常把它看作Google匆忙应对ChatGPT的产品;改名Gemini后,Google把聊天助手、模型家族、移动App和高级订阅服务统一到一个品牌下。Gemini Advanced则对应Google One AI Premium订阅,开始和ChatGPT Plus正面竞争。这个节点说明Google终于不再用一个临时实验产品去打ChatGPT,而是把Gemini放到了公司级AI战略中心。对普通用户来说,Gemini也从“Bard的后续版本”变成了Google AI助手的正式名称。
2023年12月6日:Google正式发布Gemini 1.0,包括Ultra、Pro和Nano三种规格。Gemini 1.0是Google DeepMind成立后交出的第一个重量级模型家族,也被Google称为当时最强、最通用的模型之一。Pro版本先进入Bard,Nano则面向设备端,Ultra作为最强版本准备进入高端产品。这个节点对Google来说非常关键,因为ChatGPT从2022年底爆火后,外界一直质疑Google在生成式AI上反应慢、产品落地不够果断。Gemini 1.0的发布是Google对这种质疑的正式回应,也标志着Google从Bard时代进入Gemini时代。更重要的是,Gemini从一开始就强调多模态,不只是文本模型,而是面向文本、图像、音频、视频和代码的统一系统,这为后来的Gemini 1.5、2.0、2.5和3系列定下了方向。
2023年11月17日:OpenAI董事会突然宣布罢免CEO Sam Altman,引发了整个AI行业最戏剧化的一次公司治理危机。事件发生后,OpenAI内部员工、投资方和合作伙伴迅速反应,微软也被卷入其中。几天内,OpenAI先后出现临时CEO、更换董事会、员工联名施压、Sam Altman可能加入微软、最终又回归OpenAI等连续反转。到11月22日左右,Sam Altman达成回归协议,OpenAI董事会也进行了重组。这个事件之所以是重大节点,是因为它暴露了OpenAI特殊治理结构里的冲突:一边是非营利使命、安全约束和董事会监督,另一边是ChatGPT爆发后巨大的商业化压力、微软合作和资本市场期待。它让外界第一次如此直观地看到,前沿AI公司不只是技术竞争,也面临权力、资本、安全和使命之间的撕扯。
2023年11月6日:OpenAI举办首届DevDay,发布GPT-4 Turbo、GPTs、Assistants API、DALL·E 3 API、文本转语音、GPT-4 Turbo with Vision等一系列开发者产品。GPT-4 Turbo支持128K上下文,知识更新到2023年4月,输入价格比GPT-4便宜3倍,输出价格便宜2倍;GPTs则允许用户不用写代码,就能创建带有自定义指令、知识和工具能力的ChatGPT。这个节点很重要,因为OpenAI从“卖一个聊天产品”进一步走向“让所有人围绕ChatGPT和API构建应用”。GPTs给普通用户提供了低门槛搭建专属助手的方式,Assistants API则给开发者更完整的工具调用、检索和代码解释能力。可以说,DevDay让OpenAI的平台野心第一次被完整展示出来。
2023年11月3日:xAI发布Grok,这是马斯克旗下xAI推出的第一款聊天机器人。Grok一开始就和其他AI助手走了不同路线,官方强调它有一点幽默感和“叛逆”风格,并且可以通过X平台获取实时信息。早期Grok还处于测试状态,xAI也承认它只训练了几个月,能力会快速迭代。这个节点的意义不在于Grok当时已经超过ChatGPT或Claude,而是说明前沿AI竞争又多了一个特殊玩家。xAI手里有X的实时社交数据、马斯克的流量影响力,以及后来快速建设的算力集群,这让Grok从出生起就带有很强的差异化。它不是从办公、搜索或企业服务切入,而是从社交平台和实时信息切入,这条路线后来一直影响Grok的产品定位。
2023年9月25日:OpenAI宣布ChatGPT可以“看、听、说”,开始向Plus和Enterprise用户推出语音和图像能力。语音功能先登陆iOS和Android,图像理解则覆盖更多平台。这个节点是ChatGPT多模态体验的重要开端,因为在此之前,很多人主要把ChatGPT当成文字聊天工具;从这次更新开始,用户可以拍一张图让它解释,可以通过语音和它对话,也可以围绕现实世界里的画面继续追问。它让ChatGPT从网页里的文本框,逐渐变成更接近个人助理的产品。虽然GPT-4o要到2024年才把实时多模态体验推到更高水平,但2023年9月这次更新已经把方向定了下来:ChatGPT不会只停留在文本生成,而是会朝着视觉、语音和真实世界交互不断扩展。
2023年9月25日:Amazon宣布最多向Anthropic投资40亿美元,并和Anthropic展开更深的云和芯片合作。根据协议,Anthropic会把AWS作为重要云服务基础,并使用Trainium、Inferentia等AWS芯片来训练和部署未来模型;Amazon则获得少数股权,同时把Claude引入自身云服务和企业客户生态。这个事件的重要性非常明显:在微软绑定OpenAI之后,Amazon也需要一个足够强的前沿模型伙伴来对抗Azure和Google Cloud的AI叙事。对Anthropic来说,40亿美元级别合作提供了算力、资金和企业分发渠道,让Claude不再只是一个独立聊天机器人,而是可以进入AWS客户、企业私有化和云平台生态。这个节点也标志着大模型公司和云巨头之间的“资本加算力联盟”正式成为行业主线。
2023年8月28日:OpenAI发布ChatGPT Enterprise,正式把ChatGPT推向大企业市场。企业版提供更强的数据隐私和安全承诺,明确客户的业务数据和对话不会用于训练模型,并提供SOC 2合规、传输和静态加密、管理员控制台、SSO、域名验证、使用分析等企业级能力。它还包括无限制的快速GPT-4、32K上下文窗口,以及高级数据分析功能。这个节点很重要,因为ChatGPT早期更多是个人用户和小团队在使用,而企业版发布后,它开始进入公司采购、组织管理、合规审查和大规模部署流程。对OpenAI来说,企业版不仅是收入来源,也是让ChatGPT从现象级消费产品变成企业基础软件的关键一步。对行业来说,这也带动Claude、Gemini、Microsoft Copilot等产品加速争夺企业市场。
2023年7月11日:Anthropic发布Claude 2,并开放新的公开测试网站claude.ai,同时提供API接入。Claude 2在编程、数学、推理和长文本处理上比前代明显提升,并延续Claude系列“更稳、更少有害输出、更适合长文处理”的定位。这个版本当时非常受关注,因为它不像很多只在API里出现的模型,而是直接给普通用户提供聊天入口,让更多人第一次真正体验Claude。Claude 2也继承了Anthropic之前推出的100K上下文能力,可以处理很长的文档和对话,这让它在阅读论文、合同、报告、代码和长篇资料时形成差异化。对ChatGPT来说,Claude 2是第一个在普通用户层面有明显存在感的强竞争对手;对Anthropic来说,它是从研究公司走向产品公司的重要一步。
2023年5月11日:Anthropic把Claude的上下文窗口从9K扩展到100K token,约等于7.5万个英文单词。这个事件在当时非常重要,因为那时大多数聊天模型还很容易被上下文长度限制卡住,用户想让模型读一份长合同、一本书、几十页研究资料或大型代码片段,常常需要切成很多段。Claude 100K上下文让企业和专业用户第一次明显感受到:大模型不仅可以回答问题,还可以真正“读完一大堆材料”再分析。这也成为Claude后续最鲜明的产品标签之一。虽然长上下文不等于完全理解,模型仍可能漏看细节或总结错误,但100K在2023年是非常强的差异化能力。它也迫使其他模型厂商开始重视上下文长度,后来的Gemini 1.5、GPT-4.1、Claude 4.x等长上下文竞争,都可以看到这条线的延续。
2023年3月23日:OpenAI推出ChatGPT Plugins,让ChatGPT第一次可以通过外部工具获取实时信息、运行计算、调用第三方服务或检索私有知识库。插件机制的出现,代表ChatGPT从纯聊天模型向“可连接外部世界的系统”迈出关键一步。OpenAI还提供了检索插件,允许开发者把文档存进向量数据库,再让ChatGPT在对话中检索相关内容。这一思路后来演化出了很多我们今天熟悉的东西,比如文件检索、RAG、工具调用、Actions、Assistants API和Agents SDK。虽然ChatGPT插件商店后来并没有成为一个长期成功的形态,但它的历史价值很大:它证明了大模型单靠内部知识不够,必须能连接外部数据、工具和业务系统。今天所有AI代理产品,本质上都继承了这条路线。
2023年3月21日:Google开始向美国和英国用户开放Bard,这是Google面对ChatGPT爆火后推出的第一款公众可用的对话式AI产品。Bard当时由轻量版LaMDA驱动,定位仍然是实验产品,Google也反复提醒它可能出错,需要用户反馈来改进。这个节点虽然从产品成熟度看不算完美,但历史意义很大,因为它代表Google终于把生成式AI从内部研究推向普通用户。Google拥有Transformer、BERT、LaMDA、PaLM等长期技术积累,但ChatGPT的突然爆火让外界质疑Google是否太谨慎。Bard的开放就是Google对这种压力的回应。后来的Gemini App、Gemini Advanced、AI Mode和Gemini 3,都可以看作Bard这条线逐渐成熟后的结果。
2023年3月14日:OpenAI发布GPT-4,这是ChatGPT之后第一个真正让行业重新估算大模型上限的模型。GPT-4支持图像和文本输入、输出文本,并在多个专业和学术评测里达到接近人类专家的表现,例如模拟律师考试成绩进入前10%左右,而GPT-3.5大约在后10%。OpenAI还提到,GPT-4相比GPT-3.5在内部评估中更不容易响应违规请求,事实性回答也有提升。GPT-4的发布直接把ChatGPT从“很会聊天的新工具”推向“可能改变知识工作方式的系统”。从这一天开始,AI写作、代码生成、教育、法律、金融、客服、办公自动化等场景的讨论都明显升级。GPT-4也成为后面一年多很多产品和创业公司的底层能力来源。
2023年3月14日:Anthropic正式介绍Claude,推出面向聊天界面和API的下一代AI助手。Claude的早期定位和ChatGPT有相似之处,都是可以处理对话、写作、总结、问答和文本任务的AI助手,但Anthropic更强调“helpful, honest, harmless”这套安全理念,也就是有用、诚实、无害。Claude的发布让前沿AI市场第一次出现了一个明确的ChatGPT对照组:它不靠最强营销声量,而是靠更稳的长文处理、更谨慎的回答风格和更强调安全的训练方法切入。虽然早期Claude的大众影响力还不如ChatGPT,但它为后来的Claude 2、Claude 3、Claude 3.5 Sonnet和Claude Code打下了产品基础。这个节点也标志着Anthropic从OpenAI前员工创办的研究公司,正式变成前沿AI产品竞争者。
2023年2月1日:OpenAI发布ChatGPT Plus,定价20美元/月。这是ChatGPT从免费研究预览走向商业化订阅的关键一步。Plus用户可以在高峰期获得更稳定访问、更快响应速度,并优先使用新功能。这个定价后来几乎变成行业参照物:Google Gemini Advanced、Claude Pro、Grok Premium相关权益,以及大量第三方AI工具的月费设计,都绕不开ChatGPT Plus的20美元锚点。ChatGPT Plus的意义不只是收费,而是证明普通个人用户愿意为更强AI助手持续付费。它让OpenAI在API收入之外,多了一条直接面向消费者的订阅收入线,也把ChatGPT从“爆火免费工具”变成了可以长期运营的互联网产品。后来的Pro、Team、Enterprise等套餐,都是在Plus之后继续分层出来的。
2023年1月23日:Microsoft和OpenAI宣布扩大长期合作,微软进行多年、多十亿美元级别投资。这是ChatGPT爆火后最重要的商业合作之一,也奠定了之后几年OpenAI和微软深度绑定的格局。微软不仅提供资金,还提供Azure超算和云基础设施,OpenAI的模型则进入Bing、Microsoft 365、GitHub Copilot、Azure OpenAI Service等产品线。这个节点直接改变了大模型竞争的资源门槛:前沿模型不再只是算法和数据竞争,还变成了云计算、GPU、资本、企业客户和分发入口的综合竞争。对OpenAI来说,微软合作让它有能力继续训练更大模型,并快速进入企业市场;对微软来说,OpenAI给了它在搜索、办公和开发者工具上重新挑战Google的机会。
2022年11月30日:OpenAI发布ChatGPT,最初以免费研究预览的形式开放给用户体验。这个产品的核心突破不在于它是第一个大语言模型,而在于它把复杂的大模型能力包装成一个任何人都能使用的聊天界面。用户可以直接提问、追问、让它改写、解释代码、写邮件、做总结,模型也能承认错误、质疑错误前提,并拒绝部分不合适请求。ChatGPT很快在全球爆火,几乎重新定义了大众对AI的认知:AI不再只是实验室论文、企业后台或开发者API,而是普通人每天都能打开来使用的工具。它也直接引发了2023年之后的生成式AI竞赛,Google推Bard和Gemini,Anthropic推Claude,xAI推Grok,微软、Amazon、Meta、Apple等大公司全部被迫加速调整AI战略。
