人工智能与大模型最新资讯与技术博客

GPT-5 模式与配额全解析：自动与手动 Thinking 的区别、不同用户的使用配额问题等

GPT-5 在 ChatGPT 中引入了“自动在普通/推理间切换”的机制，但模式命名、配额规则和速率限制让许多用户困惑。本文梳理不同模式的作用、是否计入推理配额、各订阅层的可用性与限制、旧模型的替换规则，并提供三步配额优化策略。特别提示：编码与大上下文任务应优先使用 GPT-5 Thinking（≈196k 上下文），而普通 Chat 模式上下文为 32k。

2025/08/12 22:51:12 阅读 1399

ChatGPT/GPT-5/GPT-5使用/GPT-5配合

IOI（International Olympiad in Informatics）：从世界顶级算法竞赛到大语言模型的新基准

在衡量大语言模型（LLM）智能水平的众多方法中，除了常见的常识推理、专业领域测评外，还有一个正在兴起且极具挑战性的方向——算法问题求解。在这一领域，几乎没有哪项比赛能比国际信息学奥林匹克（International Olympiad in Informatics，简称 IOI）更具权威性与含金量。

2025/08/12 14:48:26 阅读 67

大模型数学能力评测/大模型评测/评测基准

智谱AI发布GLM-4.5V多模态推理模型

智谱AI刚刚开源了新一代视觉-语言模型（Vision-Language Model, VLM）——GLM-4.5V。该模型基于其旗舰文本基础模型GLM-4.5-Air（总参数量1060亿，激活参数量120亿），延续GLM-4.1V-Thinking的技术路线，在42项公开视觉多模态基准测试中，在同规模模型中实现领先性能。GLM-4.5V面向图像、视频、文档理解以及GUI任务等常见多模态场景，采用Mixture-of-Experts（MoE）架构，并保持开源。

2025/08/11 23:28:48 阅读 282

GLM-4.5V/开源大模型/智谱AI/视觉理解大模型

大模型评测基准AIME 2024介绍

2024年，美国数学邀请赛（AIME）成为评估大型语言模型（LLM）数学推理能力的重要基准。AIME是一项备受尊崇的考试，包含15道题，考试时间为3小时，旨在考察美国顶尖高中生在各类数学领域的复杂问题解决能力。

2025/08/11 16:56:23 阅读 4302

SWE-Bench/大模型编程能力/大模型评测/大模型评测基准

SWE-bench Verified：提升 AI 模型在软件工程任务评估中的可靠性

在人工智能领域，随着大型语言模型（LLMs）在各类任务中的表现不断提升，评估这些模型的实际能力变得尤为重要。尤其是在软件工程领域，AI 模型是否能够准确地解决真实的编程问题，是衡量其真正应用潜力的关键。而在这方面，OpenAI 推出的 *SWE-bench Verified* 基准测试，旨在提供一个更加可靠和精确的评估工具，帮助开发者和研究者全面了解 AI 模型在处理软件工程任务时的能力。

2025/08/11 16:54:15 阅读 826

SWE-Bench/大模型编程能力/大模型评测/大模型评测基准

SWE-bench大模型评测基准介绍：测试大模型在真实软件工程任务中的能力

随着大语言模型（LLM）的快速发展，它们在自然语言处理（NLP）、代码生成等领域的表现已达到前所未有的高度。然而，现有的代码评测基准（如 HumanEval）通常侧重于**自包含的、较短的代码生成任务**，而未能充分模拟真实世界的软件开发环境。为弥补这一空白，研究者提出了一种全新的评测基准——**SWE-Bench**，旨在测试 LLM 在**真实软件工程问题**中的能力。

2025/08/11 16:51:52 阅读 1626

大模型编程能力/大模型评测/大模型评测基准

Qwen Code介绍和使用：阿里开源的命令行AI编程助手，免费开源，支持最高100万的上下文！

阿里巴巴的 Qwen Code 是一款开源的命令行 AI 工具，旨在提升开发者的编程效率，特别适用于处理大型代码库和复杂的开发任务。 2025年8月9日，阿里宣布提供每天2000次的免费Qwen Code服务，应该是满足大多数开发者的日常需求了。

2025/08/09 08:52:12 阅读 327

Qwen/QwenCode/命令行AI助手/阿里

xAI发布Grok Imagine功能，一条文本命令即可生成图片和最长达15秒的视频，也可以基于现有照片生成视频，免费用户也可以使用~

Grok Imagine 是一个由 xAI 开发的创新功能，集成到 Grok AI 聊天机器人中，旨在让用户能够从文本和视觉命令快速生成图像和视频。Grok Imagine最大的特点是能够生成长达 15 秒的视频，带有同步音频，使其成为 OpenAI 的 Sora 和 Google 的 Veo 3 等工具的直接竞争者。此外，它还包括一个“Spicy”模式，允许生成成人或显式内容，这一点引发了伦理和潜在误用的争议。

2025/08/08 22:07:14 阅读 718

GrokImagine/图像生成/图像编辑/图片生成视频/文本生成图片

OpenAI发布GPT-5：这是一个包含实时路由的AI系统，而不仅仅是一个模型

几个小时前，OpenAI发布了全新一代大模型GPT-5系列。本次发布的是一个全新的AI系统，而非一个单独的模型系列。GPT-5背后包含了5个不同的模型系列或者版本，分别是GPT-5-Pro、GPT-5、GPT-5-mini、GPT-5-nano和GPT-5-Chat。

2025/08/08 08:45:13 阅读 365

GPT/GPT-5/GPT-5Reasoning/OpenAI

Anthropic发布了Claude Opus 4.1：这是一个Claude Opus 4的小幅升级版本，价格和技术参数不变，性能略有提升

Anthropic 在 Opus 4 发布不到三个月后推出 Claude Opus 4.1，宣称“可直接替换”旧版模型。更新聚焦真实世界编码、长链路代理（agentic）任务和细粒度推理，同时保持相同 API 名称结构和计费档位，方便现有应用平滑迁移。

2025/08/07 23:37:36 阅读 109

ClaudeOpus

OpenAI Harmony 消息格式技术详解：一种为高级 Agent 设计的精细化消息格式

近日，OpenAI在发布其开源模型gpt-oss-120b和gpt-oss-20b的同时，也推出了一种专为这些模型设计的全新消息格式——Harmony。对于希望在自有解决方案中充分利用这些开源模型的开发者而言，理解Harmony至关重要。本文将以客观的第三方视角，详细解析Harmony格式的设计理念与技术细节。

2025/08/07 17:17:38 阅读 382

OpenAIHarmony消息格式/大模型技术

Simple Bench：一个专为“常识”而生的大模型评测基准

随着大型语言模型（LLM）的飞速发展，如何准确、全面地评估它们的能力成为了一个日益重要的课题。在众多评测基准中，Simple Bench 以其独特的定位脱颖而出，它专注于检验模型在日常人类推理方面的能力，而在这些方面，当前最先进的模型往往还不如普通人。本文将详细介绍 Simple Bench 评测基准，探讨其出现的背景、设计理念、评测流程以及当前主流模型的表现。

2025/08/07 09:34:05 阅读 177

SimpleBench/大模型评测/常识评测

OpenAI开源2个全新大模型，比肩o3-mini的GPT-OSS-20B和比肩o4-mini的GPT-120B，完全免费商用授权

在几个小时前，OpenAI开源了两款名为gpt-oss-120b和gpt-oss-20b的大语言模型。这是自GPT-2以来，OpenAI首次推出开源权重大语言模型，这两个模型的评测效果达到了o4-mini和o3-mini的水平，而且以Apache 2.0协议开源，大家可以自由使用，包括任何形式的商用。

2025/08/06 09:22:22 阅读 235

GPT-OSS/GPT-OSS-120B/GPT-OSS-20B/OpenAI/开源大模型

大模型评测基准Codeforces：代码生成能力的终极试金石

随着大型语言模型（LLM）能力的飞速发展，如何科学、准确地评估其性能，特别是深度的逻辑推理和代码生成能力，已成为人工智能领域的一大挑战。传统的评测基准在面对日益强大的模型时，逐渐暴露出数据污染、难度不足、无法有效评估真实推理能力等问题。在这一背景下，一个旨在检验模型竞赛级编程水平的评测基准——Codeforces应运而生，为我们提供了一个更严苛、更接近人类程序员真实水平的竞技场。

2025/08/06 09:10:31 阅读 180

代码生成评测/大模型评测/编程水平评测

谷歌发布Genie 3：一个可以生成720P开启实时交互式虚拟世界生成新纪元

谷歌DeepMind发布了一个全新的大模型——Genie 3，这是一个能够根据文本描述生成多样化、可实时交互虚拟世界的通用世界模型。目前，Genie3可以生成几分钟的720P的视频，且每秒24帧左右。用户也可以在生成的视频中实时交互控制。从谷歌官方的视频看，这个Genie 3模型生成的视频和游戏世界的质量很高，非常令人心动！

2025/08/05 23:17:11 阅读 626

Genie3/Google/世界模型

重磅！阿里开源媲美GPT-4o的图片生成和编辑大模型Qwen Image，中文渲染能力很强，还有精确的文字控制，免费开源！

就在刚才，阿里开源了Qwen Image大模型，这是阿里千问团队开源的高质量图片生成和编辑的大模型。这份发布迅速在AI社区引起了广泛关注，其核心并非又一个单纯追求图像美学或真实感的模型，而是直指一个长期存在的行业痛点：在图像中进行复杂、精准、尤其是高保真的多语言文本渲染。

2025/08/05 08:23:39 阅读 438

QwenImage/图片编辑/文本生成图片

大模型评测SimpleVQA全方位深度解析，直击多模态模型“事实幻觉”

随着多模态大语言模型（MLLM）在各个领域的应用日益广泛，一个核心问题浮出水面：我们如何信赖它们生成内容的准确性？当模型需要结合图像和文本进行问答时，其回答是否基于事实，还是仅仅是“看似合理”的幻觉？为了应对这一挑战，一个名为SimpleVQA的新型评测基准应运而生，旨在为多模态模型的事实性能力提供一个清晰、可量化的度量衡。

2025/08/01 15:49:57 阅读 100

多模态评测/大模型评测

Zhipu AI重磅发布GLM-4.5系列：技术深度解析与多维度性能评测

7月28日，智谱AI（Zhipu AI）向开源社区投下了一枚重磅炸弹，正式发布了其最新的旗舰模型系列：GLM-4.5。该系列包含两个新成员——GLM-4.5和GLM-4.5-Air，两者均以开源权重形式提供。官方技术报告详细阐述了其设计理念、技术细节以及在多项基准测试中的表现。本次发布的核心目标是打造一个能够统一推理、代码和Agent智能体能力的模型，以应对日益复杂的AI应用需求。本文将深入解析这份官方报告，剖析其核心技术、性能表现，并探讨其在当前大模型竞争格局中的战略定位。

2025/07/29 11:06:25 阅读 462

GLM-4.5系列/MoE架构/开源大模型/混合推理

阿里发布Qwen3小幅更新版本，放弃混合思考模式，发布全新的2个版本Qwen3-235B-A22B-2507模型，1/5的参数，性能直逼Kimi K2，推理模式版本评测结果接近o3

阿里今天开源了一个Qwen3-235B-A22B模型的小幅更新版本，命名为Qwen3-235B-A22B-Thinking-2507，这是一个只支持带推理过程的模型，而四天前，阿里还开源了Qwen3-235B-A22B-Instruct-2507，一个不支持推理过程的模型。这2个版本模型去除了Qwen3此前的一个模型的混合架构模式（即一个模型同时支持thinking和non-thinking），而是拆分成2个不同的版本。阿里官方说这是从社区获得了反馈之后决策的。

2025/07/26 08:22:25 阅读 644

Qwen3/Qwen3更新版/千问大模型

如何评价大模型和AI Agent在命令行环境中执行工具解决任务的能力？Terminal Bench评测简介

Terminal-Bench是一个新兴的开源基准测试，专为评估人工智能Agent（AI Agent）在命令行终端环境中的实际操作能力而设计。它通过一系列模拟真实世界场景的复杂任务，旨在客观、可量化地衡量AI Agent在执行代码编译、服务器管理和数据处理等任务时的熟练程度与自主性。

2025/07/23 16:56:16 阅读 383

AIAgent评测/TerminalBench/大模型评测/评测基准

阿里开源全新编程大模型Qwen3-Coder-480B-A35B，官方宣称其编程水平接近Claude Sonnet 4，免费开源可商用，同时开源Claude Code免费平替选择Qwen Code

阿里宣布开源第三代编程大模型Qwen3-Coder-480B-A35B，该模型是Qwen3编程大模型中第一个开源的版本，同时官方还基于Google的Gemini CLI改造并开源了阿里自己的命令行编程工具Qwen Code，完全免费使用。

2025/07/23 08:30:01 阅读 530

Agentic编程/Qwen-Coder/Qwen3/编程大模型

OpenAI内部通用大模型已经可以拿到国际数学奥利匹克竞赛金牌：AI推理能力已经接近人类顶级水平

几个小时前，OpenAI的研究人员披露，其一款内部实验性的大语言模型，在模拟的国际数学奥林匹克（International Math Olympiad ，IMO）竞赛2025中取得了金牌水平的成绩。这是一个里程碑式的突破，因为IMO被认为是衡量创造性数学推理能力的巅峰，远超以往任何AI基准测试。这项成就并非通过专门针对数学的“窄”方法实现，而是源于通用人工智能研究的根本性突破，尤其是在处理难以验证的任务和长时间推理方面。

2025/07/19 18:22:05 阅读 1196

GPT/OpenAI/大模型/大模型评测/数学推理

OpenAI正在测试一个新的o3模型：o3 alpha模型，实测编码和游戏能力十分突出

2025年7月17日，LMArena的大模型Web能力匿名竞技场出现了一个代号为anonymous-chatbot-0717的模型，而根据ChatGPT网页版的抓包显示，这个模型应该是o3家族系列的一员，其模型的api的id为“o3-alpha-responses-2025-07-17”。

2025/07/19 11:14:05 阅读 207

ChatGPT/o3alpha/OpenAI/新模型

OpenAI发布ChatGPT Agent系统：一个新模型驱动的系统，可以写代码运行代码，使用浏览器订票，写PPT、做excel的全能Agent

OpenAI刚刚发布了一个全新的AI Agent产品，称为ChatGPT Agent。这个全新的Agent系统可以控制我们的电脑，然后使用电脑上的浏览器、PPT、Excel等工具帮我们完成一些日常的工作，从头开始帮我们完成一些非常复杂的任务。根据OpenAI的描述，这个Agent系统的目标未来是一个通用的Agent，而这些能力未来将会随着这个产品不定期更新。

2025/07/19 09:03:39 阅读 177

AIAgent/AIAgent系统/ChatGPTAgent/OpenAI

最新博客