
大模型评测SimpleVQA全方位深度解析,直击多模态模型“事实幻觉”
随着多模态大语言模型(MLLM)在各个领域的应用日益广泛,一个核心问题浮出水面:我们如何信赖它们生成内容的准确性?当模型需要结合图像和文本进行问答时,其回答是否基于事实,还是仅仅是“看似合理”的幻觉?为了应对这一挑战,一个名为SimpleVQA的新型评测基准应运而生,旨在为多模态模型的事实性能力提供一个清晰、可量化的度量衡。
Explore the latest AI and LLM news and technical articles, covering original content and practical cases in machine learning, deep learning, and natural language processing.

随着多模态大语言模型(MLLM)在各个领域的应用日益广泛,一个核心问题浮出水面:我们如何信赖它们生成内容的准确性?当模型需要结合图像和文本进行问答时,其回答是否基于事实,还是仅仅是“看似合理”的幻觉?为了应对这一挑战,一个名为SimpleVQA的新型评测基准应运而生,旨在为多模态模型的事实性能力提供一个清晰、可量化的度量衡。

最近,一张截图在网络上流传,显示OpenAI安卓客户端的应用字符串文件(strings.xml)中出现了关于GPT-4.5的相关描述。这一发现引发了广泛关注,暗示OpenAI可能即将推出其最新的大型语言模型——GPT-4.5。该信息最早由开发者 @bitbor91 发现并分享,截图内容似乎来自ChatGPT安卓客户端的应用资源文件。

在 AI Agent 开发中,任务中断、状态丢失、context 超限是三个最常见的工程痛点。Anthropic 最新发布的 Managed Agents 工程博客给出了一套结构性解法:将 Agent 的大脑(调度逻辑)、手(执行环境)和记忆(会话日志)彻底解耦,让每个组件都能独立失败和重启,同时把完整的事件历史存在 context window 之外,从根本上解决长任务的状态管理问题。本文拆解这套架构的核心设计决定,以及背后的工程思路。


DeepSeek 开源的 DSH 不是又一个 Coding Agent,而是一个 Agent Runtime Framework。它把 Agent Loop、Session、Persistence 等传统上属于 Agent Core 的部分全部做成可替换插件,通过 Capability Seam 的三角色模型实现能力与实现的解耦,并要求所有模型可见内容必须可从日志重建。本文解析 DSH 最核心的几处设计,以及它与 Claude Code、Codex、Pi 等产品的真正差异。

2026 年 8 月,DeepSeek 开源全新 Agent 框架 DeepSeek Harness(DSH)。本文从架构角度解析其 Everything is a Plugin、模型请求可重建、Capability Seam 与 Subagent 等核心设计,并与 Claude Code、Codex、OpenCode、Pi 对比,讨论其作为 Agent Runtime Framework 的创新、优势与代价。

Azure OpenAI 的模型下架周期正在变短:gpt-5.1 之前所有版本从上架到弃用都是365天,但从 gpt-5.2 开始骤降到约180天。本文用官方生命周期数据,分析企业做 Agent 应用调优时该如何应对模型版本更替加快的问题。

多 Agent 系统的复杂度不仅来自 Agent 本身,更来自任务的拆分、调度与交付。当用户一次提交多个相似或相互依赖的任务时,系统需要在并发执行、任务隔离、状态管理、依赖协调、失败恢复与资源控制之间取得平衡。本文调研业界主流多 Agent 架构与编排模式,重点分析任务生命周期、任务队列与调度、子 Agent 管理、并发控制、重试与容错,以及结果聚合和最终交付机制,并总结构建可扩展、可观测、可靠的多 Agent 任务系统的关键设计原则。

大模型Agent系统从demo走向生产后,成本会成为最突出的问题。Anthropic官方最近发布了一份基于内部实测数据的优化指南,把所有手段分为"不损失效果的免费优化"和"需要取舍的调节"两类,涵盖prompt缓存、effort调节、任务预算、失败重跑、以及advisor和orchestrator两种多模型架构。其中prompt缓存是最大的单一杠杆,可将agent循环成本压缩到原来的三分之一左右。本文完整梳理了这份文档的关键结论、适用条件和失效场景。

本文基于 GPT-5.6 Sol Pro 的 Deep Research,系统研究 2025–2026 年长时程工具型 Agent、编码 Agent、Deep Research Agent 和多轮业务 Agent 的上下文压缩与管理方法。研究发现,当前业界正在从简单的滚动摘要,转向“不可变事件日志 + 结构化工作状态 + 近期原文 + 外部可恢复材料”的分层上下文架构。对于编码 Agent,优先删除或屏蔽可重新获取的旧工具输出,往往比直接使用 LLM 摘要具有更好的成本收益;

全球大模型竞争正在从单纯的模型能力竞赛,走向模型、产品、开发者生态、成本与商业化能力的综合竞争。本文系统梳理全球主流基础模型的发展格局,对比 OpenAI、Google、Anthropic、DeepSeek、Qwen 等主要参与者的技术路线、模型能力与生态布局,分析全球大模型市场当前的竞争态势及未来演进方向。