原创博客

原创AI技术博客

探索人工智能与大模型最新资讯与技术博客，涵盖机器学习、深度学习、自然语言处理等领域的原创技术文章与实践案例。

排序方式

Pika和HeyGen的开源替代品：上海人工智能实验室开源可以生成高质量最长61秒视频的LaVie文本生成视频大模型

最近，初创企业Pika引起了全球的目光。这家公司发布的Pika 1.0产品可以基于生成式AI技术来创建3D动画视频或者电影级别的视频。由于其逼真的效果，引起了很多人的关注。本文则介绍一个由上海人工智能实验室开源的文本生成视频大模型LaVie。这个模型可以根据文本生成高质量的视频内容。

2023/12/05 21:49:091,420

#LaVie #文本生成视频

如何基于Gradio构建生成式AI的应用：吴恩达联合HuggingFace推出最新1小时短课

ChatGPT是属于生成式AI的一种应用。由于其强大的效果已经变成了当前最主流的一种AI方案。而构建生成式AI应用的一个重要方向是构建友好的web形态的demo让用户能快速体验。Gradio就是这样一种开源方案，也是当前最流行的一种快速构建AI Web应用的方案。昨天吴恩达的DeepLearningAI与HuggingFace共同推出了最新的一期短课程《Building Generative AI Applications with Gradio》，教大家如何使用Gradio快速构建生成式AI的应用。

2023/07/27 09:56:251,426

#Gradio #LLM

通用人工智能（AGI）再往前一步：MetaAI发布新的能听会说的多模态AI大模型ImageBind

当前，大语言模型主要是基于生成式自然语言处理模型为主。少部分多模态模型可以处理文本、图片和视频信息。但是，AI模型目前还无法像人类一样接受周围的多模态信息进行处理，如图像、文本、声音等。但是，昨天MetaAI发布了一个可以听说读写的AI大模型ImageBind，它可以同时处理6种数据，并输出。本文将简单介绍一下这个模型。

2023/05/10 13:32:141,429

#AGI #ImageBind

基于可验证奖励的强化学习（Reinforcement Learning with Verifiable Rewards, RLVR）的介绍：为什么 2025 年，大模型训练的重心开始发生迁移？

过去几年，大语言模型的训练路线相对稳定：更大的模型、更长的预训练、更精细的指令微调与人类反馈对齐。这套方法在很长一段时间内持续奏效，也塑造了人们对“模型能力如何提升”的基本认知。但在 2025 年前后，一种并不算新的训练思路突然被推到台前，并开始占据越来越多的计算资源与工程关注度，这就是**基于可验证奖励的强化学习（Reinforcement Learning from Verifiable Rewards，RLVR）**。

2025/12/21 15:14:291,432

#RLHF #RLVR

近期ChatGPT Plus用户发现GPT-4性能大幅下降！GPT-4性能下降的现象和原因总结

最近很多ChatGPT Plus用户发现GPT-4的版本有了较大的更新，一个比较吸引人的事情是大多数更新后的GPT-4的知识库已经更新到2023年4月份，而且响应速度大幅提高。不过，令人伤心的是，很多用户发现更新后的GPT-4性能大幅下降，表现在指令遵从、记忆、理解等方面。

2023/11/05 21:50:121,438

#GPT-4 #GPT-4性能下降

阿里发布Qwen3小幅更新版本，放弃混合思考模式，发布全新的2个版本Qwen3-235B-A22B-2507模型，1/5的参数，性能直逼Kimi K2，推理模式版本评测结果接近o3

阿里今天开源了一个Qwen3-235B-A22B模型的小幅更新版本，命名为Qwen3-235B-A22B-Thinking-2507，这是一个只支持带推理过程的模型，而四天前，阿里还开源了Qwen3-235B-A22B-Instruct-2507，一个不支持推理过程的模型。这2个版本模型去除了Qwen3此前的一个模型的混合架构模式（即一个模型同时支持thinking和non-thinking），而是拆分成2个不同的版本。阿里官方说这是从社区获得了反馈之后决策的。

2025/07/26 08:22:251,441

#Qwen3 #Qwen3更新版

重磅！MetaAI开源4050亿参数的大语言模型Llama3.1-405B模型！多项评测结果超越GPT-4o，与Claude-3.5 Sonnet平分秋色！

Llama系列大语言模型是由MetaAI开源的一系列大语言模型。作为最早开源的大语言模型，Llama系列对大模型开源社区的推动有目共睹。而现在MetaAI开源Llama3.1系列模型，其中包括迄今为止最大规模的开源大语言模型Llama3.1-405B，参数规模达到了4050亿！其多项评测结果超过GPT-4、GPT-4o模型，与Claude3.5-Sonnet几乎有来有回！

2024/07/24 00:10:361,444

#Llama #Llama3.1-405B

ManusAI技术解析：这真的是Sonnet 3.7+29个工具的简单AI Agent吗？

就在今天，X平台上的一位博主发现可以通过指令让Manus返回它的系统情况，发现ManusAI是Claude Sonnet 3.7+29个工具组成的一个大模型应用系统，也让很多人认为这就是ManusAI的全部，那么这是真的吗？本文结合ManusAI的成员提供的信息为大家介绍。

2025/03/10 22:15:111,445

#AIAgent #Manus

向量大模型新选择，阿里开源向量大模型Qwen-Embedding和重排序大模型Qwen-Reranker，开源向量检索能力第一名！完全免费开源。

阿里巴巴Qwen团队发布了全新的Qwen3 Embedding系列模型，这是一套基于Qwen3基础模型构建的专用文本向量与重排（Reranking）模型。该系列模型凭借Qwen3强大的多语言理解能力，在多项文本向量与重排任务的Benchmark上达到了SOTA水平，其中8B尺寸的向量模型在MTEB多语言排行榜上排名第一。Qwen3 Reranker模型在多个评测基准上同样大幅超越了现有的主流开源竞品。

2025/06/08 22:01:381,446

#Qwen-Embedding #Qwen

Anthropic 最新 Agent 工程方案：使用双 Agent 架构让 AI 实现真正的长时自主工作

就在昨天，Anthropic 发布了一套非常重要的工程方案，专门针对这些挑战而设计：基于“Initializer Agent + Coding Agent”的双 Agent 架构。

2025/11/27 20:34:301,451

#AIAgent #大模型应用

Artificial Analysis报告显示中国AI产业技术突破，已经与美国形成全球双极主导

全球知名AI基准测试机构Artificial Analysis最新发布的2025年第一季度报告揭示了一个引人注目的重要趋势：在大语言模型领域，全球正在形成中美双极主导的新格局。这份权威报告通过严谨的技术指标评测体系，首次以数据量化的方式确认了中国AI技术水平的跨越式发展，特别是在顶尖大模型的研发领域，中国已经实质性地跻身全球第一梯队。本文根据报告的主要内容，为大家总结他们的一些观点和数据。

2025/02/09 21:32:031,460

#中国大模型 #大模型报告

Grok3发布！马斯克旗下大模型企业xAI发布Grok3、Grok3-mini，支持Deep Research、语音交互和“思考”模式的推理大模型，推理模式评测结果全球最强

今天马斯克旗下的xAI公司发布了最新一代大语言模型Grok3，基于20万张GPU集群训练，各方面的提升都非常明显。在主流评测上都超过了现有的大模型。

2025/02/18 17:01:411,473

#Grok-3-mini #Grok-3

Google发布第二代Gemini大语言模型，首个登场的Gemini 2 Flash Experimental，评测结果显示其能力已经超越上一代的Gemini 1.5 Pro！

Gemini是谷歌发布的一系列大模型的名称，是谷歌前期大模型Bard产品的替代品。从Gemini 1.0发布开始，每一次发布都获得了不错的反响。今天，Google发布了最新一代的Gemini 2.0模型，首个产品是其参数规模较小的Gemini 2.0 Flash，它的推理速度是Gemini 1.5 Pro的2倍，但是各项评测结果上的表现却超过了Gemini 1.5 Pro。该模型完全免费提供给大家使用。

2024/12/12 22:23:361,474

#Gemini2.0Flash #Gemini2

重磅！OpenAI发布正式版o1模型，推理能力再次提升，且开启商业化使用，每个月200美元不限量使用！

几个小时前，OpenAI开启了今年密集的产品发布时间，本次发布会持续12天，直播12天。几个小时前，第一个发布的产品宣布，那就是OpenAI o1模型的正式版。同时也开启了一个全新的ChatGPT付费计划，即ChatGPT Pro，每个月200美元，可以不限量使用所有模型。本文详细介绍OpenAI o1模型。

2024/12/06 07:35:141,479

#ChatGPTPro #o1-preview

神秘的图片生成和编辑大模型Nano Banana是什么？背后是Google吗？什么时候发布？能否颠覆Adobe

最近，一个代号 “Nano Banana” 的神秘图像生成与编辑大模型突然在社交网络上掀起风暴。与之前所有模型截然不同，它似乎拥有「记忆面孔」的魔法：无论角度、光影如何变化，人物的面容始终一致；它还能读懂照片里的故事，精准捕捉场景氛围，并服从多步骤、高复杂度的指令。然而，它像幽灵一样没有身世——没有官方文档，没有作者署名，甚至没有一行技术白皮书。极致的神秘感与惊人的效果形成巨大反差，像磁铁般吸住了整个社区的目光：它究竟出自谁手？能力边界到底在哪儿？本文会介绍一下这个模型当前已知的信息，以及如何使用。

2025/08/24 16:43:541,480

#NanoBanana #图片生成大模型

重磅！阿里开源325亿参数规模的推理大模型QwQ-32B：性能接近DeepSeek R1满血版，参数更低，免费商用授权！

就在几个小时前，阿里巴巴开源了最新的一个推理大模型，QwQ-32B，该模型拥有类似o1、DeepSeek R1模型那样的推理能力，但是参数仅325亿，以Apache 2.0开源协议开源，这意味着大家可以完全免费商用。

2025/03/06 08:47:091,484

#QwQ-32B #QwQ

不更改一行AI模型的代码加速你的模型训练过程——AI模型训练加速库Nebulgym简介

前几天初创AI企业Nebuly开源了一个AI加速库nebulgym，它最大的特点是不更改你现有AI模型的代码，但是可以将训练速度提升2倍。

2022/06/17 09:06:511,485

#AI训练 #模型加速

Google发布Gemini 2.0 Pro：MMLU Pro评测超过DeepSeek V3略低于DeepSeek R1，最高上下文长度支持200万tokens！开发者每天免费50次请求！

2025年2月5日，Google官方宣布Gemini 2.0 Pro版本上线，Gemini系列是谷歌最新一代大模型的品牌名称。Google最早在2024年12月中旬发布了Gemini 2.0系列的第一个模型Gemini 2.0 Flash，当时试用的人都普遍反应这个模型速度又快，结果友好，让Google摆脱了此前大模型很落后的印象。今天，Gemini 2.0 Pro上线，其能力更强。

2025/02/06 19:18:021,489

#Gemini #Gemini2.0

如何更好地使用 Sora2 生成视频？来自 OpenAI 官方的终极 Prompt 指南

Sora2 的发布再次引爆了视频生成领域。你可能已经看到过一些令人惊叹的演示视频，但当你自己上手时，生成的作品可能并不尽如人意。问题出在哪里？很可能就在你的提示词（Prompt）上。

2025/10/07 23:35:121,490

#Sora2 #视频生成大模型

如何让大模型提取更有信息密度的文本摘要？SalesforceAI最新的密度链提示方法Chain of Density Prompting

基于文本做文本摘要的时候，摘要所包含的信息密度是一个非常重要的问题。正常情况下我们希望文本摘要既能覆盖更多的重要信息，又要保持简洁和连贯。SalesforceAI与MIT等机构的研究人员联合发布了一个最新的Prompt技巧，称为密度链提示方法（Chain of Density Prompting），可以提取有信息含量的简洁摘要。

2023/09/19 11:52:441,491

#密度链 #密度链提示

马斯克的X.AI平台即将发布的大模型Grōk AI有哪些能力？新消息泄露该模型支持2.5万个字符上下文！

尽管OpenAI最早也是马斯克和别人一起创立，由于各种原因分道扬镳之后马斯克也没有对相关产品感兴趣，直到ChatGPT风卷全球之后，马斯克与OpenAI的人公开吵了几次之后成立了这家公司。半年后的现在，马斯克透露xAI即将发布它的首个大模型Grōk AI。而一位老哥已经透露了该模型的一些细节。

2023/11/05 13:56:321,492

#Grok #GrōkAI

重磅！Meta将PyTorch移交给Linux基金会！

昨天，Meta的Zuckerberg宣布，将PyTorch由Meta AI移交给Linux Foundation托管。这意味着PyTorch从今天起从Meta独立，并作为Linux Foundation下的一个项目。

2022/09/13 15:37:311,495

#pytorch #开源

看特斯拉前AI总监、OpenAI前知名研究员Andrej Karpathy如何看AI大模型编程（Claude Code这样的工具）：AI Agent正在重塑编码工作流，2026年的软件工程大变革

本文整理了 Andrej Karpathy 在 2025 年底关于 AI Agent 编程的核心观点。基于其使用 Claude Code 等大模型的真实工程经验，Karpathy 认为软件工程正从“手动编码”转向“由 AI Agent 执行、人类定义目标与约束”的新范式。文章同时分析了 AI Agent 在效率提升之外带来的工程风险、技能退化与内容质量问题，并指出 2026 年将是行业系统性消化 AI Agent 能力的关键一年。

2026/01/27 08:49:431,498

#AIAgent #AndrejKarpathy

国产全球最长上下文大语言模型开源：XVERSE-13B-256K，一次支持25万字输入，免费商用授权~

深圳的元象科技开源了一个最高上下文256K的大语言模型XVERSE-13B-256K，可以一次性处理25万字左右，是目前上下文长度最高的大模型，而且这个模型是以Apache2.0协议开源，完全免费商用授权。

2024/01/17 22:27:071,501

#Long-Context #XVERSE-13B-256K