人工智能与大模型最新资讯与技术博客

★ 【置顶】推荐一个国内可以按分钟计费的4090显卡租用公有云，一个小时24GB显存的4090只需要2.37元——仙宫云

大模型的发展速度很快，对于需要学习部署使用大模型的人来说，显卡是一个必不可少的资源。使用公有云租用显卡对于初学者和技术验证来说成本很划算。DataLearnerAI在此推荐一个国内的合法的按分钟计费的4090显卡公有云服务提供商仙宫云，可以按分钟租用24GB显存的4090显卡公有云实例，非常具有吸引力~

4090显卡/仙宫云/显卡公有云/显卡租赁

检索增强生成（RAG）

大模型检索增强生成是一种结合了大规模语言模型的自动生成能力和针对特定数据的检索机制，以提供更准确、信息丰富的输出内容的技术。

查看RAG合集

Long Context

大模型对长上下文的处理能力在于它们能够理解和维持较长篇幅的文本连贯性，有助于提升质量，以及对复杂问题和讨论的理解和回应质量。

LongContext合集

AI Agent

大模型的AI Agent是一种高级智能系统，能够理解复杂的指令和查询，并以人类般的方式生成响应、执行任务或提供决策支持。

AI Agent合集

Keras框架下的保存模型和加载模型

2019/03/27 21:19:46

3066

Keras框架下的保存模型和加载模型

Keras中predict()方法和predict_classes()方法的区别

2019/03/27 21:19:21

7345

Keras中predict()方法和predict_classes()方法的区别

Sequence-to-Sequence model

2019/03/27 21:18:52

3433

Sequence-to-Sequencemodel

TensorFlow学习——基本概念（1）

TensorFlow基本概念

2019/03/27 21:18:22

3046

TensorFlow基本概念

tf.nn.softmax_cross_entropy_with_logits函数

2019/03/27 21:17:48

4362

tensorflow/tf.nn.softmax_cross_entropy_with_logits函数

pandas的一些使用技巧

pandas的使用

2019/03/27 21:16:54

2900

pandas/Python

Microsoft Visual C++ 14.0 is required 的解决方案

Microsoft Visual C++ 14.0 is required

2019/03/27 21:15:19

3029

MicrosoftVisualC++14.0isrequired/python

网络爬虫存储数据的三种常见方式及其python实现

网络爬虫

2019/03/27 21:14:29

3434

excel/Python/TXT/数据库

用python生成随机数的几种方法

本篇博客主要讲解如何从给定参数的的正态分布/均匀分布中生成随机数以及如何以给定概率从数字列表抽取某数字或从区间列表的某一区间内生成随机数，按照内容将博客分为3部分，并附上代码。

2019/03/27 21:13:17

5103

Python/随机数生成

用python绘制散点图

如何使用python绘制简单的散点图

2019/03/27 21:13:00

6061

Python/散点图

深度学习之GRU神经网络

之前面的博客中，我们已经描述了基本的RNN模型。但是基本的RNN模型有一些缺点难以克服。其中梯度消失问题（Vanishing Gradients）最难以解决。为了解决这个问题，GRU（Gated Recurrent Unit）神经网络应运而生。本篇博客将描述GRU神经网络的工作原理。GRU主要思想来自下面两篇论文：

2019/03/23 15:34:28

10914

GRU/RNN/深度学习

深度学习之LSTM模型

在前面的博客中，我们已经介绍了基本的RNN模型和GRU深度学习网络，在这篇博客中，我们将介绍LSTM模型，LSTM全称是Long Short-Time Memory，也是RNN模型的一种。

2019/03/23 15:34:00

9582

LSTM/RNN/深度学习

8个非常好的NLP领域的预训练模型（包含代码和论文资源）

使用预训练模型处理NLP任务是目前深度学习中一个非常火热的领域。本文总结了8个顶级的预训练模型，并提供了每个模型相关的资源（包括官方文档、Github代码和别人已经基于这些模型预训练好的模型等）。

2019/03/23 12:27:49

11076

NLP/PretrainedModel/深度学习/预训练

深度学习之Attention机制

Encoder-Decoder的深度学习架构是目前非常流行的神经网络架构，在许多的任务上都取得了很好的成绩。在之前的博客中，我们也详细介绍了该架构（参见深度学习之Encoder-Decoder架构）。本篇博客将详细讲述Attention机制。

2019/03/21 11:32:02

6196

Attention/RNN/深度学习

深度学习中Sequence to Sequence (Seq2Seq) 模型的目标是将一个序列转换成另一个序列。包括机器翻译（machine translate）、会话识别（speech recognition）和时间序列预测（time series forcasting）等任务都可以理解成是Seq2Seq任务。RNN（Recurrent Neural Networks）是深度学习中最基本的序列模型。

2019/03/19 11:19:04

13208

Encoder-Decoder/RNN/Seq2Seq/深度学习