统计、机器学习与编程知识的原创博客

支持超长上下文输入的大语言模型评测和总结——ChatGLM2-6B表现惨烈，最强的依然是商业模型GPT-3.5与Claude-1.3

目前开源领域已经有一些模型宣称支持了8K甚至是更长的上下文。那么这些模型在长上下文的支持上表现到底如何？最近LM-SYS发布了LongChat-7B和LangChat-13B模型，最高支持16K的上下文输入。为了评估这两个模型在长上下文的表现，他们对很多模型在长上下文的表现做了评测，让我们看看这些模型的表现到底怎么样。

2023/07/02 09:40:48 阅读 3728

LLM/long-context/开源大模型/超长上下文

Scikit-Learn最新更新简介

Scikit-Learn有很优秀的机器学习处理思想，包括TensorFlow等新框架都借鉴了它的设计思想。最近的更新也让Scikit-Learn更加强大。在描述这个更新之前我们先简单看一下历史，然后让我们一起看看都有什么新内容吧。

2020/02/12 22:33:36 阅读 3733

sk-learn/人工智能/机器学习/编程

使用Spring Security进行登录验证

Spring Security可以帮助我们进行页面的权限控制和登录验证，在这篇博客中，我们将简要描述如何使用Spring Security进行登录验证。

2017/11/08 11:15:53 阅读 3762

SpringMVC/SpringSecurity/web开发/网站系统

pandas.DataFrame.to_csv和dask.dataframe.to_csv在windows下保存csv文件出现多个换行结果

使用pandas的DataFrame和dask的DataFrame保存数据到csv文件时候会出现两个换行符的情况。本文描述如何解决。

2020/05/08 17:20:04 阅读 3778

dask/pandas/python

时间序列数据处理中的相关数学概念

时间序列数据分析的基础包含大量的统计知识。这篇博客主要用通俗的语言描述时间序列数据中涉及到的一些基本统计知识。

2019/07/09 14:50:20 阅读 3788

时间序列数据/统计

大模型领域最著名开源模型小羊驼Vicuna升级！Vicuna发布1.5版本，可以免费商用了！最高支持16K上下文！

Vicuna是开源领域最强最著名的大语言模型，是UC伯克利大学的研究人员联合其它几家研究机构共同推出的一系列基于LLaMA微调的大语言模型。这个系列的模型因为极其良好的表现以及官方提供的匿名评测而广受欢迎。今天，LM-SYS发布Vicuna 1.5版本，包含4个模型，全部基于LLaMA2微调，最高支持16K上下文输入，最重要的是基于LLaMA2的可商用授权协议！免费商用授权！

2023/08/03 14:14:54 阅读 3800

LLaMA2/vicuna/开源

Eclipse使用Maven插件的简单介绍

使用Maven作为构建工具，管理项目和依赖非常方便。这篇博客将简要介绍在Eclipse中如何使用Maven插件

2017/11/08 15:25:09 阅读 3808

maven/构建工具/编程

2022年全球最大的10家数据处理相关的创业公司

最近几年，数据的重要性在各个领域都获得了巨大的重视。因此，数据管理相关的业务也成为各项基础设施中增长最快的业务，目前的市场规模约700亿美元，占所有企业的基础设施支持约1/5。仅在2021年，数据处理相关的公司获得了数百亿的风险投资。为此，Future总结了2022年全球最大的50家数据创业企业。这里我们列举其中的最大的10个进行介绍。

2022/03/26 00:18:52 阅读 3813

人工智能/企业简介

如何基于PyTorch来优化大模型训练的内存（显存）使用：8种方法总结

大模型虽然效果很好，但是对资源的消耗却非常高。更麻烦的其实不是训练过程慢，而是峰值内存（显存）的消耗直接决定了我们的硬件是否可以来针对大模型进行训练。最近LightningAI官方总结了使用Fabric降低大模型训练内存的方法。但是，它也适用于其它场景。因此，本文总结一下相关的方法。

2023/07/04 22:24:11 阅读 3813

大模型微调/模型压缩

100天搞定机器学习（100-Days-Of-ML）（一）数据预处理

2019/07/06 20:46:50 阅读 3815

机器学习

深度学习方法：受限玻尔兹曼机RBM【转载】

受限玻尔兹曼机（Restricted Boltzmann Machine，RBM）是G.Hinton教授的一宝。Hinton教授是深度学习的开山鼻祖，也正是他在2006年的关于深度信念网络DBN的工作，以及逐层预训练的训练方法，开启了深度学习的序章。其中，DBN中在层间的预训练就采用了RBM算法模型。RBM是一种无向图模型，也是一种神经网络模型。

2017/04/10 20:38:00 阅读 3822

RBM/受限玻尔兹曼机/神经网络

[翻译]当推荐系统遇上深度学习

翻译自Wann-Jiun Ma的Deep Learning Meets Recommendation Systems，主要讲了推荐系统的基础算法以及使用深度学习对电影的海报进行近似计算，从而推荐相似的电影。

2017/05/10 16:38:41 阅读 3832

推荐系统/深度学习/电影推荐

使用SpringMVC创建Web工程并使用SpringSecurity进行权限控制的详细配置方法

使用SpringMVC框架搭建Web项目工程是目前非常流行的web项目创建方式。同时Spring Security也为我们提供了登录验证和权限控制等内容。

2017/11/08 11:16:01 阅读 3866

SpringMVC/SpringSecurity/web开发/网站建设/网站开发

科研词助

科研小助手，帮助认识科研中常见缩写词和混淆词等，来自《机器学习导论》的专业词汇

2017/06/11 17:23:22 阅读 3871

科研软文化

Text-to-Video来临！——Meta AI发布最新的视频生成预训练模型

DALLE·2的出现，让大家认识到原来文本生成图片可以做到如此逼真效果，此后Stable Diffusion的开源也让大家把Text-to-Image玩出花了。而现在，Meta AI的研究人员让这个工作继续往前一步，发布了Text-to-Video的预训练模型：Make-A-Video。

2022/09/30 00:39:18 阅读 3899

text-to-image/text-to-video

HuggingFace过去七天最流行的AI模型一览——预训练大模型绝对王者

HuggingFace是目前最火热的AI社区（HuggingFace简介：https://www.datalearner.com/blog/1051636550099750 ），很多人称之为AI模型的GitHub。包括Google、微软等很多知名企业都在上面发布模型。而HuggingFace上提供的流行的模型也是大家应当关注的内容。本文简单介绍一下2023年4月初的七天（当然包括3月底几天）的最流行的9个模型（为什么9个，因为我发现第10个是一个数据集！服了！）。让大家看看地球人都在关注和使用什么模型。

2023/04/24 22:43:31 阅读 3906

AI流行趋势

Seq2Seq的建模解释和Keras中Simple RNN Cell的计算及其代码示例

RNN的应用有很多，尤其是两个RNN组成的Seq2Seq结构，在时序预测、自然语言处理等方面有很大的用处，而每个RNN中一个节点是一个Cell，它是RNN中的基本结构。本文从如何使用RNN建模数据开始，重点解释RNN中Cell的结构，以及Keras中Cell相关的输入输出及其维度。我已经尽量解释了每个变量，但可能也有忽略，因此可能对RNN之前有一定了解的人会更友好，本文最主要的目的是描述Keras中RNNcell的参数以及输入输出的两个注意点。如有问题也欢迎指出，我会进行修改。

2020/07/12 21:25:13 阅读 3928

Keras/RNN/Seq2Seq/SimpleRNNCell/深度学习

Author Topic Model[ATM理解及公式推导]

2017-01-13 11:38:43 阅读 3933

Gibbs抽样/TopicModel

清华大学ChatGLM团队发布AI Agent能力评测工具AgentBench：GPT-4一骑绝尘，chatglm2表现优秀，baichuan-7b排名倒数！

所谓AI Agent就是一个以LLM为核心控制器的一个代理系统。业界开源的项目如AutoGPT、GPT-Engineer和BabyAGI等，都是类似的例子。然而，并不是所有的AI Agent都有很好的表现，其核心还是取决于LLM的水平。尽管LLM已经在许多NLP任务上取得进步，但它们作为代理完成实际任务的能力缺乏系统的评估。清华大学KEG与数据挖掘小组（就是发布ChatGLM模型）发布了一个最新大模型AI Agent能力评测数据集，对当前大模型作为AI Agent的能力做了综合测评，结果十分有趣。

2023/08/09 21:28:38 阅读 3956

AgentBench/AIAgent/LLM

Linux环境下使用NLPIR(ICTCLAS)中文分词详解

linux环境下使用中文分词工具

2017-01-02 20:54:51 阅读 3980

linux/NLPIR

pip、Anaconda更改国内源以及为当前用户安装

如何更改国内源，提升下载速度，以及只为当前用户安装指定包

2018/05/31 11:16:15 阅读 3985

pip

LangChain提升大模型基于外部知识检索的准确率的新思路：更改传统文档排序方法，用 LongContextReorder提升大模型回答准确性！

检索增强生成（Retrieval-augmented generation，RAG）是一种将外部知识检索与大型语言模型生成相结合的方法，通常用于问答系统。当前使用大模型基于外部知识检索结果进行问答是当前大模型与外部知识结合最典型的方式，也是检索增强生成最新的应用。然而，近期的研究表明，这种方式并不总是最佳选择，特别是当检索到的文档数量较多时，这种方式很容易出现回答不准确的情况。为此，LangChain最新推出了LongContextReorder，推出了一种新思路解决这个问题。

2023/09/17 22:46:44 阅读 3988

LangChain/LongContextReorder/RAG/外部数据/大模型知识检索/检索增强生成