Original Blog

Original AI Tech Blogs

Explore the latest AI and LLM news and technical articles, covering original content and practical cases in machine learning, deep learning, and natural language processing.

Sort by

Sort by Date Sort by Views

text-davinci-003后继者！OpenAI发布了一个新的补全大模型：GPT-3.5-Turbo-Instruct，完全的指令模型，没有聊天优化

OpenAI最新发布了GPT-3.5-Turbo-Instruct，这是一款强大的指令遵循大模型。尽管官方没有发布官方博客介绍，但我们将在本文中详细探讨这一模型的特点以及其在人工智能领域的价值。

2023/09/19 10:09:303,899

#GPT-3.5-Turbo-Instruct #指令大模型

tokens危机到来该怎么办？新加坡国立大学最新研究：为什么当前的大语言模型的训练都只有1次epoch？多次epochs的大模型训练是否有必要？

epoch是一个重要的深度学习概念，它指的是模型训练过程中完成的一次全体训练样本的全部训练迭代。然而，在LLM时代，很多模型的epoch只有1次或者几次。这似乎与我们之前理解的模型训练充分有不一致。那么，为什么这些大语言模型的epoch次数都很少。如果我们自己训练大语言模型，那么epoch次数设置为1是否足够，我们是否需要更多的训练？

2023/05/31 00:33:363,901

#tokens #大语言模型

分类和Logistic回归

监督学习中的分类问题和Logistic回归常常被用于推荐问题中关于BPR的研究，但是为什么一定要用Logistic函数来建模和优化呢？本篇博客将带你揭晓奥秘~

2017/03/06 20:58:313,912

#BPR #Logistic回归

什么是推理大模型？DeepSeek R1推理大模型与DeepSeek V3模型的区别是什么？什么时候该使用推理大模型？

最近，随着DeepSeek R1的火爆，推理大模型也进入大众的视野。但是，相比较此前的GPT-4o，推理大模型的区别是什么？它适合什么样的任务？推理大模型是如何训练出来的？很多人并不了解。本文将详细解释推理大模型的核心内容。

2025/02/08 18:05:033,912

#DeepSeekR1 #OpenAIo1

Dask的Merge操作性能对比

在前面的博客中，我们已经对`Dask`做了一点简单的介绍了，在这篇博客中我们来对比一下`Dask`的`DataFrame`在不同条件下的运算性能，主要是连接操作的性能（merge)。

2020/05/24 18:32:523,929

#dask #python

元宇宙企业Roblox究竟是一家什么样的企业

美国有一家上市企业，叫做Roblox，号称是元宇宙龙头企业，被市场炒的火热。这家企业到底是什么样的业务，可以被认为是一家纯正的元宇宙企业。本文根据我收集的资料，为大家介绍一下。

2021/11/19 23:05:243,941

#元宇宙 #初创企业

基于Emebdding的检索增强生成效果不同模型对比：重排序十分有利于检索增强生成的效果

基于Embedding模型的大语言模型检索增强生成（Retrieval Augmented Generation，RAG）可以让大语言模型获取最新的或者私有的数据来回答用户的问题，具有很好的前景。但是，检索的覆盖范围、准确性和排序结果对大模型的生成结果有很大的影响。Llamaindex最近对比了主流的`embedding`模型和`reranker`在检索增强生成领域的效果，十分值得关注参考。

2023/11/08 20:10:293,955

#RAG #reranker

机器学习（人工智能）在工业中应用步骤入门

机器学习是实现人工智能最重要的方法之一，包括深度学习等都属于机器学习中的一种方法。因此，机器学习的应用被认为是实现人工智能应用的重要途径。人工智能的应用目标是使用计算机（机器）来代替或者辅助人工来完成某项任务。机器学习在解决业务问题的应用需要谨慎考虑。本文提供一些步骤可以参考。

2018/11/20 11:37:043,976

#人工智能 #机器学习

使用Spring Security进行登录验证

Spring Security可以帮助我们进行页面的权限控制和登录验证，在这篇博客中，我们将简要描述如何使用Spring Security进行登录验证。

2017/11/08 11:15:534,002

#SpringMVC #SpringSecurity

深度学习方法：受限玻尔兹曼机RBM【转载】

受限玻尔兹曼机（Restricted Boltzmann Machine，RBM）是G.Hinton教授的一宝。Hinton教授是深度学习的开山鼻祖，也正是他在2006年的关于深度信念网络DBN的工作，以及逐层预训练的训练方法，开启了深度学习的序章。其中，DBN中在层间的预训练就采用了RBM算法模型。RBM是一种无向图模型，也是一种神经网络模型。

2017/04/10 20:38:004,028

#RBM #受限玻尔兹曼机

[翻译]当推荐系统遇上深度学习

翻译自Wann-Jiun Ma的Deep Learning Meets Recommendation Systems，主要讲了推荐系统的基础算法以及使用深度学习对电影的海报进行近似计算，从而推荐相似的电影。

2017/05/10 16:38:414,032

#推荐系统 #深度学习

Scikit-Learn最新更新简介

Scikit-Learn有很优秀的机器学习处理思想，包括TensorFlow等新框架都借鉴了它的设计思想。最近的更新也让Scikit-Learn更加强大。在描述这个更新之前我们先简单看一下历史，然后让我们一起看看都有什么新内容吧。

2020/02/12 22:33:364,043

#sk-learn #人工智能

pandas.DataFrame.to_csv和dask.dataframe.to_csv在windows下保存csv文件出现多个换行结果

使用pandas的DataFrame和dask的DataFrame保存数据到csv文件时候会出现两个换行符的情况。本文描述如何解决。

2020/05/08 17:20:044,044

#dask #pandas

解决大语言模型的长输入限制：MetaAI发布MegaByte最高支持几百万上下文输入！

尽管OpenAI的ChatGPT很火爆，但是这类大语言模型有一个非常严重的问题就是对输入的内容长度有着很大的限制。例如，ChatGPT-3.5的输入限制是4096个tokens。MetaAI在前几天提交了一个论文，提出了MegaByte方法，几乎可以让模型接受任意长度的限制！

2023/10/09 22:43:094,060

#long-context #MegaByte

编程语言（Programming Language）、汇编语言（Assembly Language, ASM）、机器语言（Machine Language/Code）的区别和简介

在编程的世界中，有不同层次的语言（language），这些语言有时候也称代码（code）。本文将简单介绍编程语言（Programming Language）、汇编语言（Assembly Language, ASM）、机器语言（Machine Language/Code）的区别。

2021/09/23 17:29:504,061

#汇编语言 #编程

科研词助

科研小助手，帮助认识科研中常见缩写词和混淆词等，来自《机器学习导论》的专业词汇

2017/06/11 17:23:224,069

#科研软文化

时间序列数据处理中的相关数学概念

时间序列数据分析的基础包含大量的统计知识。这篇博客主要用通俗的语言描述时间序列数据中涉及到的一些基本统计知识。

2019/07/09 14:50:204,088

#时间序列数据 #统计

100天搞定机器学习（100-Days-Of-ML）（一）数据预处理

2019/07/06 20:46:504,094

#机器学习

Eclipse使用Maven插件的简单介绍

使用Maven作为构建工具，管理项目和依赖非常方便。这篇博客将简要介绍在Eclipse中如何使用Maven插件

2017/11/08 15:25:094,114

#maven #构建工具

Author Topic Model[ATM理解及公式推导]

2017-01-13 11:38:434,119

#Gibbs抽样 #TopicModel

2022年全球最大的10家数据处理相关的创业公司

最近几年，数据的重要性在各个领域都获得了巨大的重视。因此，数据管理相关的业务也成为各项基础设施中增长最快的业务，目前的市场规模约700亿美元，占所有企业的基础设施支持约1/5。仅在2021年，数据处理相关的公司获得了数百亿的风险投资。为此，Future总结了2022年全球最大的50家数据创业企业。这里我们列举其中的最大的10个进行介绍。

2022/03/26 00:18:524,142

#人工智能 #企业简介

7种回归技术

2018/09/22 17:33:074,151

#回归算法 #机器学习

大模型领域的GGML是什么？GGML格式的大模型文件与原有文件有什么不同？它是谁提出的？如何使用？

GGML是在大模型领域常见的一种文件格式。HuggingFace上著名的开发者Tom Jobbins经常发布带有GGML名称字样的大模型。通常是模型名+GGML后缀，那么这个名字的模型是什么？GGML格式的文件名的大模型是什么样的大模型格式？如何使用？本文将简单介绍。

2024/01/20 10:48:014,160

#GGML #大模型加速

阿里巴巴开源国内最大参数规模大语言模型——高达720亿参数规模的Qwen-72B发布！还有一个可以在手机上运行的18亿参数的Qwen-1.8B

Qwen系列是阿里巴巴开源的一系列大语言模型。在此前的开源中，阿里巴巴共开源了3个系列的大模型，分别是70亿参数规模和140亿参数规模的Qwen-7B和Qwen-14B，还有一个是多模态大模型Qwen-VL。而此次阿里巴巴开源了720亿参数规模的Qwen-72b，是目前国内最大参数规模的开源大语言模型，应该也是全球范围内首次有和Llama2-70b同等规模的大语言模型开源。

2023/12/01 08:37:444,163

#Qwen-72B #Qwen大模型