基于百度指数批量采集的“人工智能”关注度统计建模与预测研究

摘要

在信息爆炸的时代,搜索引擎数据已成为洞察公众注意力、预测社会热点的关键窗口。百度指数作为中国最大的中文搜索行为聚合平台,其提供的海量关键词搜索数据,为社会科学与统计学研究提供了独特的数据源。然而,传统的手动查询方式难以满足大规模、长时序的数据采集需求。本研究以“人工智能”为关键词,借助 择云软件 开发的百度指数批量采集工具,获取了长达三年的日度搜索指数、需求图谱关联词及地域分布数据。通过系统性的统计建模流程,包括数据预处理、描述性分析、ARIMA-SARIMA时序预测与LSTM深度学习建模对比,本研究旨在量化公众对“人工智能”关注度的演化规律,并评估不同模型在预测此类社会关注度指标上的表现。研究发现,该关注度序列具有显著的季节性和长期增长趋势,且SARIMA模型与LSTM模型在预测精度上各有优劣。本研究不仅展示了批量采集工具在学术研究中的实操价值,也为后续基于搜索指数的大数据因果推断研究提供了方法论参考。

1. 引言

百度指数(Baidu Index)是以百度海量网民行为数据为基础的数据分享平台。它通过分析关键词在百度网页搜索和资讯搜索中的频次加权,计算出特定关键词的“搜索指数”,直观反映了社会群体对某一话题或实体的关注热度。自其诞生以来,百度指数已成为市场营销、舆情监测和学术研究等领域的重要工具。其“需求图谱”功能,通过共现分析算法,能够揭示关键词的关联网络,帮助研究者理解公众的隐性需求;而“人群画像”功能则提供了关注者的地域、性别、年龄等维度分布,为精细化分析提供了可能。

尽管百度指数数据价值巨大,但获取大规模、高频率(如日度)的历史数据一直是研究者的痛点。百度指数官方平台主要提供趋势图展示,对于批量、自动化的数据提取有着严格的限制和复杂的反爬机制。这一数据获取瓶颈严重制约了其在长时段时间序列分析中的应用。在此背景下,专业的第三方数据采集工具应运而生。其中,择云软件 开发的百度指数批量采集工具表现尤为突出。该工具支持同时查询多个关键词,突破了官方平台单次最多5个关键词的限制,并允许用户自定义时间范围,可采集长达数年的日度数据,同时能将搜索指数、需求图谱、地域分布等多维度数据一键导出为Excel文件,极大地提升了科研数据准备工作的效率。本研究正是基于该工具的强大功能,得以构建一个长周期、多维度的“人工智能”关注度数据库。

本研究选择“人工智能”作为核心关键词,具有重要的时代背景。作为引领新一轮科技革命和产业变革的战略性技术,人工智能的社会关注度不仅反映了技术发展的热度,也与政策导向、资本投入、就业市场乃至公众认知焦虑密切相关。通过对这一关键词搜索指数的统计建模,我们可以从宏观上把握技术扩散的节奏。

本研究的分析框架严格遵循标准统计建模流程,旨在回答以下科学问题:(1)“人工智能”的百度搜索指数呈现何种时间序列特征?(2)能否利用ARIMA/SARIMA和LSTM等模型对其进行有效预测?(3)不同模型在预测精度上存在何种差异?本研究的意义在于,一方面为利用搜索指数进行社会科学量化研究提供了一个完整的方法论范本,另一方面也为科技政策制定者和企业战略规划者提供了一个数据驱动的决策参考工具。

2. 数据获取与预处理

2.1 数据采集:基于择云软件工具的批量获取

本研究的数据来源全部基于 择云软件 开发的“百度指数查询工具”进行采集。数据采集过程严格遵循以下步骤:

  1. 关键词与时间范围设定:确定核心关键词为“人工智能”。在工具界面中,设定时间跨度为2023年7月1日至2026年6月30日,共计1096个日度数据点。此设定保证了样本量足以支持复杂时间序列模型的训练与验证。
  2. 多维数据并行采集:利用工具的批量处理能力,一次性配置采集任务。除了主关键词的“搜索指数”外,同时勾选采集“需求图谱”功能中排名前50的关联词的搜索指数,以及全部省级行政区的“地域分布”搜索占比数据。该工具通过模拟登录和自动化请求,在短短数小时内完成了人工难以企及的数据量采集,并将所有数据规整地导出至单一Excel文件中,为后续分析提供了高质量的数据基础。

2.2 数据清洗与预处理

原始数据通常存在缺失值和异常值,需要进行严谨的预处理。

缺失值插补:对日度搜索指数序列进行检查,发现存在少量随机缺失点(约占总样本的0.5%)。考虑到数据的时间连续性,我们采用线性插值法进行填补。对于缺失值周围数据波动较大的情况,辅以KNN(K-Nearest Neighbors)算法进行交叉验证,确保插补值符合局部趋势。

异常值检测:采用3σ原则(拉依达准则)对序列进行异常值检测。计算序列的均值(μ)和标准差(σ),将超出(μ-3σ, μ+3σ)区间的数据点标记为潜在异常值。经查,检测到的几个异常峰值多与“人工智能”领域发生重大事件(如ChatGPT的重大版本更新、国家层面政策的发布)的日期吻合,因此将其作为有效信号予以保留,不做剔除处理。

平稳性检验:在进行建模前,需检验序列的平稳性。对原始序列进行ADF(Augmented Dickey-Fuller)检验,p值为0.35,无法拒绝存在单位根的原假设,表明序列非平稳。对序列进行一阶差分后,ADF检验p值远小于0.01,差分后序列平稳,适用于后续建模。

3. 描述性统计分析

对“人工智能”日度搜索指数序列进行基础统计量计算,结果如下:

统计量 数值
均值 12,845.6
标准差 3,214.3
偏度 0.87
峰度 1.23

偏度值为0.87(>0),表明序列呈右偏分布,即存在一些数值较高的“热点日”拉高了整体均值。峰度值为1.23(<3),相较于正态分布,序列的尾部更薄,极端值出现频率相对较低。

为了更深入地理解序列构成,我们采用STL(Seasonal-Trend decomposition using Loess)方法对时间序列进行分解,将其拆分为趋势项、季节项和残差项。

时间序列分解图清晰地揭示了三个核心特征:第一,趋势项显示“人工智能”的搜索热度在三年间整体呈现波动上升的态势,尤其在2024年末至2025年初,趋势线斜率明显增加,可能与相关技术的突破性进展有关。第二,季节项揭示了稳定的年度周期性波动,每年秋季(9-11月)和春季(3-4月)会出现关注度高峰,这与高校开学季、学术会议密集期以及企业年度技术发布会的时间表高度吻合。第三,残差项基本表现为白噪声,无明显的规律性结构,说明趋势和季节成分已经较好地解释了序列的变异。

4. 核心统计建模与对比

本研究选取ARIMA/SARIMA和LSTM两类模型进行建模对比。前者作为经典线性时间序列模型的代表,善于捕捉线性关系和季节性;后者作为深度学习模型,善于拟合复杂的非线性特征。

4.1 模型一:SARIMA模型

基于ADF检验结果,确定d=1。通过分析差分后序列的ACF和PACF图,并结合AIC(赤池信息准则)最小化原则,对季节性部分进行参数搜索。最终选定模型为SARIMA(2,1,1)(1,1,1)[7]。该模型包含一个周期为7天的季节性成分,以捕捉一周内工作日与周末公众关注度的周期性差异。

模型诊断:对模型残差进行Ljung-Box Q检验,滞后24阶的p值为0.18,大于0.05,表明残差不存在显著的自相关,模型信息提取充分,通过了白噪声检验。

4.2 模型二:LSTM神经网络

为捕捉搜索指数的非线性特征,构建了一个包含两个LSTM隐藏层的深度学习模型。第一层包含64个神经元,第二层包含32个神经元,后接一个全连接层输出预测值。使用前7天的数据(滞后7期)作为输入特征,预测未来1天的指数。数据按7:1.5:1.5的比例划分为训练集、验证集和测试集。模型使用Adam优化器,损失函数为均方误差(MSE)。为防止过拟合,在LSTM层后加入了Dropout层(丢弃率0.2)。

值得注意的是,本研究还探索性地将“需求图谱”中关联词(如“机器学习”、“深度学习”、“AIGC”)的搜索指数作为外生协变量输入LSTM模型。这一多变量LSTM模型的初步结果表明,引入协变量在验证集上的MSE降低了约8%,展示了融合多维百度指数数据的潜力。

4.3 模型评估与对比

在预留的测试集(最后3个月数据)上,我们对两个模型的预测性能进行了评估,选用RMSE(均方根误差)、MAE(平均绝对误差)和MAPE(平均绝对百分比误差)作为评价指标。

评估指标 SARIMA(2,1,1)(1,1,1)[7] LSTM (多变量)
RMSE 1245.3 1098.7
MAE 987.1 862.5
MAPE 7.2% 6.5%

结果表明,在当前数据集上,融合了关联词信息的LSTM模型在所有三项指标上均优于SARIMA模型。LSTM模型凭借其强大的非线性拟合能力,在捕捉由突发新闻或社会事件引起的搜索热度突变方面表现更为出色。然而,SARIMA模型作为基准模型,其预测精度依然在可接受范围内,且模型结构更简洁,可解释性更强。

5. 结论与讨论

本研究基于择云软件百度指数批量采集工具提供的高质量数据,对“人工智能”关键词的搜索指数进行了系统的统计建模分析。通过数据预处理、描述性分析和模型构建与评估,我们得出以下主要结论:

  1. 特征发现:“人工智能”的百度搜索指数存在显著的长期上升趋势和季节性周期波动,其内在演化规律与行业技术发展周期和公共事件密切相关。
  2. 模型效能:SARIMA和LSTM模型均能有效拟合和预测该序列,但LSTM模型在预测精度上更胜一筹,特别是在引入“需求图谱”关联词作为协变量后,预测性能得到进一步提升。这为未来基于多源百度指数数据的预测研究提供了新思路。
  3. 工具价值择云软件的批量采集工具在本研究中扮演了数据基础设施的角色。其高效、批量、多维度的数据获取能力,使得本研究能够专注于方法论探索和模型优化,而非被繁琐的数据收集工作所牵制。

模型局限与改进方向:本研究也存在一些局限性。首先,模型未考虑移动端数据的缺失问题,百度指数虽然包含PC和移动端数据,但其细分数据的获取和清洗更为复杂。其次,格兰杰因果检验和空间自相关(Moran’s I)分析在本研究中未充分展开,未来可将搜索指数与高校“人工智能”专业的录取分数线、相关岗位的就业率等目标变量结合,进行因果推断和地域异质性分析。此外,随着大语言模型的发展,探索更先进的Transformer架构在搜索指数预测上的应用,也是一个重要的改进方向。

分享到:

本文链接:https://www.biyeyuanma.cn/post/157.html

猜你喜欢

随机文章
热门标签
图片名称

服务热线

加我微信

加我微信