01、数据说明与构建方法
本数据集以全国地级市历年《政府工作报告》为文本语料,通过构造数字化政府主题词表对上述文本做系统性词频统计,进而测度各地政府对数字化建设的注意力配置强度。核心思路是:先以定制词表遍历每份报告,累加得到该城市—年份层面的关键词出现频次;再引入TF‑IDF加权框架对词频做规范化处理——其中逆文档频率(IDF)维度进一步嵌入时间因子,使同一词汇在不同年份的”区分度”随其在全国城市语料中的扩散程度动态衰减,从而避免后期高频泛化词(如”数字””平台”类)被机械高估。此处理方式与刘文革等(2024)在”数字化政府建设”量化策略上的操作逻辑一致。在此文本维度之外,数据集进一步纳入财政资源配置信息,以地级市一般预算支出 / 全国财政支出的比值作为政府施政能力的缩放锚,经标准化合成后得到最终面板指标——数字化政府建设指数(2007–2024,地级市层面,非平衡面板)。财政比率的引入思路可溯源至杨海生等(2020)对企业/地方政府行为研究中以支出份额刻画相对规模的惯用做法。
02、字段结构
每条观测所含变量:年份|省份|城市|地级市财政支出|国家财政支出|比率|关键词词频|报告总词频|TF‑IDF|数字化政府建设指数
![图片[1]经管皮皮侠数据网-www.jgppx.top2007-2024年 地级市数字化政府建设指数 xlsx](https://www.jgppx.top/wp-content/uploads/2026/06/image-44-1024x622.png)
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END












