ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

STATA空间杜宾模型实操:从空间权重矩阵构建到效应分解

STATA空间杜宾模型实操:从空间权重矩阵构建到效应分解 简介面向经济学、区域科学及社会科学领域需要开展空间计量分析的师生与研究人员这份命令文档系统梳理了利用STATA构建空间权重矩阵与估计空间杜宾模型的全流程操作。内容涵盖shp2dta读取地图数据并生成坐标数据集、spmap绘制空间分布图、spmat生成逆距离与邻接权重矩阵、行标准化处理以及Morans I指数计算并配有清晰命令注释便于直接套用与移植。文档还详细展示了如何将生成的权重矩阵保存为spmat和txt格式为后续空间杜宾模型等空间回归分析打下基础。资源包共1个docx文件大小43KB文本形式保存了完整命令与参数说明轻量易读无需复杂环境即可快速查阅。目前已有395人学习下载适合作为空间计量入门与进阶的速查手册可有效减少编写命令时的试错成本。 这几年空间计量在经管类、社科类论文里几乎成了标配空间权重矩阵加空间杜宾模型SDM是出现频率最高的一套组合。我自己帮学生处理数据、改论文遇到最多的问题就是权重矩阵不会构建、模型命令报错、跑完结果不会解读。这篇就把整套流程串起来讲清楚从空间权重矩阵的生成原理、STATA里的具体命令写法到空间杜宾模型的估计、检验、效应分解再到实际踩过的一些坑一次性整理出来。适合刚接触空间计量的研究生也适合照着教程跑通过一遍、但回头不知道每一步在干什么的同行。1. 空间计量研究框架与STATA使用策略1.1 为什么我推荐用STATA处理空间杜宾模型STATA的空间计量生态这些年已经非常成熟。横截面数据有早期的spatreg、spreg面板数据有xsmle这个几乎人手一个的外部命令矩阵处理有spmat和STATA 15之后内置的spmatrix。相比Matlab需要自己写极大似然函数R虽然语法灵活但学习成本偏高GeoDa图形化点击方便但只能做基础的空间回归——STATA的优势在于你可以在同一个环境里完成面板数据清理、权重矩阵构建、模型估计、偏偏效应分解全部流程命令可复现性也最强。这对需要反复调模型、换矩阵、做稳健性检验的科研场景来说省下的时间非常可观。1.2 从原始数据到论文结果的完整工作流我建议动手之前先把整个流程在心里过一遍。空间计量研究其实套路很固定大致可以分成七步准备数据包括核心变量面板数据、每个个体的坐标或邻接关系文件构建空间权重矩阵并做标准化用Morans I检验被解释变量的空间自相关性跑普通OLS做LM和Robust LM检验判断空间效应应该放在误差项还是滞后项用LR或Wald检验判断模型是否可以简化为SAR或SEM据此确定用SDM还是其他模型用xsmle估计模型并对结果做直接效应、间接效应分解更换权重矩阵类型做稳健性检验。这七步里第2步和第5步是新手最容易卡住的地方也是下面两节重点展开的内容。2. 空间权重矩阵模型的核心别在这步偷懒2.1 空间权重矩阵究竟是什么空间权重矩阵的本质是把区域之间如何互相影响这个抽象问题转化成一张具体的数值表。举个例子假设研究30个省份的碳排放如果不考虑空间性每个省的碳排放只由本省变量解释。但实际情况是邻近省份的产业结构、减排政策、技术溢出都会影响本省的碳排放。空间权重矩阵W就是用来刻画这种邻居效应的矩阵的每个元素wij代表第j个区域对第i个区域的影响强度。常见的权重矩阵类型用一张表来对比类型构建逻辑适用场景数据需求邻接权重Queen有公共边界或公共顶点视为邻居行政区划数据地图shapefile邻接权重Rook只有公共边界视为邻居行政区划数据地图shapefile逆距离权重wij1/dij地理距离越近影响越大有经纬度坐标坐标数据距离阈值权重距离小于阈值取1否则取0有坐标且存在影响半径坐标数据K近邻权重每个区域只取最近的K个邻居区域密度不均时坐标数据经济距离权重用GDP、贸易流等经济距离替代地理距离经济溢出研究经济指标邻接权重在区域经济研究里最常用但前提是能拿到准确的地图文件。如果只有经纬度坐标用逆距离权重或K近邻权重会更方便。经济距离权重适合研究贸易溢出、资本流动这类问题不过因为不是纯地理关系审稿时可能被追问构造依据需要提前想好怎么解释。2.2 STATA生成权重矩阵的实操命令STATA里构建空间权重矩阵核心就是两条路老一点的spmat命令以及STATA 15之后内置的spmatrix命令。两者功能基本对应但语法不同混用会报错所以建议不要在一套代码里来回切换两种命令。先说最省事的场景用经纬度坐标直接生成逆距离权重矩阵。* 假设数据里已经有long和lat两个变量id变量是省份代码 ssc install spmat * spmat的逆距离权重命令 spmat idistance W long lat, id(province)spmatrix的写法稍微不同* 使用spmatrix前先声明面板结构 xtset province year * 用坐标生成逆距离权重矩阵id()里写面板的横截面维度 spmatrix create idistance W, id(province)如果你的坐标数据缺失或者研究区域是不规则的行政区划最稳妥的办法是先把shapefile读进STATA再用邻接方式生成权重矩阵。读取shapefile常用shp2dta命令把地图的数据库和坐标分开存成dta文件然后合并到主数据里。这一步虽然有点绕但胜在可靠之后生成邻接矩阵时不会出现坐标对不上号的问题。如果权重矩阵已经在外部算好了不管是Excel、csv还是其他软件导出的格式直接导入更省事* csv格式的权重矩阵导入 import delimited using W.csv, clear * 用spmatrix导入csv里必须含id列且是数字格式 spmatrix import W using W.csv, id(province) * 如果是从GeoDa导出的gal文件 spmat import W from weights.gal, id(province)2.3 权重矩阵标准化与常见坑点权重矩阵生成后一般都要做行标准化。行标准化的意思是每一行所有元素之和等于1这样处理后WY的计算结果可以解释为邻居变量的加权平均值模型里的空间滞后项系数也更容易解读。STATA里标准化的命令不复杂spmatrix normalize W, normalize(row) spmat normalize W, row我在这一步踩过两次坑。第一次是生成矩阵后忘记标准化直接拿去跑xsmle结果估计参数不收敛检查之后发现权重矩阵的行和差异太大有的行是0.5有的行是8.7极大似然估计自然不会稳定。第二次是标准化之前没有保留原始矩阵后来想换一种标准化方式只能重新生成。所以我的建议是原始矩阵和标准化矩阵分开存命名上用W_raw和W区分做稳健性检验的时候能快速切换。还有一个容易被忽略的问题权重矩阵的对角元素必须为0。空间权重矩阵刻画的是别人对自己的影响自己不能是自己的邻居。如果构建过程有误矩阵对角元素不为0xsmle跑出来的空间自回归参数会异常偏大看起来显著得一塌糊涂实际上完全是错的。检查方法不复杂跑模型前先查看一下矩阵的对角线即可。3. 空间杜宾模型从原理到STATA命令落地3.1 SDM模型在讲什么空间杜宾模型Spatial Durbin Model的常见面板形式是Y_it ρ * ΣW_ij Y_jt X_itβ ΣW_ij X_jtθ μ_i λ_t ε_it这个公式看着吓人逐项拆开其实很直白。第一项ρΣWijYjt是空间滞后项意思是本省的Y会被邻居省的Y影响ρ就是这个溢出效应的强度。第三项ΣWijXjtθ是解释变量的空间滞后项它捕捉的是邻居省的解释变量对本地Y的影响这也是SDM和SAR模型的核心区别——SAR只考虑Y之间的互相依赖SDM还考虑了X的跨区域效应。最后μi和λt分别是个体固定效应和时间固定效应。顺着这个思路SDM的优势就出来了它同时包含Y的溢出和X的溢出不像SAR和SEM那样只刻画其中一种。实际研究里你不确定空间交互是通过被解释变量还是解释变量传导的直接用SDM是一个相对安全的起点。但这里要强调一句SDM不是万能药如果真实模型是空间误差相关贸然用SDM反而会得到有偏的估计所以模型选择检验是必须做的。3.2 模型选择检验先别急着跑SDM比较规范的流程是先用普通面板OLS然后做LM检验判断空间效应的形式。* 第一步跑普通OLS reg y x1 x2 * 第二步安装并运行空间诊断命令 ssc install spatdiag spatdiag, weights(W)spatdiag的输出里有两个关键指标空间滞后项的LM检验和空间误差项的LM检验同时各自带一个Robust版本。判断逻辑不复杂只有空间滞后的LM显著优先考虑SAR只有空间误差的LM显著优先考虑SEM两个都显著存在双重空间依赖SDM是合适的选择两个都不显著空间效应可能真的不显著或者权重矩阵构造有问题。如果LM结果显示空间效应确实存在而且你打算用SDM强烈建议再跑一下LR/Wald检验验证SDM能否简化为SAR或SEM。原假设分别是θ0SDM退化为SAR和θρβ0SDM退化为SEM。xsmle结果基础上可以用lrtest这样操作* 比较SDM与SAR、SDM与SEM xsmle y x1 x2, wmat(W) model(sdm) fe nolog est store m_sdm xsmle y x1 x2, wmat(W) model(sar) fe nolog est store m_sar lrtest m_sdm m_sar xsmle y x1 x2, wmat(W) model(sem) fe nolog est store m_sem lrtest m_sdm m_sem如果两个LR检验都拒绝原假设说明SDM相对SAR和SEM都有显著改进可以理直气壮用SDM。如果某一个不能拒绝选更简洁的那个模型就够了没必要为了显得自己会用SDM就硬上。3.3 xsmle命令实操与效应分解模型定了之后估计的部分基本交给xsmle。这个命令要先从SSC安装ssc install xsmle最基础的SDM固定效应写法xtset province year xsmle y x1 x2, wmat(W) model(sdm) fe type(both) nolog几个选项必须说明白。model(sdm)指定模型类型可选sar、sem、sdm、sac等wmat(W)指定权重矩阵注意这里用的是标准化后的矩阵fe是固定效应type(both)表示个体和时间双向固定效应如果只需要个体固定效应写成type(ind)就行。随机效应则用re选项。结果表里最先看的是rho即空间自回归系数衡量的是邻居Y的整体影响。如果rho显著为正说明存在正向的空间溢出效应。然后是各解释变量的系数β以及WX那部分的系数θ。这里特别提醒在SDM里解释变量对Y的总影响不能只看β因为邻居的X和Y都会反哺回来所以必须做效应分解。xsmle提供了现成的分解方式xsmle y x1 x2, wmat(W) model(sdm) fe type(both) nolog dydx加dydx之后的结果表会多出Direct、Indirect和Total三组。Direct是直接效应即本省X对本省Y的总影响它包含了空间反馈效应Indirect是间接效应也叫空间溢出效应即本省X通过空间交互对邻居省Y的影响Total是两者之和。论文里最经常报告的就是这几列尤其间接效应是否显著往往直接决定了能不能得出存在空间溢出的结论。4. 常见问题与排查思路4.1 权重矩阵报错matrix not found、维度对不上这是被问得最多的一类问题。常见报错信息是matrix W not found或W has wrong dimension。前者多半是权重矩阵不在当前数据环境中——比如换了另一个dta文件或者存了矩阵但没有读取后者则和面板的横截面个体数量不匹配有关。排查思路很简单先确认当前样本里的province数量再确认矩阵的行列数。我踩过一次很典型的坑原始数据里有31个省份清理缺失值后只剩29个但权重矩阵还是31×31跑xsmle直接报错。解决方法是先对数据进行完整清理用xtset确认后再重新生成或筛选权重矩阵别指望STATA能自动对齐。4.2 面板数据设定与缺失值处理xsmle对面板结构的要求很严格。使用之前务必先xtset横截面维度要和权重矩阵的id保持一致。如果你的数据是非平衡面板xsmle有时候会不兼容稳妥的做法是先决定是保留完整观测样本还是用插补方法把面板补平衡。另一种常见问题是核心变量有少数缺失值直接删除后模型报observation dropped结果权重矩阵对不上。我的习惯是生成一个analysis样本并同时生成对应的权重矩阵保证每次跑的样本是完全匹配的。如果数据是从Excel导入的还容易遇到中文变量名乱码可以在import excel时指定encoding(UTF-8)或先转换为dta格式再读入能省掉不少麻烦。4.3 固定效应与随机效应的选择细节面板SDM的固定效应设置我见过最多的误操作是把fe和re都跑一遍哪个结果好看就报哪个这样审稿人一眼就能看出问题。规范做法是先用Hausman检验判断。STATA里xtreg加上hausman可以处理无空间项的基准模型有空间项的模型一般会参考同类检验或者同时报告SAR、SDM的FE和RE结果。xsmle的re估计在小样本下表现不太稳定个人经验是样本量不够大的时候优先用双向固定效应但也要配合LM检验的结果一起汇报这样经得起追问。4.4 权重矩阵的保存与复用研究过程中要跑很多轮每次都重新生成权重矩阵既浪费时间也容易出错。spmat和spmatrix都支持保存和读取。spmatrix用spmatrix export把矩阵导出到文件下次用spmatrix import读回来spmat可以用spmat save和spmat use。我的习惯是把所有权重矩阵和对应说明统一放在一个weights文件夹里命名类似W_queen_binary.dta、W_queen_row.dta、W_dist_binary.dta跑模型时按需读取。这样整个研究过程的矩阵来源清晰写methodology部分时也不用翻聊天记录。最后分享一点个人体会空间计量最容易出问题的往往不是模型选择而是数据环节。权重矩阵和样本不匹配、边界坐标有误、标准化方式混乱这些问题一旦出现后期结果解读就全部失真。所以我建议宁可在准备阶段多花两天把矩阵和样本的对应关系理得清清楚楚也不要急着跑回归跑出一堆漂亮数字最后发现是错误矩阵的产物那才是真正的浪费功夫。本文还有配套的精品资源点击获取
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表