做综合评价之前,先弄清楚这五个基本问题
做综合评价之前,先弄清楚这五个基本问题
在管理学、经济学、公共管理和工业工程等领域,我们经常需要评价一个无法由单一指标完整描述的对象。例如:
- 哪个地区的高质量发展水平更高?
- 哪家企业的数字化转型能力更强?
- 哪个城市的公共服务水平更好?
- 哪个供应商的综合表现更优?
- 哪项政策方案更值得采用?
- 一个组织的韧性、创新能力或治理水平处于什么状态?
面对这些问题,研究者通常会收集多个指标,然后进行数据处理、指标赋权和综合计算,最终得到一个综合得分、排名或者等级。这类研究通常可以称为多指标或多属性综合评价研究。
初学者很容易把综合评价理解成一套计算流程:找到数据,选择一种赋权方法,再选择一种评价模型,最后计算得分。事实上,综合评价首先是一项关于“评价什么、根据什么评价、由谁评价”的研究活动,其次才是一项数学计算活动。具体方法可以帮助我们执行评价规则,却不能代替我们定义评价对象、评价标准和结果含义。
郭亚军在《综合评价理论、方法及应用》第1章中,将一个综合评价问题归纳为五个基本要素:
- 被评价对象;
- 评价指标;
- 权重系数;
- 集结模型;
- 评价者。
这五个要素构成了理解评价类论文最基础的框架。它们告诉我们,综合评价并不是数据输入模型之后自动产生结论,而是评价者围绕一定目的,对一组对象选择评价指标、确定指标权重,并通过某种集结规则,为每个对象形成综合评价结果的过程。
换句话说,任何综合评价结论,都隐含着以下问题:
评价谁?评价什么?各项标准有多重要?如何把每个对象的多项指标集结为该对象的评价结果?谁在决定这些规则?
如果这些问题没有得到清楚回答,那么即使计算公式完全正确,评价结论仍然可能缺乏可信度和管理意义。下面先说明综合评价是什么、在什么情况下需要综合评价,再依次讨论这五个要素及其在完整评价流程中的位置。
一、综合评价究竟是什么
我们可以先给出一个相对通俗的定义:
综合评价是根据特定评价目的,利用多个指标描述评价对象的不同属性,再通过一定的权重和集结规则,将每个对象的多维指标信息转换为相应的综合得分、评价等级或类别,并在需要时对多个对象进行比较和排序的过程。
这里首先需要澄清“综合”的含义:综合的是同一个对象的多项指标信息,不是把多个评价对象合并成一个整体。以一组地区为例,评价模型通常为每个地区分别计算一个评价结果,再对这些地区进行排序或分类。
本文主要讨论郭亚军所概括的多属性综合评价经典过程。在这一经典框架中,通常存在多个同类对象,并根据每个对象的综合评价值进行比较。模糊综合评价等方法也属于综合评价,但可以围绕一个对象判断其对不同评价等级的隶属程度,结果形式与排序型评价并不完全相同。
这个定义中有几个关键词。
第一个关键词是“特定目的”。评价不是脱离目的的客观观察。评价企业经营绩效、企业创新能力和企业社会责任,虽然对象都是企业,但评价目的不同,指标体系和评价方法也会不同。
第二个关键词是“多个指标”。如果一个问题能够由单个指标充分判断,就没有必要构建复杂的综合评价体系。例如,单纯比较企业营业收入,直接比较营业收入即可。只有当研究对象具有多个不能被单一指标替代的属性时,才有必要进行综合评价。
第三个关键词是“转换”。原始指标通常具有不同单位、方向和含义,不能直接比较。评价模型的作用,是按照一套明确的规则,把这些多维信息转换成一种更容易判断的结果。
第四个关键词是“综合结果”。每个对象的综合结果可以是一个分数,但并不一定必须是分数,也可以表现为等级、类型、相对效率或对不同等级的隶属程度。当存在多个对象时,还可以进一步形成排名或优劣关系。
因此,综合评价的核心不只是“算分”,而是建立一套从对象的多维指标信息到该对象综合评价结果的转换规则。
二、什么情况下需要综合评价
并不是所有涉及多个变量的研究都属于综合评价,也不是所有管理问题都应该构建一个综合指数。
综合评价通常适用于以下情形:
- 研究对象具有多个重要属性,单一指标不足以反映其整体状态;
- 研究需要在若干同类对象之间进行比较;
- 不同指标之间存在一定程度的权衡;
- 研究需要将复杂信息压缩成较容易理解的结论;
- 评价结果具有明确用途,例如识别差距、分配资源、选择方案或监测发展状态。
对于本文讨论的经典比较型评价,可以先检查两个前提:被评价对象是否具有可比性,以及研究问题是否确实需要把每个对象的多项指标集结成综合结果。
1. 被评价对象应当具有可比性
郭亚军在讨论被评价对象时指出,同一类被评价对象通常应当多于一个,否则便缺少判断或比较的必要。其基本思想是:综合评价通常面对的是一组同类对象,而不是毫无联系的事物。
例如,可以比较:
- 不同地区的营商环境;
- 同一行业中不同企业的创新能力;
- 同一企业不同年份的经营状态;
- 满足相同需求的若干投资方案。
但如果把一家制造企业、一所高校和一个城市放在一起评价“综合实力”,即使能够收集若干共同指标,这种比较也很难具有明确意义。因为这些对象的功能、目标和运行规律并不相同。
所以,评价之前首先要回答:
这些对象为什么可以放在一起比较?
可比性可能来自:
- 对象属于同一类型;
- 对象承担相近功能;
- 对象面对相似环境;
- 对象具有相同或相近的管理目标;
- 对象可以采用相同的评价标准。
如果这一问题没有回答,后面的权重和模型选择便失去了稳定基础。
2. 研究问题确实需要形成综合评价结果
有些论文构建综合指数,只是因为“指标比较多”,但多个指标并不必然需要合成为一个总分。
例如,企业盈利能力、员工满意度和碳排放强度可能都值得分析。但是否应该把它们合成一个“综合经营质量得分”,取决于研究目的和理论依据。指标可以同时出现,不代表它们天然属于同一个评价概念。
综合指数具有信息压缩的优势,也会损失信息。一个对象的总分越简洁,越可能掩盖该对象在不同指标或维度上的结构差异。因此,只有当形成对象层面的综合结果确实具有研究或管理价值时,才有必要将多个指标进行聚合。
三、综合评价由哪五个基本要素构成
明确了综合评价的适用场景,接下来就要回答评价系统如何构成。郭亚军归纳的五个基本要素并不是五个彼此孤立的名词:评价者根据评价目的选择被评价对象和评价指标,确定权重与集结模型,最终为每个对象形成评价结果。下面分别说明每个要素解决什么问题。
(一)被评价对象:评价结论是关于谁的
被评价对象是评价活动最终要判断、排序或者分类的对象。在数学表达中,可以将一组被评价对象记作:
$$ S={s_1,s_2,\ldots,s_n},\qquad n>1 $$
其中,$s_i$ 表示第 $i$ 个被评价对象。
评价对象看似简单,实际上至少需要界定四个边界。
1. 对象边界
研究评价的是企业整体、某个业务部门,还是某个项目?评价的是城市政府的治理能力,还是城市整体的发展水平?
对象边界不同,指标责任主体也不同。例如,居民收入可能是地区发展水平的合理指标,但未必适合直接作为地方政府治理绩效指标,因为居民收入还受到产业结构、市场环境和历史条件等多种因素影响。
2. 时间边界
研究评价的是某一时点的状态、一个时期的平均表现,还是连续多年的变化趋势?
同一企业在不同年份可以被视为多个“企业—年份”评价单元,但这时评价结果既包含对象差异,也包含时间变化,需要额外考虑跨期可比性。
3. 空间或行业边界
不同地区的发展阶段、资源条件和制度环境可能存在显著差异;不同行业企业的资本结构和技术特征也不相同。是否应该使用同一套标准,需要理论说明。
4. 比较边界
评价结果通常是相对于某个参照系而言的。一个地区在全国范围内可能处于中游,在同类资源型地区中却可能表现较好。样本范围发生变化,评价结果和排名也可能随之改变。
因此,论文不能只写“选取30个地区作为评价对象”,还应说明:
- 为什么选择这些地区;
- 它们是否属于同一比较范围;
- 研究时期为何这样设置;
- 样本选择是否可能影响评价结论。
(二)评价指标:根据哪些方面进行判断
郭亚军将评价对象的运行或发展状态表示为由多个分量构成的状态向量。每个分量从一个侧面刻画评价对象的某种特征,这些分量共同构成评价指标体系。
如果一项评价包含 $m$ 个指标,可以将第 $i$ 个对象的指标状态表示为:
$$ \boldsymbol{x}i=(x{i1},x_{i2},\ldots,x_{im})^{\mathsf T} $$
其中,$x_{ij}$ 表示第 $i$ 个评价对象在第 $j$ 个指标上的取值。
这段数学表达背后的管理含义是:
评价对象的总体状态无法直接观察,因此需要通过多个侧面加以描述。
例如,“企业创新能力”不能直接从现实中读取一个数值,只能通过研发投入、研发人员、专利质量、新产品收入、技术转化能力等指标近似反映。
但这里必须注意:
指标是评价概念的观察窗口,不是评价概念本身。
专利数量可以反映企业创新产出的一部分,却不能等同于完整的创新能力;研发投入可以反映创新资源投入,却不能自动证明企业具备较强的创新效率。
指标体系的五项基本要求
郭亚军将评价指标体系的一般原则概括为:
- 系统性;
- 科学性;
- 可比性;
- 可测取或可观测性;
- 尽可能相互独立。
这些原则可以进一步解释如下。
系统性:是否覆盖了概念的主要方面
指标体系不能只选取容易获得的数据,而遗漏评价对象的重要维度。
例如,评价公共服务水平,如果只使用财政投入指标,而缺少服务可及性、服务质量和居民获得感,那么评价结果主要反映“投入多少”,而不是公共服务的总体水平。
系统性并不意味着指标越多越好。指标过多可能带来重复计算、信息噪声和解释困难。真正的系统性,是用有限指标覆盖概念的主要结构。
科学性:指标与概念之间是否存在合理联系
每个指标都应该有理论依据、经验依据或清晰的管理逻辑。
论文需要解释的不是“这个指标在其他文献中使用过”,而是:
- 它反映评价概念的哪个方面;
- 为什么能够反映这个方面;
- 它有哪些可能的测量偏差;
- 在当前研究情境下是否仍然适用。
文献使用频率可以作为参考,却不能替代理论论证。
可比性:不同对象的指标值能否公平比较
相同名称的指标不一定具有相同口径。例如,不同地区对某类财政支出的统计范围可能不同;不同企业的研发投入披露标准也可能存在差异。
此外,绝对规模指标容易受到对象规模影响。大型企业的专利数量通常高于小型企业,但这不必然意味着大型企业的创新效率更高。因此,可能需要使用人均值、占比、密度或强度指标。
可测取性:指标能否获得可信数据
一个概念在理论上很重要,不等于能够被可靠测量。
如果某项指标依赖高度主观的估计,或者不同对象采用完全不同的数据口径,那么把它纳入评价体系可能增加表面完整性,却降低实际可信度。
研究者需要在理论完整性与数据可获得性之间进行权衡,并诚实说明代理指标的局限。
尽可能相互独立:避免信息被重复计算
如果多个指标反映几乎相同的信息,它们可能使某个维度在综合评价中被重复强调。
但“相互独立”不能被机械理解为指标之间不能相关。同一理论维度下的指标出现一定相关性是正常的。是否删除指标,需要同时考虑统计关系和理论含义,而不能仅根据相关系数作决定。
(三)权重系数:各项指标应当受到多大重视
在多指标评价中,不同指标对评价目的的相对重要性可能不同。可以用权重系数表示这种相对重要程度:
$$ w_j\geq 0,\qquad \sum_{j=1}^{m}w_j=1 $$
其中,$w_j$ 表示第 $j$ 个指标的权重。
郭亚军特别强调,当被评价对象及其指标值已经给定时,综合评价结果将依赖于权重系数,因此权重确定是否合理会影响结果的可信程度。
不过,“权重表示指标的相对重要性”这句话还需要进一步追问:
这里所说的重要性,究竟是哪一种重要性?
现实研究中,至少存在三种不同含义。
1. 价值判断上的重要性
评价者根据管理目标、政策需要或专业经验,认为某项指标应当受到更多重视。例如,在安全评价中,决策者可能认为重大事故风险具有不可替代的重要性。
专家评分、德尔菲法和层次分析法等方法,通常更接近这种价值判断。
2. 数据区分上的重要性
如果某个指标在当前样本中的差异较大,它能够更明显地区分评价对象。一些数据驱动的赋权方法主要利用这种统计特征。
但“更能区分样本”不等于“管理上更加重要”。某个核心指标可能因为所有对象都表现相近而获得较低的数据驱动权重;某个次要指标也可能因为样本差异很大而获得较高权重。
3. 对最终结果的实际影响
即使两个指标拥有相同权重,由于其方差、分布和与其他指标的相关关系不同,它们对综合得分和排名的实际影响也可能不同。
因此,论文不能看到某项指标权重最高,就直接得出“它是影响评价结果最重要的因素”。更谨慎的表达应当根据权重来源进行:
- 专家权重较高:说明评价者认为该指标更重要;
- 数据驱动权重较高:说明该指标在当前样本中提供了较多区分信息;
- 敏感性较高:说明该指标或其权重变化对最终结果影响较大。
这三种结论并不等价。
(四)集结模型:怎样把一个对象的多项指标合成为评价结果
所谓集结模型,就是把某个对象的多个指标值及其权重转换为该对象综合评价结果的规则。它集结的是指标信息,而不是把多个评价对象合并为一个对象。对于第 $i$ 个评价对象,可以抽象表示为:
$$ y_i=f(\boldsymbol{w},\boldsymbol{x}_i) $$
其中:
- $\boldsymbol{x}_i$ 是第 $i$ 个对象的指标状态;
- $\boldsymbol{w}$ 是指标权重;
- $f$ 是集结模型;
- $y_i$ 是第 $i$ 个对象的综合评价结果。
对每个对象分别计算后,可以得到 $y_1,y_2,\ldots,y_n$。根据这些评价值的大小或所属区间,可以进一步对评价对象进行排序、分级或分类。
这一定义揭示了综合评价最关键的一步:
多指标评价的任务不是简单地把数字加起来,而是为每个对象选择一种符合评价目的的指标集结逻辑。
不同集结模型代表不同的评价观念和结果形式。例如:
- 加权求和强调各指标贡献的累积;
- 理想点方法关注每个评价对象与某种理想状态的距离,并常据此排序;
- 模糊评价把对象的指标信息转换为其对不同评价等级的隶属程度;
- 优劣关系方法侧重对象之间的两两比较;
- 数据包络分析评价多投入、多产出条件下的相对效率;
- 非补偿性规则强调某些最低标准不能被其他优势抵消。
常见的熵权-TOPSIS组合也属于这一框架:熵权法利用一组评价对象的指标数据确定权重,TOPSIS再把每个对象的多项指标表现集结为该对象相对于正、负理想解的贴近度,最后据此比较和排序。这里的“综合评价”仍然是对每个对象的多指标信息进行综合。
这里最值得关注的是“补偿性”。
假设一个评价对象在某个指标上表现很差,它能否依靠其他指标的高分弥补?
如果评价城市宜居水平,一个城市在交通便利方面的优势可能在一定程度上弥补其商业设施不足;但如果评价产品安全,某个产品的严重安全缺陷通常不能被低价格和漂亮外观抵消。
所以,集结模型的选择不能只根据方法是否流行,还要根据管理问题回答:
- 指标之间是否可以互相补偿;
- 是否存在必须达到的最低标准;
- 研究需要为对象形成得分、排序、等级、类别还是隶属度;
- 理想状态来自样本、政策目标还是理论标准;
- 不同指标之间是否存在相互作用;
- 模型结果是否便于解释和应用。
(五)评价者:谁在定义评价规则
郭亚军把评价者列为综合评价的第五个基本要素。评价者可以是个人,也可以是群体。评价目的的确定、指标体系的建立、模型选择和权重确定,都与评价者有关。
这是综合评价中经常被忽视,却贯穿其他四个要素的一点。
很多论文将“使用客观数据”和“评价过程完全客观”等同起来。实际上,即使所有指标值都来自统计数据库,研究者仍然需要决定:
- 评价什么概念;
- 选择哪些对象;
- 纳入哪些指标;
- 指标是正向、负向还是适度型;
- 使用什么比较基准;
- 如何处理缺失值和异常值;
- 使用何种权重;
- 采用何种集结模型;
- 如何解释最终结果。
这些决定都不是由数据自动完成的。
因此,更准确的认识是:
综合评价通常同时包含客观信息和主观判断。高质量评价的目标不是假装消除所有主观性,而是让评价中的判断有依据、可说明、可复核。
在实际研究中,还需要说明评价者是谁:
- 研究者;
- 行业专家;
- 政府部门;
- 企业管理者;
- 服务对象;
- 多方利益相关者。
不同评价者可能拥有不同目标。例如,企业管理者评价供应商时可能重视成本与交付,监管部门可能更重视合规和安全,消费者则可能更关注质量和服务。不存在脱离评价主体与评价目的的唯一权重体系。认识到评价者的作用,不是要否定评价的科学性,而是要求研究者把评价立场和规则说明清楚。
四、五个基本要素怎样形成完整评价过程
前面的五个要素描述了一个综合评价问题“由什么构成”,经典评价过程则说明这些要素“按照什么顺序发生联系”。郭亚军将综合评价看作各组成要素之间信息流动和组合的过程,同时指出其中包含主观信息与客观信息的集成。
根据教材第1章对经典过程的概括,一项综合评价研究通常包括:
- 明确评价目的;
- 确定被评价对象;
- 建立评价指标体系;
- 收集指标原始值并进行必要的预处理;
- 确定与各指标对应的权重系数;
- 选择或构造综合评价模型;
- 计算综合评价值;
- 根据评价值对对象进行排序或分类。
这条逻辑链并不是可以随意调换顺序的算法清单。一般来说,后一步建立在前一步的判断之上。
例如:
- 评价目的不清楚,就无法判断哪些对象应该比较;
- 对象范围不清楚,就无法判断指标是否具有可比性;
- 指标含义不清楚,就无法合理确定方向和权重;
- 权重与集结规则不清楚,综合得分就缺少明确含义;
- 结果含义不清楚,就无法提出有依据的管理建议。
因此,一项评价研究不应从“选择什么计算方法”开始,而应从评价任务和评价目的开始。赋权和集结虽然是数学计算最集中的环节,却只是完整评价过程中的一部分。
五、为什么使用客观数据也不等于评价完全客观
五个基本要素及其经典流程还揭示了一个重要事实:评价过程中既有对现实状态的观察,也有对评价标准的选择。
原始数据可以来自客观记录,但以下问题都包含研究判断:
- 什么值得测量;
- 什么属于正向表现;
- 什么状态应当被视为理想;
- 哪些差异具有管理意义;
- 指标之间应当如何权衡;
- 是否允许优势补偿短板;
- 最终以总分、排名还是等级表达结果。
这并不意味着综合评价可以任意进行。恰恰相反,评价中的判断越无法完全消除,研究者越需要做到:
- 理论依据明确;
- 数据来源可靠;
- 处理过程透明;
- 参数设置可解释;
- 结果可以复现;
- 合理替代方案下结论基本稳定。
所谓“科学评价”,并不是评价者完全退出评价过程,而是评价者能够对自己的每项选择承担解释责任。客观数据能够约束评价判断,却不能自动生成评价目的、指标体系和集结规则。
六、从综合得分到管理结论,还差哪一步
完成上述流程,我们可以得到综合得分、排名、等级或分类结果,但研究并没有在计算结束时自动完成。评价类论文还需要解释这些结果究竟意味着什么。
综合评价主要回答“表现如何”,它可以帮助研究者:
- 比较不同对象的综合表现;
- 描述同一对象在不同时期的变化;
- 分析不同维度的优势和短板;
- 判断对象与目标状态或参照标准之间的差距。
但是,仅凭综合评价结果,通常不能直接回答“为什么形成这种差异”。例如,某个地区得分较高,只能说明它在当前评价目的、指标体系、数据、权重和集结规则下表现较好,不能由此直接证明某项政策导致了这一结果。
因此:
评价结果不等于影响机制,指标权重不等于因果效应,数学意义上的短板也不一定是现实中的根本原因。
如果研究希望进一步解释评价结果的形成机制,就需要结合理论分析、案例材料、访谈、回归模型或更严格的因果识别方法。评价模型负责为对象形成综合评价结果,机制分析负责解释结果来源,二者可以衔接,但不能互相替代。
七、写评价类论文前,可以先检查这五个问题
对于刚接触评价类论文的研究者,可以先不急着学习具体算法,而是用下面五个问题检查自己的研究:
| 基本要素 | 必须回答的问题 |
|---|---|
| 被评价对象 | 评价谁?这些对象为什么可以比较? |
| 评价指标 | 评价什么?指标能否代表研究概念? |
| 权重系数 | 依据什么表达指标的相对重要程度? |
| 集结模型 | 如何把每个对象的多项指标转化为该对象的评价结果? |
| 评价者 | 谁在设定评价目的、标准和规则? |
在此基础上,再继续追问:
- 数据是否可靠并具有可比性?
- 评价结果对权重和模型选择是否敏感?
- 得分差异是否具有实际管理意义?
- 结论有没有超过模型能够支持的范围?
如果这些问题能够得到清楚回答,具体使用哪种赋权方法或评价模型才具有讨论意义。如果这些问题没有回答,那么再复杂的算法,也可能只是在不清楚评价含义的情况下,对一组数据进行了精确计算。
综合评价当然需要数学方法,但方法应当服务于评价目的。对于评价类管理论文而言,真正完整的逻辑不是“选方法—算权重—出排名”,而是:先定义评价任务,再建立有依据的评价规则,最后对评价结果作出与证据范围相符的管理解释。
说明与参考文献
本文关于综合评价五个基本要素、指标体系的一般原则,以及经典评价过程的概括,依据郭亚军《综合评价理论、方法及应用》第1章第1.3节“多属性综合评价的经典过程”。
本文对以下内容进行了面向初学者的解释和延伸:
- 被评价对象的边界与可比性;
- 不同含义的指标权重;
- 集结模型中的补偿性;
- 评价与因果解释的区别;
- 评价过程中的主客观信息关系。
这些延伸用于说明上述理论框架在管理类论文中的实际含义,并非对原书文字的直接转述。
参考文献:
郭亚军. 综合评价理论、方法及应用[M]. 北京:科学出版社,2007.