8.4 术语表:足球数据科学词典(中英对照)
词典
🕒 预计阅读:11 分钟
📅 更新时间:2026年09月14日
👁️ 1 次阅读
✍️ 来源:球小策量化实验室
阅读本知识库时遇到不熟悉的术语,来这里查。
一、预期类指标#
| 术语 |
英文 |
含义 |
| 预期进球 |
xG (Expected Goals) |
基于历史数据估算,一次射门转化为进球的概率。用于衡量机会质量而非结果 |
| 预期失球 |
xGA (Expected Goals Against) |
本方球门承受的预期进球值,衡量防守质量 |
| 阻止进球 |
GSAA / Goals Prevented |
面对的总 xGA 与实际失球的差值,衡量门将表现 |
| 净预期进球 |
xGD (Expected Goal Difference) |
xG 减去 xGA,衡量综合表现 |
二、攻防强度类指标#
| 术语 |
英文 |
含义 |
| 进攻威胁实时指数 |
OTI (Offensive Threat Index) |
衡量进攻端创造威胁的方式与效率,按位置可分为锋线(FW-OTI)与中场(MF-OTI) |
| 防线压制实时指数 |
DII (Defense Suppression Index) |
衡量防守体系压制对手创造机会的能力 |
| 门将影响值 |
GIM (Goalkeeper Impact Metric) |
量化门将扑救质量与阻止进球的贡献 |
| 阵容完整度 |
Squad Integrity |
考虑伤停后球队的实际战力完整程度 |
三、统计与建模术语#
| 术语 |
英文 |
含义 |
| 泊松分布 |
Poisson Distribution |
描述单位时间/空间内随机事件发生次数的概率分布,足球进球数近似服从 |
| 逻辑回归 |
Logistic Regression |
把多特征映射为 0~1 概率的统计模型 |
| 岭回归 |
Ridge Regression |
带 L2 正则化的线性回归,用于抑制多重共线性 |
| 正则化 |
Regularization |
给模型加约束以防止过拟合的技术 |
| 数据穿越 |
Look-ahead Bias |
建模时使用了当时不可得的信息(如未来数据),导致回测虚高 |
| 多重共线性 |
Multicollinearity |
特征之间高度相关,导致回归系数不稳定 |
| 收缩估计 |
Shrinkage |
小样本时把估计值向先验值拉近,以降低方差 |
| 过拟合 |
Overfitting |
模型在训练集表现好但样本外表现差 |
| 样本外检验 |
Out-of-sample Test |
用未参与建模的数据检验模型效果 |
| 走步式检验 |
Walk-forward Validation |
按时间顺序滚动切分训练/测试集的验证方式 |
四、评估类术语#
| 术语 |
英文 |
含义 |
| 信息系数 |
IC (Information Coefficient) |
指标与未来结果之间的相关系数,衡量预测力 |
| 期望值 |
EV (Expected Value) |
考虑概率加权的平均结果,量化决策的核心指标 |
| 投资预期收益率 |
ROI (Return on Investment) |
总预期收益与总投入的比值 |
| 最大回撤 |
Max Drawdown |
资产曲线从最高点到最低点的最大跌幅 |
| 凯利公式 |
Kelly Criterion |
在已知概率优势下计算最优选择方向比例的公式 |
| 幸存者偏差 |
Survivorship Bias |
只看到成功样本而忽略失败样本造成的认知偏差 |
五、市场与数据数值术语#
| 术语 |
英文 |
含义 |
| 隐含概率 |
Implied Probability |
由数据数值反推的概率(1 ÷ 数据数值) |
| 服务成本率 |
Overround / Vig |
机构加在数据数值中的利润比例 |
| 公平概率 |
Fair Probability |
去除服务成本后的归一化概率 |
| 离散度 |
Spread / Dispersion |
不同机构对同一结果的定价差异 |
| 变异系数 |
CV (Coefficient of Variation) |
标准差除以均值,消除量纲后可跨场次比较波动性 |
| 让球盘 |
Handicap |
为平衡实力差距而设置的让球线 |
| 进球数预期盘 |
Over/Under |
对总进球数的定价线 |
| 数据数值漂移 |
Odds Drift |
数据数值随时间的变化 |
六、数据处理术语#
| 术语 |
英文 |
含义 |
| 特征工程 |
Feature Engineering |
从原始数据构造模型可用特征的过程 |
| 标准化 |
Standardization |
把不同量纲的变量转换到可比较的尺度 |
| Z 分数 |
Z-score |
(x − 均值) / 标准差 |
| 百分位排名 |
Percentile Rank |
某值在整体中的排名百分位,对异常值鲁棒 |
| 滚动窗口 |
Rolling Window |
用固定长度的最近 N 期数据做统计 |
| 时间衰减 |
Time Decay |
对越近的数据赋予越高权重 |
| 幂等 |
Idempotent |
同一操作重复执行不会产生额外副作用 |
| 限流 |
Rate Limiting |
限制单位时间内的请求次数 |
| 实时指数退避 |
Exponential Backoff |
失败重试时逐步拉长间隔的策略 |
| 去重免扣 |
Dedup Hit |
相同参数短期内重复请求不重复计费 |
七、赛事与阵容术语#
| 术语 |
英文 |
含义 |
| 近 5 场战绩 |
Form (Last 5) |
最近五场比赛的结果表现 |
| 首发阵容 |
Starting Lineup |
比赛开始时的出场球员 |
| 出战成疑 |
Doubtful |
是否出场尚未确定的球员状态 |
| 历史交锋 |
H2H (Head to Head) |
两队之间的历史对战记录 |
| 赛程密度 |
Fixture Congestion |
单位时间内的比赛频率,影响体能 |
| 轮换 |
Rotation |
为分配体能而更换首发阵容 |
八、AI 与智能体术语#
| 术语 |
英文 |
含义 |
| 大语言模型 |
LLM (Large Language Model) |
基于海量文本训练的生成式语言模型 |
| 语义幻觉 |
Hallucination |
模型生成听起来合理但无事实依据的内容 |
| 下一个词预测 |
Next Token Prediction |
LLM 的底层生成机制 |
| 上下文窗口 |
Context Window |
模型单次能处理的信息量上限 |
| 智能体 |
Agent |
能调用工具、执行多步任务的 AI 系统 |
| 技能包 |
Skill |
给智能体安装的领域能力扩展 |
| 工具调用 |
Tool Calling |
模型调用外部接口获取信息的能力 |
| 提示词工程 |
Prompt Engineering |
通过设计指令来引导模型输出的方法 |
下一步该看什么#