7.1 【边界声明】我们公开什么、闭源什么
先读这篇本篇是整个第七篇的前提。请务必先读完这一篇,再读后面的构造教程。
一、为什么要写这篇声明
我们决定公开高阶指标的构造方法论。这是一件对用户有综合性价比的事,但也需要把边界说清楚——既避免误解,也避免不必要的争议。
二、三层信息切分
| 层级 | 内容 | 是否公开 | 说明 |
|---|---|---|---|
| L1 概念层 | 这个指标想捕捉什么现象、为什么重要 | ✅ 全公开 | 在第三篇已完整讲过 |
| L2 方法层 | 一般用什么数据、什么函数形式、怎么定权重、怎么验证有效性 | ✅ 公开 | 本篇的核心内容 |
| L3 参数层 | 我们确切的特征集合、分箱方式、权重数值、标定周期 | ❌ 闭源 | 属于核心资产 |
三、为什么公开 L2 是有意义的
因为用户真正能用上的综合性价比全部在 L2。
- L3 的具体参数,你拿到也没用——你没有我们这套清洗后的数据;
- L2 的方法论,你能直接用在你自己的数据上,构建适合你自己用途的指标。
一个关键认知:
做自媒体内容,和做球探工作,和做量化研究,需要的权重完全不同。
所以正确的做法不是你复制我们的权重,而是你按自己的用途构建自己的权重。
这件事我们无法替你完成——这正是教学的综合性价比所在。
四、关于「参数反推」的诚实说明
这一点必须讲清楚,因为它涉及技术上的真实风险:
只要「函数形式公开 + 输出值公开」,专有参数在原理上是可以被回归反推的。
任何拿到足够多「输入字段 + 我们的公开输出值」样本的人,理论上都可以通过回归或优化拟合出接近的参数。「不公布权重」并不能真正保护权重。
我们的应对设计
| 约束 | 具体做法 |
|---|---|
| 教函数形式,不教特征集合 | 公开「xG 可以用射门位置与射门方式建模」这类思路;不公开实际使用了哪些具体特征维度 |
| 教学示例与生产口径刻意错开 | 教学采用简化模型(例如射门区域分 5 档),生产采用完整模型;教学可基于公开历史赛季,生产使用当期标定 |
| 引导用户建自己的权重 | 教学内容的目标是「让你会做」,不是「让你复刻我们」 |
| 显式声明边界 | 就是本篇 |
需要说明的是:教学示例的数值不会与线上生产值一致。这是有意为之,请不要把教学代码的输出与接口返回的值做逐位比对。
五、你可以用这些内容做什么
| 允许 | 说明 |
|---|---|
| 用在自己的项目里 | 个人或商业项目都可以 |
| 改造后使用 | 鼓励根据自己数据的特点调整 |
| 写成文章分享 | 标注来源即可 |
| 用于教学 | 同上 |
六、本篇系列的内容地图
| 文档 | 内容 |
|---|---|
| 7.2 | 四条技术路线总览 |
| 7.3 | 基础数据盘点(你能拿到什么原料) |
| 7.4 ~ 7.7 | 四个构造示例(xG / 攻防强度 / 伤停折损 / 市场离散度) |
| 7.8 | 权重怎么定 |
| 7.9 | 如何验证指标是否有效 |
| 7.10 | 特征工程常见陷阱 |
| 7.11 ~ 7.14 | 自建系统、自动化、回测 |
七、前置知识
本系列假设你具备:
- Python 基础(能看懂 pandas / numpy 代码);
- 基本的统计概念(均值、分布、相关性);
- 已经能成功调用球小策 API(见 4.3)。
如果不具备前两项,建议先读第三篇理解概念,实践部分可以稍后再看。
足球赛事前瞻 | AI 智能分析 | 足球数据解读 - 球小策