这一页说明数据从哪来、怎么去重、分数怎么算、以及为什么某条没上榜。 内容由配置与代码自动生成,避免与实际实现脱节。
一、数据源(当前启用 27 个抓取端点)
| 媒体 | 国家/地区 | 类型 | 权威权重 | 状态 |
|---|---|---|---|---|
| Al Jazeera | QA | media | 0.80 | ok |
| Ars Technica | US | tech | 0.84 | ok |
| BBC | UK | media | 0.90 | ok |
| BBC 中文 | UK | media | 0.83 | ok |
| 中国新闻网 | CN | wire | 0.90 | ok |
| CNBC | US | finance | 0.86 | ok |
| cnBeta | CN | tech | 0.66 | ok |
| 德国之声中文 | DE | media | 0.80 | 未运行 |
| 经济观察报 | CN | finance | 0.84 | degraded |
| The Guardian | UK | media | 0.86 | ok |
| 虎嗅 | CN | tech | 0.78 | 未运行 |
| IT之家 | CN | tech | 0.74 | ok |
| 机器之心 | CN | tech | 0.80 | 未运行 |
| 36氪 | CN | tech | 0.82 | 未运行 |
| NPR | US | media | 0.88 | ok |
| 纽约时报中文网 | US | media | 0.85 | ok |
| 人民日报 | CN | media | 0.94 | ok |
| 量子位 | CN | tech | 0.78 | degraded |
| 法国国际广播中文 | FR | media | 0.78 | ok |
| solidot | 0.00 | 未运行 | ||
| sspai | 0.00 | 未运行 | ||
| 证券时报 | CN | finance | 0.85 | 未运行 |
| TechCrunch | US | tech | 0.84 | ok |
| The Hill | US | media | 0.86 | ok |
| 钛媒体 | CN | tech | 0.78 | ok |
| wallstreetcn | 0.00 | 未运行 | ||
| Wall Street Journal | US | finance | 0.92 | ok |
完整来源清单(275 个)见仓库中的 config/sources.yaml; 抓取地址见 config/feeds.yaml。权威权重参与重要度计算。
二、去重与聚类
先去 URL 跟踪参数做精确去重,再用「字符 3-gram + 分词」混合相似度做近重复去重; 公告、财报等模板类文本只走 URL 精确去重,避免样板文本误合。 聚类分两步:文本相似度贪心(突发事件阈值更低),再用最长公共子串与实体重叠做二次合并。
三、三档分数
热度 = 报道量 × 0.4 + 媒体多样性 × 0.3
+ 互动信号 × 0.3(log 压缩后归一化)。
重要度 = 来源权威 × 0.32 + 影响范围 × 0.24
+ 影响类型 × 0.2 + 持续性 × 0.14
+ 跨区关注 × 0.1。
上升 = 12 小时与 72 小时速度比的 log 归一化 × 0.55 + 新鲜度 × 0.25 + 跨平台共振 × 0.20,
再按全网覆盖率衰减。
四、证据门槛
最低互动代理值 8; 最低独立来源 2 家; 单来源事件需要互动代理值 ≥ 60 才能上榜。 交叉印证只统计发现阶段的独立媒体,不统计回抓扩充后的来源数。
说明:社交平台互动数据尚未接入,当前互动信号使用 「报道量 × 3 + 独立源 × 4」的代理值,页面会如实标注。
五、纠错与删除
发现错误可在 后台审核队列提交,或通过仓库 issue 反馈。 本产品只展示标题、来源、时间、链接与自生成摘要,不存储也不展示原文全文。