公开采集身份
这是一个受控、低频读取企业公开网页文字的验证项目,用来判断公开资料能否被整理成有证据、可追溯的制造能力数据。
- 采集器名称
- ManufacturingDataMVTBot
- 当前版本
- 0.2
- 政策编号
- MVT01-P0-v1
- 联系与退出
- 1274199737@qq.com
- 机器可读规则
- crawler-policy.json
受控金丝雀 截至 2026-08-22,只允许对一个明确签名的来源执行低频、单页 HTML 文字验证;不代表系统已经获准批量采集。
采集器如何表明身份
每次合规请求都会使用固定 User-Agent,不冒充浏览器、搜索引擎或真人:
ManufacturingDataMVTBot/0.2 (+https://crawler.eastsea.vip/; contact=mailto:1274199737@qq.com)
当前阶段会读取什么
- 一个经一次性签名明确批准、无需登录即可访问的企业官网来源
- 该来源的 robots.txt 与一个明确列出的 HTML 页面
- 页面可见文字,以及支持结论所需的最小来源位置与时间
- 企业在页面中自行陈述的工艺、材料、设备或精度信息
不会做什么
- 不会加载或保存图片、脚本、样式、PDF 和其他子资源,也不跟随链接
- 不会登录、破解验证码或绕过访问控制
- 不会轮换代理、隐藏身份或规避封禁
- 不以员工个人资料为采集目标,也不建立个人画像
- 不会把 AI 推断冒充企业已确认的事实
访问强度与立即停止条件
- 每个网站同一时间最多 1 个请求。
- 每个网站最高 1 次请求/分钟,不突发访问,不自动重试。
- 每次运行必须由一次性签名绑定准确网址;运行编号使用后不能重放。
- 页面深度固定为 0,不跟随重定向,不加载子资源。
- 遵守路径级 robots.txt 规则以及网站明确公布的限制。
- 遇到 401/403、429、验证码、封禁页、robots 禁止或网站明确反对时,立即停止该来源。
- 遇到无效 TLS 证书时阻断当前请求;不绕过证书错误,也不自动降级到不安全的 HTTP。
- 当前金丝雀只使用 GET,不提交表单。
数据怎样使用与保存
原始 HTML、网络回执和转换记录只在受限环境中短期保存,首个保存周期不超过 30 天;图片不会下载或保存,原始页面不会公开再发布。用于检索的证据只保留必要逐字片段,并移除个人邮箱、手机号和即时通信账号。每条制造能力结论都保留来源地址、采集时间、证据位置与原始工件哈希,并明确标记为“企业自行陈述”;AI 推断与企业原话分开保存,证据不足时标记为“待核实”。
纠错、限制访问或停止采集
如果您是网站或企业资料的权利人,希望更正资料、限制某些路径,或让本项目完全停止访问,请发送邮件到 1274199737@qq.com。邮件中附上相关域名和要求即可;收到后会先暂停对应来源,再核对处理。
English: For corrections, access restrictions, or a complete opt-out, contact 1274199737@qq.com with the affected domain. Collection for that source will be paused before review.