Phase 1
最小运营版 MVP
2 周
先把“录链接 → 抓取 → 入库 → 查看 → 初审”跑通,让运营马上能用。
- 链接录入页
- 任务队列页
- 资料列表页
- 资料详情页
- 基础初审能力
这个项目当前不先做“复杂 AI 成品”,而是先做一个运营马上能用的最小版本: 先让运营录入链接、沉淀原始资料、看到状态、完成初审;随后再逐步进入结构化抽取、RAG、监视搜索和综合内测。
先实后虚,先让数据进来,再谈智能增强
当前最重要的不是把系统讲得多高级,而是先让运营能录链接、补信息、做初审,开始形成真实工作流。
没有原始链接、正文、附件、时间和来源的稳定入库,后面所有抽取、搜索、RAG 都是空中楼阁。
要做到 95%+ 的识别率,前提一定是:系统可改、可核对、可审计,而不是一次性自动生成。
第一阶段细做;后续阶段先定方向,再根据第一阶段真实结果细化
先把“录链接 → 抓取 → 入库 → 查看 → 初审”跑通,让运营马上能用。
根据第一阶段沉淀的真实样本,增强品牌、产品、品类、风险、不合格项目等字段抽取。
用真实链接和真实来源跑批,找出抓取、PDF、OCR、附件、字段抽取的主要问题。
只基于已核对的正式证据库做检索和回答,不直接吃脏原始数据。
把“发现新通报、新召回、新海关数据”的能力接进系统,自动进入处理链路。
对前端、后端、数据处理、RAG、监视搜索做整链路联调,检验是否真能协同工作。
小范围上线,用真实运营流程验证 SOP、回滚、异常处理和产出质量。
第一阶段是当前真正要开干的部分
先保证最小链路稳定,再叠加智能能力
[运营人员]
|
v
[前端管理台 Vue3 + TS + Element Plus]
|
v
[后端 API Rust + Axum]
|
+--------------------+
| |
v v
[任务状态机] [查询/核对服务]
| |
v v
[抓取/解析 Worker] ---> [PostgreSQL]
|
v
[原始 HTML / PDF / 附件 / OCR 结果存储]
第一阶段只要求:
录入 -> 抓取 -> 保存 -> 查看 -> 初审
后续再加:
结构化抽取 -> 正式证据库 -> 检索 -> RAG -> 监视搜索
前重后轻,第一阶段最重要
只要达到这些,就算第一阶段成功