近期,千方科技助力武汉市交通运输局智能交通中心,正式编制完成了《武汉市公共交通领域高质量数据集建设指南》。该指南全面覆盖出租汽车、网约车、常规公交、城市轨道交通与共享单车五大细分领域,针对每个业务场景下的数据集建设均给出了明确规范。简单来说,这份指南的核心目标就是“让武汉的公共交通系统变得更加智能高效”。
不少人可能会好奇:到底什么是高质量数据集?实际上,它指的是经过清洗、标注、结构化处理,能够直接用于训练人工智能模型的数据集合。当前,AI技术在交通领域的应用正在加速落地,这原本是一个积极的发展趋势。然而,问题在于:交通行业虽然常常强调“数据量大”,真正能够被AI模型有效利用的数据却并不多。
造成这一困境的原因主要有两点。第一,数据分散在各业务系统中,各管一摊,标准不统一,质量也参差不齐。第二,行业内的专业知识和经验——例如调度规则、应急预案、运营逻辑等——这些“隐性知识”很难被模型直接学习吸收。结果就是,AI模型“通识有余,专识不足”,表面上懂得很多,但一旦落到具体应用场景,就往往力不从心。
今年6月,国家数据局专门发布了《关于推进行业高质量数据集建设行动的实施方案》,对数据集的标准提出了明确要求。交通运输部科学研究院的院长也对此进行了解读:交通领域的数据必须遵循“结构完整、内容多样、标注准确、模型适配”这四个标准,才能转化为AI可以高效利用的“食粮”。更关键的是,那些隐藏在运行规则、调度逻辑和应急预案中的行业知识,单纯依靠机器无法提取,必须由行业专家深度参与标注才能实现。

