评测集建设与维护:按既定标准扩充和维护多个模型的多维度评测集,组织标注与交叉复核,对评测结果做质检,保证数据可信;在「评测 → 数据集构建 → 模型优化 → 评测验收」闭环里承接执行环节,并对指标定义提出改进意见;
模型横向对比:定期对标 sota 视频生成模型跑同题对比,产出可复用的对比记录与 bad case 归档,为「哪些能力值得投入、哪些是伪需求」的判断提供事实依据;
应用场景与 case 搭建:基于实时视频能力,跑通并沉淀可对内对外展示的 demo case,把「模型能做到什么」变成看得见的东西。