返回代表工作
竞赛项目2026公开代码

DCIC 场景文本图像伪造分析

在限时任务中组合视觉语言模型与分割网络,同时完成图像真伪判别、伪造区域定位和归因解释。

我的角色
方案设计、模型微调与全链路集成
方法与工具
Qwen-VL · QLoRA · ResNet34-UNet · Structured prompting
视觉语言模型判别与分割网络定位组成的图像伪造分析流程图

问题与挑战

单一模型很难同时兼顾高层语义判断与像素级定位,且限时环境要求各模块能够快速独立迭代和稳定交付。

关键贡献

  1. 将视觉语言模型用于全局判别和结构化归因,把分割网络用于像素级掩码定位。

  2. 使用 QLoRA 完成参数高效微调,并设计稳健的结构化输出与回退解析。

  3. 以解耦级联架构支持双路独立迭代,降低限时开发中的耦合风险。

结果与公开边界

在竞赛窗口内交付完整检测、定位与解释链路,验证“VLM 认知 + 分割定位”路线的工程可行性。

  • Qwen-VL
  • QLoRA
  • ResNet34-UNet
  • Structured prompting
  • Segmentation
查看 GitHub