返回代表工作
DCIC 场景文本图像伪造分析
在限时任务中组合视觉语言模型与分割网络,同时完成图像真伪判别、伪造区域定位和归因解释。
- 我的角色
- 方案设计、模型微调与全链路集成
- 方法与工具
- Qwen-VL · QLoRA · ResNet34-UNet · Structured prompting
01
问题与挑战
单一模型很难同时兼顾高层语义判断与像素级定位,且限时环境要求各模块能够快速独立迭代和稳定交付。
02
关键贡献
将视觉语言模型用于全局判别和结构化归因,把分割网络用于像素级掩码定位。
使用 QLoRA 完成参数高效微调,并设计稳健的结构化输出与回退解析。
以解耦级联架构支持双路独立迭代,降低限时开发中的耦合风险。
03
结果与公开边界
在竞赛窗口内交付完整检测、定位与解释链路,验证“VLM 认知 + 分割定位”路线的工程可行性。
查看 GitHub