Sign InOpen Brain
arXivPaperNeeds Review

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap uses multimodal retrieval to find caption omissions and hallucinations before refinement, offering a concrete retrieval-and-review pattern for vision agents.

arXiv
Open Source Open MarkdownOpen JSON
Source Summary

**Re³Cap** uses multimodal retrieval as a reasoning signal, with a Caption Refinement Suggester and Caption Quality Assessor targeting hallucinations and omissions. It reports an average **8.64% improvement** over GRPO on COCO-LN500 relation reasoning.

Practical Implication

Builders of vision agents can test retrieved examples or evidence as inputs to a separate suggestion-and-assessment loop. The design separates finding likely caption defects from judging the revised output and requires no extra annotations.

Agent-Ready Context
**Re³Cap** uses multimodal retrieval as a reasoning signal, with a Caption Refinement Suggester and Caption Quality Assessor targeting hallucinations and omissions. It reports an average **8.64% improvement** over GRPO on COCO-LN500 relation reasoning.

Builders of vision agents can test retrieved examples or evidence as inputs to a separate suggestion-and-assessment loop. The design separates finding likely caption defects from judging the revised output and requires no extra annotations.

The reported gain is specific to **COCO-LN500** relation reasoning, and the supplied material gives no latency or compute costs. Broader caption quality and production tradeoffs remain unclear.
Context Map
agentimage#retrieval#harness-engineering#generative-media
Uncertainty
The reported gain is specific to **COCO-LN500** relation reasoning, and the supplied material gives no latency or compute costs. Broader caption quality and production tradeoffs remain unclear.