{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:Y2TAAOIBD6QFGYGMD4HWT7LVUZ","short_pith_number":"pith:Y2TAAOIB","schema_version":"1.0","canonical_sha256":"c6a60039011fa05360cc1f0f69fd75a64b68fe43c06af90e973684331cd7456d","source":{"kind":"arxiv","id":"2506.12364","version":2},"attestation_state":"computed","paper":{"title":"MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"cs.AI","authors_text":"Hengxing Cai, Jinhan Dong, Jue Hou, Mingjun Xu, Renxin Zhong, Sihang Li, Zehui Wang, Zhifeng Gao","submitted_at":"2025-06-14T05:55:00Z","abstract_excerpt":"Multimodal document retrieval systems enable information access across text, images, and layouts, benefiting various domains like document-based question answering, report analysis, and interactive content summarization. Rerankers improve retrieval precision by reordering retrieved candidates. However, current multimodal reranking methods remain underexplored, with significant room for improvement in both training strategies and overall effectiveness. Moreover, the lack of explicit reasoning makes it difficult to analyze and optimize these methods further. In this paper, We propose MM-R5, a Mu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.12364","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-06-14T05:55:00Z","cross_cats_sorted":["cs.CL","cs.CV"],"title_canon_sha256":"cf133b63373316ce629b98822536ec3acd074f2e11a0f03eadd87fbeb0e116e8","abstract_canon_sha256":"de0df309da54cb709ef671f3256c4f4169ab0bae1b4ccc9dce00be706df44c67"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:25:12.647384Z","signature_b64":"svEb+Jptunwh1dP1TqoqE0Zzb2XcovqfOoEPPVR1IxiIHkZTN7bSb94LfJqL8Tt4GnpJFdYagWxX8YMS7rRwCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c6a60039011fa05360cc1f0f69fd75a64b68fe43c06af90e973684331cd7456d","last_reissued_at":"2026-07-05T11:25:12.646890Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:25:12.646890Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"cs.AI","authors_text":"Hengxing Cai, Jinhan Dong, Jue Hou, Mingjun Xu, Renxin Zhong, Sihang Li, Zehui Wang, Zhifeng Gao","submitted_at":"2025-06-14T05:55:00Z","abstract_excerpt":"Multimodal document retrieval systems enable information access across text, images, and layouts, benefiting various domains like document-based question answering, report analysis, and interactive content summarization. Rerankers improve retrieval precision by reordering retrieved candidates. However, current multimodal reranking methods remain underexplored, with significant room for improvement in both training strategies and overall effectiveness. Moreover, the lack of explicit reasoning makes it difficult to analyze and optimize these methods further. In this paper, We propose MM-R5, a Mu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.12364","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.12364/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.12364","created_at":"2026-07-05T11:25:12.646948+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.12364v2","created_at":"2026-07-05T11:25:12.646948+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.12364","created_at":"2026-07-05T11:25:12.646948+00:00"},{"alias_kind":"pith_short_12","alias_value":"Y2TAAOIBD6QF","created_at":"2026-07-05T11:25:12.646948+00:00"},{"alias_kind":"pith_short_16","alias_value":"Y2TAAOIBD6QFGYGM","created_at":"2026-07-05T11:25:12.646948+00:00"},{"alias_kind":"pith_short_8","alias_value":"Y2TAAOIB","created_at":"2026-07-05T11:25:12.646948+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20280","citing_title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10759","citing_title":"miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31984","citing_title":"GR2 Technical Report","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30027","citing_title":"DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2602.05408","citing_title":"Rich-Media Re-Ranker: A User Satisfaction-Driven LLM Re-ranking Framework for Rich-Media Search","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11864","citing_title":"Very Efficient Listwise Multimodal Reranking for Long Documents","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27600","citing_title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24564","citing_title":"MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ","json":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ.json","graph_json":"https://pith.science/api/pith-number/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/graph.json","events_json":"https://pith.science/api/pith-number/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/events.json","paper":"https://pith.science/paper/Y2TAAOIB"},"agent_actions":{"view_html":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ","download_json":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ.json","view_paper":"https://pith.science/paper/Y2TAAOIB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.12364&json=true","fetch_graph":"https://pith.science/api/pith-number/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/graph.json","fetch_events":"https://pith.science/api/pith-number/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/action/storage_attestation","attest_author":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/action/author_attestation","sign_citation":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/action/citation_signature","submit_replication":"https://pith.science/pith/Y2TAAOIBD6QFGYGMD4HWT7LVUZ/action/replication_record"}},"created_at":"2026-07-05T11:25:12.646948+00:00","updated_at":"2026-07-05T11:25:12.646948+00:00"}