{"as_of":"2026-08-17T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e9707bbfe0573a456e0e55a58a02bc760999e14a110b63d595ff5916fd231f9","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:18:41.276230Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:24:50.665855Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:27:25.514916Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T11:35:25.894465Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2411.10440"},"observation_digest":"sha256:2695f588abad9675f5c1038c9bd3d7de9105c89543ff742bfc9ee31d1f30ded6","observation_id":"7f27ffdb-7d2c-42c1-b6e2-3c18214a288d","resolution":{"observed_at":"2026-05-16T11:35:25.944906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-08T20:06:35.213153Z","title":"Internlm- xcomposer2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-13T06:46:27.328035Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.213153Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:ef13575e13e4ee25ea9a1fdd895e192b7264e84b9b0612acaaef00274a64aac7","observation_id":"d4118f63-dd22-44cc-943a-d3c28a5d7eef","resolution":{"observed_at":"2026-08-08T20:06:35.213153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:16.528682Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2503.01785"},"observation_digest":"sha256:1ec1e81bb26ab263594498311967f1278c266cb2673309c300b26fd37af12d5f","observation_id":"3224bb3e-e772-43d0-8163-b0098b5be323","resolution":{"observed_at":"2026-05-13T22:16:16.607976Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T00:44:30.558048Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2503.05236"},"observation_digest":"sha256:1e3e1132fb9cb4380ec4a3c49e743548992accf07fbfcbebaba5ad44059bf56c","observation_id":"7a26ca15-e149-4653-b3f7-d1fbdafb6563","resolution":{"observed_at":"2026-05-14T00:44:30.624665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6b52e2b87aef3b0b6b14ea7fc09856f3b21c8cd507da24dc7f70cf49ce41c035","observation_id":"4a697026-1be9-46ed-b0f5-473b729784fc","resolution":{"observed_at":"2026-05-13T01:13:57.508448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-15T22:24:50.665855Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07263","last_updated":"2025-06-09T11:46:47Z","snapshot_observed_at":"2026-08-17T03:01:50.427267Z","submitted_at":"2025-05-12T06:23:08Z","title":"Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:24:50.665855Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.07263"},"observation_digest":"sha256:e0e818e3f115d3e24d5a0623630938a0c537a7504f5d87d29b01f91fe84a9e5b","observation_id":"8b0068df-7793-450c-97e6-2e5c84a92d2c","resolution":{"observed_at":"2026-08-15T22:24:50.665855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-15T20:18:52.977818Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13403","last_updated":"2025-05-19T17:37:39Z","snapshot_observed_at":"2026-08-15T20:12:18.033057Z","submitted_at":"2025-05-19T17:37:39Z","title":"MR. Judge: Multimodal Reasoner as a Judge","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.977818Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.13403"},"observation_digest":"sha256:3ec5acca5f722d8670e2b2471fc37b06b0346f390b74f3b4d9fa86fce2f0278f","observation_id":"ff096c44-57f5-4d46-8d45-e53e287d1424","resolution":{"observed_at":"2026-08-15T20:18:52.977818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-15T20:17:23.265015Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13427","last_updated":"2025-06-05T05:29:41Z","snapshot_observed_at":"2026-08-16T02:17:25.109640Z","submitted_at":"2025-05-19T17:55:08Z","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:23.265015Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.13427"},"observation_digest":"sha256:ca81a437209696254a75e162a4aa97dc619d8936d47d7d499314eaab28d4b41c","observation_id":"4023cf70-a35a-48ef-8c9b-7675d116fb4a","resolution":{"observed_at":"2026-08-15T20:17:23.265015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T15:42:32.512442Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.512442Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:116745c1b4d506b923ada3621ace222c77a44f67d70252b9e57f77e66998f64a","observation_id":"af863026-8903-46e6-adf7-f264d3c4b139","resolution":{"observed_at":"2026-08-07T15:42:32.512442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T15:02:24.804904Z","title":"Zang Yuhang, Dong Xiaoyi, Zhang Pan, Cao Yuhang, Liu Ziyu, Ding Shengyuan, Wu Shenxi, Ma Yubo, Duan Haodong, Zhang Wenwei, others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16517","last_updated":"2025-05-24T10:44:27Z","snapshot_observed_at":"2026-08-13T20:18:37.619057Z","submitted_at":"2025-05-22T10:57:07Z","title":"ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:24.804904Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.16517"},"observation_digest":"sha256:a112ecba91c330a4d2fa0c63b28e9617e14008d1c1abc49287588eb851ae7ec3","observation_id":"4b405f5b-deab-4f49-88d5-95f077449607","resolution":{"observed_at":"2026-08-07T15:02:24.804904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T14:34:55.112648Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-16T09:37:30.090618Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.112648Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:6f6dbe2e7b58f49a76cd7ec6cc442dec352af57f63ee1c68eaf7d8e400d1dd32","observation_id":"62de62e2-b0ec-4e6f-8e41-c84fe1f9368e","resolution":{"observed_at":"2026-08-07T14:34:55.112648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T13:34:16.325870Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21496","last_updated":"2025-05-27T17:58:06Z","snapshot_observed_at":"2026-08-08T15:12:37.593143Z","submitted_at":"2025-05-27T17:58:06Z","title":"UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:34:16.325870Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.21496"},"observation_digest":"sha256:5966b18f3a171c327fc82a74c1744c17ba0193231f420dd2a86332abc681841f","observation_id":"38988312-0153-4080-8c93-3efae3d66d08","resolution":{"observed_at":"2026-08-07T13:34:16.325870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T11:05:19.748441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-14T03:05:22.935928Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.748441Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ccdd50176e41c94c027eda1c3494b1f158a59980b5f129015547e2eaff60182a","observation_id":"869ae997-430e-4c73-89a3-0a3e0ab35c59","resolution":{"observed_at":"2026-08-07T11:05:19.748441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-05T20:28:55.357084Z","title":"Zang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-13T23:10:52.614750Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:55.357084Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4d82cdd4dde801c5e44e297591c15929433268e8e8fbe7b25105c442623e21d7","observation_id":"a8581371-e20e-49bd-b5d3-ab2602db9964","resolution":{"observed_at":"2026-08-05T20:28:55.357084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-05T13:24:39.936440Z","title":"Internlm-xcomposer2.5-reward: A simple yet effective multi-modal reward model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.936440Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:2bdf3b833308adb5d08e39f5ceeaff96059102687e1f7b00d9ce98961fa379fc","observation_id":"2d5e40fb-ea29-4f77-b6e6-136cf38cf54c","resolution":{"observed_at":"2026-08-05T13:24:39.936440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-04T20:20:36.958513Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-09T06:09:37.758584Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.958513Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:893c12b5cb32fc862a34631316e1988d998147ce40740af02eb37fb6ef6bec1c","observation_id":"abd59930-c41a-4f52-a69c-cdfaf9472107","resolution":{"observed_at":"2026-08-04T20:20:36.958513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2603.13224","last_updated":"2026-05-09T03:24:22Z","snapshot_observed_at":"2026-08-16T01:35:37.734008Z","submitted_at":"2026-03-13T17:58:14Z","title":"Visual-ERM: Reward Modeling for Visual Equivalence","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T11:19:42.002790Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2603.13224"},"observation_digest":"sha256:6ec37c3ef3a3c9f3082156d904673ccb1915a6b5bc23e5558f439e61617b0cec","observation_id":"8ac583ed-ae6f-4ae6-84c8-ee1303df5c55","resolution":{"observed_at":"2026-05-15T11:19:57.941133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2605.25661","last_updated":"2026-06-24T00:40:46Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:11:32Z","title":"DRM: Diffusion-based Reward Model With Step-wise Guidance","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:39.225557Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2605.25661"},"observation_digest":"sha256:f0fd96864b0e6f90d8ed1c05cb6f7d2f8e6ca76282ae37a63bcb12228c28080b","observation_id":"4c2c0386-ae29-4357-96f2-a12ded5569e9","resolution":{"observed_at":"2026-06-29T22:13:59.364370Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2606.08525","last_updated":"2026-06-07T09:05:49Z","snapshot_observed_at":"2026-08-14T16:18:16.719359Z","submitted_at":"2026-06-07T09:05:49Z","title":"DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T18:58:26.701929Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2606.08525"},"observation_digest":"sha256:a1ec2aa7dca9d83cfff2f76824ab2838d427f5e7fd25a14b9af662139177e201","observation_id":"3ef200f6-b981-4852-870a-3bae331782cf","resolution":{"observed_at":"2026-07-02T22:27:25.516872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-14T14:00:00.388339Z","title":"arXiv preprint arXiv:2501.12368 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10147","last_updated":"2026-07-11T06:15:03Z","snapshot_observed_at":"2026-08-14T20:33:58.912858Z","submitted_at":"2026-07-11T06:15:03Z","title":"REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T14:00:00.388339Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2607.10147"},"observation_digest":"sha256:ada0625bc33b8019e4d525d3ba91c0249f62148d6f9cf21348be063ab3a63a79","observation_id":"bd273c75-6f75-4bf8-ac52-952a1847c676","resolution":{"observed_at":"2026-07-14T14:00:00.388339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-12T14:37:30.113159Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10908","last_updated":"2026-08-11T13:29:03Z","snapshot_observed_at":"2026-08-15T10:20:33.664842Z","submitted_at":"2026-08-11T13:29:03Z","title":"Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:30.113159Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2608.10908"},"observation_digest":"sha256:162a545521f829a0a68226d06aa0f5b74083894e135fa2c2d76e443e62eb126b","observation_id":"225973e3-99ce-490d-bfa7-bbe563a68028","resolution":{"observed_at":"2026-08-12T14:37:30.113159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12368/citation-record","integrity":"/paper/2501.12368/integrity","json":"/paper/2501.12368/citation-record.json","paper":"/paper/2501.12368"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:39.733873Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.733873Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:44c90befbb81cbc8615990f8c2ee0bd616035fd49ed2bab1d25e4ea85d5243e0","observation_id":"58d466b8-4661-4ac4-94a4-70d1320a4cf4","resolution":{"observed_at":"2026-08-10T17:18:39.733873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-10T17:18:39.740331Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.740331Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:3f00570f065c676b024a7ddc4c45449f742708dd73c447a808061762bb187792","observation_id":"abb2e5e7-7488-4e7a-bace-6d5eed9066cd","resolution":{"observed_at":"2026-08-10T17:18:39.740331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:39.744554Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.744554Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:22a11d5440622bba0ea2fa97e3672c34c5994ffa2b8e340756505571b9fa6eeb","observation_id":"0a0a2297-cc46-4993-baea-55277e0d3952","resolution":{"observed_at":"2026-08-10T17:18:39.744554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:39.784548Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.784548Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:edfeba3df12b0fb298a01c07c55f47e62fee87c88b606dbf0975ccccd6affcd6","observation_id":"308b8b09-15f2-4a16-9a00-79617e86b914","resolution":{"observed_at":"2026-08-10T17:18:39.784548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:39.873733Z","title":"Claude 3.5 sonnet model card addendum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.873733Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:83d929b698724a024550dda7f78188566f798a3b8050f5fa55b41f3f4313c976","observation_id":"f416b15a-134f-45bc-8468-f36dbd519e90","resolution":{"observed_at":"2026-08-10T17:18:39.873733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:39.932884Z","title":"A general language assistant as a laboratory for alignment, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.932884Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:83b6e1c7027956c0f1e20872561dac30ca36b3570e8fa0fa4d4ed592daa917d6","observation_id":"c3362012-a413-41e9-b6c8-ebd3cccdfa13","resolution":{"observed_at":"2026-08-10T17:18:39.932884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:39.989250Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.989250Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:ef6f05d8cc4d9f31a2f628659d26aa6c239eae1069079e770cbc53b800d344f1","observation_id":"cff2761c-efe5-445b-a9a7-5421abd75456","resolution":{"observed_at":"2026-08-10T17:18:39.989250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-10T17:18:39.992578Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.992578Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8f7e3165fc078dfa6757628dad58fefdc06b3202ae02eb877efd7a0ed973217d","observation_id":"f1936c73-93a5-4010-b1fe-c97c4465e134","resolution":{"observed_at":"2026-08-10T17:18:39.992578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-10T17:18:39.996148Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.996148Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:d6a755bcebc3d28ad6e8f9ac20f53a570f08c651171f0853627386fa4a83c411","observation_id":"0c81af2e-f9ce-4efc-98ba-6970f4a382be","resolution":{"observed_at":"2026-08-10T17:18:39.996148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-15T10:04:00.606398Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"cited_work":{"arxiv_id":"2411.13697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.13697","snapshot_observed_at":"2026-08-10T17:18:42.348103Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","venue":"cs.CV","work_id":"aa06bd68-8ccf-4d1c-ad7b-054b96ed2b78","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.999709Z"},"links":{"cited_paper":"/paper/2411.13697","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:91e2a076e59bda341df5b2b506ce4f802267e2bfed68a71b9675988cf2211826","observation_id":"a76663c8-4a8f-4508-9668-446e09af7a64","resolution":{"observed_at":"2026-08-10T17:18:42.352989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-10T17:18:40.003741Z","title":"ALLaVA : Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.003741Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:f141f8bdcd91031dfb17e19495f7f02613b6a2783e0633a0def7603a6807cfaa","observation_id":"d20653c7-597e-4d09-8ceb-611f7f2522b6","resolution":{"observed_at":"2026-08-10T17:18:40.003741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-17T03:33:20.954386Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-10T17:18:40.008109Z","title":"GeoQA : A geometric question answering benchmark towards multimodal numerical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.008109Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:c4d3733f76297cf423a2b8690628072e5e4e44c7c980ca9d3d7469b8971af0e9","observation_id":"4371e3e0-06ad-4ccc-aa02-a9927339681a","resolution":{"observed_at":"2026-08-10T17:18:40.008109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-10T17:18:40.012622Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.012622Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e6ca167ffb04034c5ea55e489be381a4532d8fc521b0b03234e5095b8f48fb17","observation_id":"ba719efe-0197-4a54-91de-5dc6c461edcb","resolution":{"observed_at":"2026-08-10T17:18:40.012622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T17:18:40.016166Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.016166Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e811fcb24b856c52e1a69ec2eb543aa37ea7fdbed47b90700c7d6dbd4a2c4a78","observation_id":"f76dc3b8-f695-4eaf-9c72-ed9ca8af8034","resolution":{"observed_at":"2026-08-10T17:18:40.016166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T17:18:40.020319Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.020319Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:0db7fe653c33f633119d1d2c36ae5e1773327a94b5a865e6e3200095e741e7dc","observation_id":"fdbc36e7-7bd3-4698-8f73-99efc9412160","resolution":{"observed_at":"2026-08-10T17:18:40.020319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.023606Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.023606Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:98fa9e23639ac79adf08de0933e3fe2a13cf27da7f09579ab3d8eab2ef01ae46","observation_id":"a9f7a83e-3c1a-491f-b7cb-c54ce9cbffa4","resolution":{"observed_at":"2026-08-10T17:18:40.023606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T17:18:40.026561Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.026561Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8b6eb5e3fcb275f28d48edcb23103d1eb61bcef9bf393b35da2ac58a54bf77b5","observation_id":"37398d8d-7290-4226-9e4f-f32733487964","resolution":{"observed_at":"2026-08-10T17:18:40.026561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.030331Z","title":"UltraFeedback : Boosting language models with scaled ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.030331Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:6bf0b9169ee786cb5f81af7f67c83552a2275a13280c1651146736b9b245bf41","observation_id":"101de2ce-124e-4cdb-bbc9-9483cb8b18f7","resolution":{"observed_at":"2026-08-10T17:18:40.030331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.033523Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.033523Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:6ac84891a9538a6647140a3ce2695a1ccb275bb30e80c2b606f9b84168640317","observation_id":"08df7141-6ad8-49f9-a21b-05ed2eff8acc","resolution":{"observed_at":"2026-08-10T17:18:40.033523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.036520Z","title":"Nvlm: Open frontier-class multimodal llms, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.036520Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:bbb42c5661b1a0c496f983509f7b7530c21c8743543d2df6c11e14e9b983f415","observation_id":"07750255-4877-4540-a978-a9ddea935e20","resolution":{"observed_at":"2026-08-10T17:18:40.036520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.040215Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.040215Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:9d18eb3934a0a6751672a68319860dde08cf2f505b86e6ff62c0360deeba1acb","observation_id":"442d64e1-b8ce-4923-8602-cc3b41276550","resolution":{"observed_at":"2026-08-10T17:18:40.040215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17760","last_updated":"2024-11-26T00:44:37Z","snapshot_observed_at":"2026-08-17T05:38:19.020192Z","submitted_at":"2024-11-26T00:44:37Z","title":"Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17760","snapshot_observed_at":"2026-08-10T17:18:40.043652Z","title":"Efficient self-improvement in multimodal large language models: A model-level judge-free approach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.043652Z"},"links":{"cited_paper":"/paper/2411.17760","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:d8f4ef1cab9b8c7d63feb664b632ca7a37f8b4cb184cf0668108d3a1ff9bac31","observation_id":"612bf3fb-f15e-4b05-85a7-cc4a788cbf1d","resolution":{"observed_at":"2026-08-10T17:18:40.043652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-16T13:47:54.996189Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-10T17:18:40.048630Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.048630Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:fc8a279cc921e19ba8ffd39c9d0d449bd73a6afe92f8d8e23d1e865aff114d92","observation_id":"c589c456-a654-476e-8903-177fb877283d","resolution":{"observed_at":"2026-08-10T17:18:40.048630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-10T17:18:40.051995Z","title":"Length-controlled AlpacaEval : A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.051995Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:79ba11c395c2d3e75b3b16a57f61b46cfb3ca30cdfef78be0aba3573d0114ebe","observation_id":"e6e9e2d1-9db3-4af9-8c46-fbdf91f4c118","resolution":{"observed_at":"2026-08-10T17:18:40.051995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.063012Z","title":"Understanding dataset difficulty with V -usable information, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.063012Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:1cceaf5abac58aa12ada883db2c944dbfb7457755f965681f920d9f2f06fc7e8","observation_id":"aa988a50-a441-4095-ad9d-cae9b58ebecb","resolution":{"observed_at":"2026-08-10T17:18:40.063012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.088351Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.088351Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:890f931278ee0e9a55719fa84e00032671ca9db431dd984fe77351d7e7c537dd","observation_id":"09bbe186-d714-4269-9934-d6eec117ef55","resolution":{"observed_at":"2026-08-10T17:18:40.088351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.133384Z","title":"Gemini-2.0-Flash https://deepmind.google/technologies/gemini/flash/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.133384Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:c09e249cc68ca6da6223cec11be6b399c35f2e737f1bae58c708f2fc914f6014","observation_id":"f5dca67c-1523-4ecc-b463-6978652be895","resolution":{"observed_at":"2026-08-10T17:18:40.133384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-10T17:18:40.187180Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.187180Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:009964c50344de22495fc663a2c22effb2e5ccd449ae88b98aca64986aa85d2f","observation_id":"96fee390-a7a4-460f-ad96-88ef3d2a3164","resolution":{"observed_at":"2026-08-10T17:18:40.187180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15522","last_updated":"2025-05-20T06:23:39Z","snapshot_observed_at":"2026-08-16T13:07:36.883796Z","submitted_at":"2024-10-20T22:09:44Z","title":"M-RewardBench: Evaluating Reward Models in Multilingual Settings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15522","snapshot_observed_at":"2026-08-10T17:18:40.289337Z","title":"M-RewardBench : Evaluating reward models in multilingual settings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.289337Z"},"links":{"cited_paper":"/paper/2410.15522","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:ceedfb86e5c945015101b61715eee05c78277cd26fed9e456a02840ab23ff2ff","observation_id":"0af39565-f021-4e93-8634-6d84e6b00ba6","resolution":{"observed_at":"2026-08-10T17:18:40.289337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-08-16T14:19:52.313301Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-10T17:18:40.302326Z","title":"V-STaR : Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.302326Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:52b3dfbabe09c5ef458aa8873027211abda8fd6a15914d02854420532c75d45e","observation_id":"a048fb1b-5180-445b-9358-f086841cb616","resolution":{"observed_at":"2026-08-10T17:18:40.302326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.305716Z","title":"ChatGLM-RLHF : Practices of aligning large language models with human feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.305716Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e088f6d4e081bb321847dec4d76ebcf56bb370aafa463d2626adbfc4570b5d34","observation_id":"5ab04001-84f7-41e3-84a3-84d0aec55dd9","resolution":{"observed_at":"2026-08-10T17:18:40.305716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T17:18:40.308909Z","title":"GPT-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.308909Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:d2f3a8a40e28d5b421f60264ce028733b48c370f01a6ad4b59dcb69df006e57b","observation_id":"5c3e020b-5eb3-4fad-b5f0-ef71c55ce7e2","resolution":{"observed_at":"2026-08-10T17:18:40.308909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.312036Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.312036Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:be09695e6ee8b9107ea6f4328036f56560ac88ccc09e346393f7b2d136d549d6","observation_id":"cfc4f9b0-36ae-42ec-829d-49e72306cffa","resolution":{"observed_at":"2026-08-10T17:18:40.312036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15334","last_updated":"2025-06-06T02:50:17Z","snapshot_observed_at":"2026-08-16T13:07:41.754327Z","submitted_at":"2024-10-20T08:56:52Z","title":"Modality-Fair Preference Optimization for Trustworthy MLLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15334","snapshot_observed_at":"2026-08-10T17:18:40.315614Z","title":"Modality-fair preference optimization for trustworthy mllm alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.315614Z"},"links":{"cited_paper":"/paper/2410.15334","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:06f1a0c879a0c7d3e547ff6a3600b87cbecb7e70dd2d98f867f4c07ad3a0c9ec","observation_id":"515c7b57-8268-48ba-b500-97056909de4c","resolution":{"observed_at":"2026-08-10T17:18:40.315614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13746","last_updated":"2024-12-18T11:28:05Z","snapshot_observed_at":"2026-08-11T18:07:40.121451Z","submitted_at":"2024-12-18T11:28:05Z","title":"RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13746","snapshot_observed_at":"2026-08-10T17:18:40.319693Z","title":"Rag-rewardbench: Benchmarking reward models in retrieval augmented generation for preference alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.319693Z"},"links":{"cited_paper":"/paper/2412.13746","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:efbef31522053cb5aa603411ca428ecc7cb006d4d8dc11133d4955772fe20e4e","observation_id":"4099f462-0776-4890-a203-4333cab0c352","resolution":{"observed_at":"2026-08-10T17:18:40.319693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.323358Z","title":"MiraData : A large-scale video dataset with long durations and structured captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.323358Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8bf041a7b8001b60f08920f2275b8543738a1dce9cc78a2c1baa722b39e7de91","observation_id":"4518ad0f-f119-4320-b745-b8c985a49f7a","resolution":{"observed_at":"2026-08-10T17:18:40.323358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.326686Z","title":"DVQA : Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.326686Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:204a01a4bd5f63ae7d808c002b38f2d847e0390ce60b6601051f042cff54d197","observation_id":"49243fb7-a149-4e87-85ce-394bb0ddaab3","resolution":{"observed_at":"2026-08-10T17:18:40.326686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.330107Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.330107Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:9bb265d59f387b589f6afe138db84c3c35325012d2101decb6d36b4d24ad11e4","observation_id":"2e59b7f5-0657-40b7-8318-4f87ee28cb06","resolution":{"observed_at":"2026-08-10T17:18:40.330107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.334228Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.334228Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:4b8468c1d81304941982419b1a1b64bdc6d0988955c49d15c0072382993d6fa1","observation_id":"5fb7bcf8-7a8d-41fe-892b-b1944122cbad","resolution":{"observed_at":"2026-08-10T17:18:40.334228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.337511Z","title":"Solar 10.7b: Scaling large language models with simple yet effective depth up-scaling, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.337511Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:eab6737d8a5a35fdaf9dbbf7dcba1873ed25f1b29033f5f9df4d2cccb285e467","observation_id":"79cb0ae7-ba2d-4a4c-9e3b-3e7fff583507","resolution":{"observed_at":"2026-08-10T17:18:40.337511Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-10T17:18:40.341393Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.341393Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:4b58544bb07f9c45cb7f547c65b01fa6529a0933008847e4538e20c59b913b1b","observation_id":"aa318f91-e11a-414e-bf44-60a684de6eb6","resolution":{"observed_at":"2026-08-10T17:18:40.341393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-16T14:07:56.582345Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-10T17:18:40.346017Z","title":"Rewardbench : Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.346017Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:9e9200c1052c074bb34b0b619d14bbdf03bffe37aa1255019e1ab3301fe5982b","observation_id":"6f5c59c3-738b-47c2-b346-5277a2cd6459","resolution":{"observed_at":"2026-08-10T17:18:40.346017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.349859Z","title":"LLaVA-OneVision : Easy visual task transfer, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.349859Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:a8cab12baf8908e654a432e52cda16f83064c5a3f8b78ceab8f924dd8ba878ad","observation_id":"cb5a167b-871e-413b-b7ca-4b33653c03ec","resolution":{"observed_at":"2026-08-10T17:18:40.349859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-08-17T03:27:30.826224Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-10T17:18:40.353566Z","title":"VLRewardBench : A challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.353566Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:0cdccea4cd5d05fb7017dc23f09fbd6cd57a3d5eb6108fece26853400ab0f24f","observation_id":"1c825286-f9a1-427e-be53-46c0f39f8f43","resolution":{"observed_at":"2026-08-10T17:18:40.353566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09421","last_updated":"2024-10-18T07:10:38Z","snapshot_observed_at":"2026-08-16T13:10:06.269155Z","submitted_at":"2024-10-12T07:56:47Z","title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09421","snapshot_observed_at":"2026-08-10T17:18:40.357027Z","title":"VLFeedback : A large-scale ai feedback dataset for large vision-language models alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.357027Z"},"links":{"cited_paper":"/paper/2410.09421","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:0a0c6df1c2f9169d10be1ceb84c2c1399ed91c40d44281cd4b95879f293a82c4","observation_id":"1188d9ef-0642-4a17-9831-73a078874489","resolution":{"observed_at":"2026-08-10T17:18:40.357027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.360992Z","title":"Super-CLEVR : A virtual benchmark to diagnose domain robustness in visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.360992Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:755a200e1af8f75110c08b0a94425fb584964df20a01627d59c8331bb89eedb0","observation_id":"285d6ba9-b35a-448c-b8c0-b9ae15f66b35","resolution":{"observed_at":"2026-08-10T17:18:40.360992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-16T16:02:23.201218Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-10T17:18:40.365616Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.365616Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e273d19a68abf80291aaeee7201f2511210409a12b5b85f96b383ad65e7853ac","observation_id":"7408baa0-c25c-497a-9826-7969589fceff","resolution":{"observed_at":"2026-08-10T17:18:40.365616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-16T16:39:58.404449Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-10T17:18:40.380507Z","title":"CLEVR-Math : A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.380507Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:45ef14c64622137e1fc60c885dbe3a16c41361d829fd83fe8c4c75b00f45724c","observation_id":"a7d25e91-ad11-431e-b94a-e505c2517387","resolution":{"observed_at":"2026-08-10T17:18:40.380507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-10T17:18:40.418284Z","title":"Skywork-Reward : Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.418284Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:308dcba930ea6aa2b625cc3a51fe0215afdd3681924d25b5be9c7208d7bee257","observation_id":"e77e1440-cd08-48f9-ada1-a3249b3b1051","resolution":{"observed_at":"2026-08-10T17:18:40.418284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.479180Z","title":"OCRBench : on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.479180Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:50db9fa079226919e7ebe5e47b876646b7807f711ad562879f79cbcd9cf6d6c6","observation_id":"4881fd41-fa58-4911-8ffc-e987a128768e","resolution":{"observed_at":"2026-08-10T17:18:40.479180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-16T23:34:44.456187Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-08-10T17:18:40.522131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.522131Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:3d5e414166a08b929eaefe039df833ec6e6df984756d5b1e80c74494ddae5aa4","observation_id":"8995f9b6-2354-4758-aae2-58978eb21bde","resolution":{"observed_at":"2026-08-10T17:18:40.522131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16184","last_updated":"2024-10-21T16:48:26Z","snapshot_observed_at":"2026-08-16T22:01:21.418066Z","submitted_at":"2024-10-21T16:48:26Z","title":"RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16184","snapshot_observed_at":"2026-08-10T17:18:40.563918Z","title":"RM-Bench : Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.563918Z"},"links":{"cited_paper":"/paper/2410.16184","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e902dd999f66dda425983edfc346c2c8ac8262112fd548f557006b37f580de34","observation_id":"c25ada88-2319-46cf-873e-afa009daf17e","resolution":{"observed_at":"2026-08-10T17:18:40.563918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.568167Z","title":"MMBench : Is your multi-modal model an all-around player? In ECCV, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.568167Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:82c1c5e4742e2221f0c0c2c6031c83fef09bd44cdfaf32c5e12a876768022ac0","observation_id":"f488368e-1c0a-421e-b1ed-9a0c9a8a92ab","resolution":{"observed_at":"2026-08-10T17:18:40.568167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17637","last_updated":"2024-10-23T07:56:48Z","snapshot_observed_at":"2026-08-16T13:06:43.966520Z","submitted_at":"2024-10-23T07:56:48Z","title":"MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17637","snapshot_observed_at":"2026-08-10T17:18:40.575703Z","title":"Mia-DPO : Multi-image augmented direct preference optimization for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.575703Z"},"links":{"cited_paper":"/paper/2410.17637","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:6c74a41fc5b71c9b166cda6c225a9d1a5b78f7787344011343af38336a1e33a7","observation_id":"7a8cf238-711c-4185-a867-8e79beac2d7c","resolution":{"observed_at":"2026-08-10T17:18:40.575703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-08-16T13:13:39.851077Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-10T17:18:40.579427Z","title":"Uncertainty-aware reward model: Teaching reward models to know what is unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.579427Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:eef7d48fc2793a61c3f25e53ecb813f2b3a6d2fa8587980aa9ab485d04b0c58c","observation_id":"5b9f5248-de18-4fda-8e3f-797c009e6805","resolution":{"observed_at":"2026-08-10T17:18:40.579427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-16T20:04:49.795889Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-10T17:18:40.583349Z","title":"IconQA : A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.583349Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:6e418d6970ab1c9f0f06f67cc76f9863d3572f625a00e9c3ba62024c35533084","observation_id":"78288ff8-3bd9-472c-990b-3f5217db9ca7","resolution":{"observed_at":"2026-08-10T17:18:40.583349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.587351Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.587351Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e0e1ecb9b99d5cb18991fb31b5a1900f442b1e3925d80630865f849f2fa28bcd","observation_id":"3ad19d6e-c128-4786-bf34-099f23e33c51","resolution":{"observed_at":"2026-08-10T17:18:40.587351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-16T16:28:15.445578Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T17:18:40.590732Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.590732Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:c65b39a0a45f848645993dc963a3ae042b3591427da59e1254545f56b9e4cfcf","observation_id":"219b968c-698f-47ae-aa01-efe93dbd34e2","resolution":{"observed_at":"2026-08-10T17:18:40.590732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-10T17:18:40.594307Z","title":"MathVista : Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.594307Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:690bb856919f849d33905b09ee4dbec821bab65b5137d3da0dfa9410567360cf","observation_id":"7957d2ce-2237-420d-9ad5-bb17187ffd6f","resolution":{"observed_at":"2026-08-10T17:18:40.594307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.598612Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.598612Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:9fb873e0cdb6844a65250fd1c5e86e01bef7c67be8cd8ad1b22a4a3fee6b0438","observation_id":"cdc4050a-55aa-4029-b674-5a00e3cd283f","resolution":{"observed_at":"2026-08-10T17:18:40.598612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-16T03:42:56.050856Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10640","snapshot_observed_at":"2026-08-10T17:18:40.601712Z","title":"BlueLM-V-3B : Algorithm and system co-design for multimodal large language models on mobile devices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.601712Z"},"links":{"cited_paper":"/paper/2411.10640","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8b651bb2c0b2213606c6251f5900fccd421cb23b7a0a98aaee4993e35e25e0af","observation_id":"1efae7e5-581b-43bc-89f4-76ecca9cbd5e","resolution":{"observed_at":"2026-08-10T17:18:40.601712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-16T13:42:29.466840Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-10T17:18:40.604882Z","title":"WildVision : Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.604882Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:35781df6e8f75f13351b8cb0ca280bc6d3cdfbf71b532a70065d8c9808641e48","observation_id":"e949c44f-8a1d-4595-a56b-36ad88e827eb","resolution":{"observed_at":"2026-08-10T17:18:40.604882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T17:18:40.607907Z","title":"ChartQA : A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.607907Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:d4541cd5a9cccc900280910d2aaea18ff6d10f1dfbcdd8258e8748119d9e22db","observation_id":"b5b622ca-28c3-4b42-9a7c-22c64cb84bff","resolution":{"observed_at":"2026-08-10T17:18:40.607907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.610991Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.610991Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:74751a917804443a8caf786d3203c57fad6dce9be049a303504fdd075995ca5e","observation_id":"478c6912-1417-4b61-8c53-f9c31d908cac","resolution":{"observed_at":"2026-08-10T17:18:40.610991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.613542Z","title":"CLIP-DPO : Vision-language models as a source of preference for fixing hallucinations in lvlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.613542Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:149e11d9e8db38ef829711075bbc2ee40f702a8e65f014071f3d1b4900cc8969","observation_id":"20922ed5-4389-4107-afb0-163b5a88e166","resolution":{"observed_at":"2026-08-10T17:18:40.613542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.628592Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.628592Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:6960bfb82d79d2c4d0a067d5c1661d805a07f20dcf1a2f1bf8986d89de00de7d","observation_id":"875b6e08-ce30-4bf4-b665-dd00535debef","resolution":{"observed_at":"2026-08-10T17:18:40.628592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.679361Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.679361Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:4f1a3bd3303d4f1d2a453ab6f505a8e1869938051d070adb8f49dd9fce897ff0","observation_id":"de65f01f-f3d3-4c6b-844f-54778dde1ff8","resolution":{"observed_at":"2026-08-10T17:18:40.679361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01509","last_updated":"2025-03-20T02:49:09Z","snapshot_observed_at":"2026-08-16T13:38:01.678643Z","submitted_at":"2024-07-01T17:53:35Z","title":"MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01509","snapshot_observed_at":"2026-08-10T17:18:40.682766Z","title":"Mia-bench: Towards better instruction following evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.682766Z"},"links":{"cited_paper":"/paper/2407.01509","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:1b748cc41d8a1d18888fdb84096307ffe00979526c5099d0e90c9253df00550e","observation_id":"90818076-b40e-4a5c-b924-ee2dc2f1b00b","resolution":{"observed_at":"2026-08-10T17:18:40.682766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.686089Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.686089Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:2d043c62d3dc04ead9c4e10d8495a0f4cd1b3031cf29c787ec07aec8a9dd2dc7","observation_id":"30b34e5c-83b3-406b-9389-5919afe1a63a","resolution":{"observed_at":"2026-08-10T17:18:40.686089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.690249Z","title":"Direct P reference O ptimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.690249Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:66ff2def61dc9599ff56338e7a84abc32e361b7b7367309620886780da4e6a4d","observation_id":"436b17c0-ef21-4f14-ac51-d3522ffac504","resolution":{"observed_at":"2026-08-10T17:18:40.690249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T17:18:40.694381Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.694381Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:c757b385c51b79f274191fd39cd6d5397fd726742dd726b55ffe2613cadde161","observation_id":"57fcecd5-43c9-4c9f-b8b7-760c3e770cd1","resolution":{"observed_at":"2026-08-10T17:18:40.694381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.697547Z","title":"High-dimensional continuous control using generalized advantage estimation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.697547Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:c6ab92cc47b2e923060aed46d6644ef8c25351d87b3a69ba2552a0c6dc723b59","observation_id":"2aa2f087-19f3-4dc7-8096-2c346e092f35","resolution":{"observed_at":"2026-08-10T17:18:40.697547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.700334Z","title":"A-OKVQA : A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.700334Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:1752708e8de8247df8974910c6d36fe2d69b4f1b97dc9af38c4a1deeedd5b0d1","observation_id":"a4b4be7d-6b44-4480-99be-4062f0d309e7","resolution":{"observed_at":"2026-08-10T17:18:40.700334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.703155Z","title":"SenseNova","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.703155Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:9ef85f9c43ca9320af4040239dbc9f8beb4a6475c79444374de5c34a4e1838a8","observation_id":"11fe6856-b491-4455-a76b-99b7f905281f","resolution":{"observed_at":"2026-08-10T17:18:40.703155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-10T17:18:40.705967Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.705967Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:94d20fc9403c207bc501945e23b657a7f6e9acb28bf156f20c4b210962837165","observation_id":"20aac059-6c36-4088-b322-d116401722ea","resolution":{"observed_at":"2026-08-10T17:18:40.705967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.709141Z","title":"KVQA : Knowledge-aware visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.709141Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:30144ca602c835c286c4ef47a3770729aa4c1d4c41476c488d3dee1e14f5b0aa","observation_id":"ad5ce93d-80b4-4605-a06b-220c229a09d1","resolution":{"observed_at":"2026-08-10T17:18:40.709141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.712595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.712595Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:be722d4f588ef4af52f7475bf88d7955727837a278410becd246589231f1f474","observation_id":"60fdbdef-aa39-408c-bea1-f7f04cf74be7","resolution":{"observed_at":"2026-08-10T17:18:40.712595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.752880Z","title":"Skywork critic model series","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.752880Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:a84ece5f464640db46755c8c36c42bc68bfca67a0833f76d497d1e7da2757f11","observation_id":"fbdc80d1-d44c-4094-b355-3effe39c1038","resolution":{"observed_at":"2026-08-10T17:18:40.752880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:40.774050Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.774050Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:2e5280d6ca3218b6afefec85338138f237a62cabb37383c0b6bfe7302cc6ac80","observation_id":"f5edfb6b-7ae8-42c9-a183-44a3b654b76d","resolution":{"observed_at":"2026-08-10T17:18:40.774050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-10T17:18:40.819168Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.819168Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:06851d2c8c7740ea211586d509f3640c43a52ffb69153f96e4fe2290be521405","observation_id":"267e7d76-4d72-4135-a056-8a1a22a9c20e","resolution":{"observed_at":"2026-08-10T17:18:40.819168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17578","last_updated":"2025-03-29T11:50:10Z","snapshot_observed_at":"2026-08-16T13:06:45.631223Z","submitted_at":"2024-10-23T06:04:55Z","title":"MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17578","snapshot_observed_at":"2026-08-10T17:18:40.878653Z","title":"MM-Eval : A multilingual meta-evaluation benchmark for llm-as-a-judge and reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.878653Z"},"links":{"cited_paper":"/paper/2410.17578","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:5c67742d7510e826d707ceace54ade734ff55c85b145e5b92465c9262ef5274f","observation_id":"0cbd0ccb-bf5e-4f99-873c-1821f29e00b6","resolution":{"observed_at":"2026-08-10T17:18:40.878653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-10T17:18:40.924422Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.924422Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:a916912dcde733809c4be496df7d73c4698d98433c11356a0a495ff005f0e46b","observation_id":"e867eb92-46ed-4f6b-9234-3fac4742bcee","resolution":{"observed_at":"2026-08-10T17:18:40.924422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:41.042071Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.042071Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:3d42d3f27ec2937e201b3dcc1fd48e94599bb95f4c3075f8855e4a763996b3e2","observation_id":"98ce674b-7312-45ac-a662-cf2e0c98db37","resolution":{"observed_at":"2026-08-10T17:18:41.042071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:43.289658Z","title":"The llama 3 herd of models, 2024 b","venue":null,"work_id":"4d6286e5-a655-41da-8488-ce8fac6dc1b0","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.045129Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e9f0865a2cce503bdcb7b73d236b26484c094e9261418d424fea228f2675c085","observation_id":"039d1596-53f5-4aa0-b7bd-4e749315c2df","resolution":{"observed_at":"2026-08-10T17:18:43.293231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:43.279092Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024 c","venue":null,"work_id":"223d6fa3-1e3d-47e0-9df4-b999ac93d071","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.048480Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:630bfbaea7be03b2bdef52ec6ca4e523ffd3853b06d4924b11e0dc6d1f3febea","observation_id":"1271437d-7acb-49df-90eb-120a72575184","resolution":{"observed_at":"2026-08-10T17:18:43.282973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-10T17:18:41.052281Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.052281Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8f8747814d430c5681550ff8922331115dd26f1966f3cd717c1b04848b86ef74","observation_id":"6d858170-afe5-4fe8-ab8c-005917015ef1","resolution":{"observed_at":"2026-08-10T17:18:41.052281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12109","last_updated":"2025-01-31T14:30:07Z","snapshot_observed_at":"2026-08-16T13:24:43.757694Z","submitted_at":"2024-08-22T03:49:18Z","title":"RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data","version":2},"cited_work":{"arxiv_id":"2408.12109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.12109","snapshot_observed_at":"2026-08-10T17:18:41.939951Z","title":"RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data","venue":"cs.CV","work_id":"bf1c0a50-17f5-4a9c-94b5-f75741055387","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.056178Z"},"links":{"cited_paper":"/paper/2408.12109","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8087ff35866b565a2f8933464b6c4caa04120c481e204e57463d286158ad67a4","observation_id":"5d005002-d81d-490c-bf4b-5ddfabecd607","resolution":{"observed_at":"2026-08-10T17:18:41.947365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-16T13:41:43.608449Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-10T17:18:41.059884Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.059884Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:96b2e444b2313b3911ab1b2b6d749c09c636982701802e2eca8e13bf0f9af746","observation_id":"e7092d19-35bc-4643-861b-ceaa4b504d6c","resolution":{"observed_at":"2026-08-10T17:18:41.059884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-10T17:18:41.063611Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.063611Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:a5c09b001185a5dca3b17351b4b9c0ab37414f842a2392950324052b38848575","observation_id":"26683e97-4e56-44a1-b3be-b18a534c2d7b","resolution":{"observed_at":"2026-08-10T17:18:41.063611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T17:18:41.067215Z","title":"Qwen2-VL : Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.067215Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:abe8541eb8a7b6da301e4108217399d617e217720353e9faf81985df31901212","observation_id":"cb318e60-307e-4a39-9f51-7a5e4e143791","resolution":{"observed_at":"2026-08-10T17:18:41.067215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-16T13:28:23.560818Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-10T17:18:41.070735Z","title":"Self-taught evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.070735Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:9c2784d34e9f1f6d379cef97823ef84b146b2bbd6cc7436e1955afb45b1948e5","observation_id":"41efb4af-7311-4954-9367-87bf666197c7","resolution":{"observed_at":"2026-08-10T17:18:41.070735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-08-16T13:13:30.091783Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-10T17:18:41.073776Z","title":"HelpSteer2-Preference : Complementing ratings with preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.073776Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:99311720833ddc5613678cc81bbe3f6975e12a6431d3448c76cc99413df08b0b","observation_id":"29e9a852-64f1-484d-8d9a-abe2624e34f2","resolution":{"observed_at":"2026-08-10T17:18:41.073776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:43.131727Z","title":"FunQA : Towards surprising video comprehension, 2024","venue":null,"work_id":"c11ac7c3-cd74-411d-b782-30b1ca0ee480","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.077019Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:c6d5e60ef2a17ec2c6d4ee9cfa032ea16a29f9da539081e35864c9be24962875","observation_id":"f90cb740-cdbf-4b82-b858-58f83c056816","resolution":{"observed_at":"2026-08-10T17:18:43.191462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-16T13:12:52.288371Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-10T17:18:41.080692Z","title":"LLaVA-Critic : Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.080692Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:be03c89e7ad87d67e046223c2a2212582ac10108daf843f7f35068de06707070","observation_id":"e6dbfc2c-f213-427f-ab31-493ba0e3dfa8","resolution":{"observed_at":"2026-08-10T17:18:41.080692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-14T19:57:03.409333Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-10T17:18:41.089878Z","title":"Scaling inference-time search with vision value model for improved visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.089878Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:5ac673376bda5e7375eecd477c80e737e767cc9382e3fa6b0cce03329e242a1a","observation_id":"e1cacfed-d5a6-4c9a-857a-9f80a2ba00dc","resolution":{"observed_at":"2026-08-10T17:18:41.089878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:42.962621Z","title":"SUTD-TrafficQA : A question answering benchmark and an efficient network for video reasoning over traffic events","venue":null,"work_id":"bef7a148-6922-43d9-a560-f041f9387d70","year":2021},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.145353Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:a41f699470678a0d1ee43ef33fc158534cf188b487fd1d00768e8ecd934f6d1c","observation_id":"7a82b675-5cce-414e-ab4f-4594492fb324","resolution":{"observed_at":"2026-08-10T17:18:43.093560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:42.829977Z","title":"Inf outcome reward model","venue":null,"work_id":"9ddf9a59-4adb-4f95-9ed9-5ec36ade9ebf","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.199723Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:715bdcd228023f2f94361974d102e96debeb40f8fe14b6f71564da719d9981f8","observation_id":"731f932f-5711-447a-83bc-95fbdd1e9fd8","resolution":{"observed_at":"2026-08-10T17:18:42.898205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:42.800378Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":null,"work_id":"e704b222-e7db-4855-9d78-6b79d6ea6cb6","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.269132Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:d8f79224bd1db61a4286d5c4b3ebdf336aa292c871d89c186eb0d9e831cf7025","observation_id":"0a0836de-eb21-4637-92f4-08c00797e542","resolution":{"observed_at":"2026-08-10T17:18:42.804105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:42.789076Z","title":"MiniCPM-V : A gpt-4v level mllm on your phone","venue":null,"work_id":"807251d5-8376-44ee-bd96-646d6afcca81","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.272937Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:e2bfae50d4a95c1463bc31186cd3b3505fc5817dc308810daef363a32a2dd29c","observation_id":"adf2a856-1306-4899-b6f5-f6335a026060","resolution":{"observed_at":"2026-08-10T17:18:42.793363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:18:42.778518Z","title":"RlHF-V : Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"f5497c5c-c336-463c-9011-ed74628d1f79","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.276230Z"},"links":{"citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:4e4a64e1a0ec587fb424be3ce9d5017a9493585a118d4694cbd1a67335125eb5","observation_id":"a2b79ee4-74e8-4746-80e5-7c071fa66362","resolution":{"observed_at":"2026-08-10T17:18:42.782420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 21 inbound Pith citation observations for arXiv:2501.12368."}