{"as_of":"2026-08-04T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b612494ea646115f7084441b34d564926f8a67ceb79f037106676a1b51a61747","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:41:44.833354Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09269/citation-record","integrity":"/paper/2605.09269/integrity","json":"/paper/2605.09269/citation-record.json","paper":"/paper/2605.09269"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:3bcca07ab6d96b1506e71a7093b5b696c0f47c6ba13654efcd8f09fefa071435","observation_id":"5879cfb6-b351-4b6a-a0d1-f3a6e905a593","resolution":{"observed_at":"2026-05-12T06:01:24.295028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:b0717b613ab552895e59fdc9487cca54c0d8fdb20f303fd563b6f072928ccf77","observation_id":"0c62d594-07ab-4aa6-b87a-64e137cbb3ef","resolution":{"observed_at":"2026-05-12T06:01:24.603346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as- a-judge with vision-language benchmark","venue":null,"work_id":"2325c155-e4bb-4712-9b17-ab1176282955","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:e61a1897901cf990908291cd32c0fd36bf3d0da1c11bbdca1aeec9b740da9ff7","observation_id":"beff6b32-0c4e-4e49-913d-7aa713cb5529","resolution":{"observed_at":"2026-05-12T13:56:36.703241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f8182f9a-3fa1-4456-8c6f-cc0883e2db6b","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:51b10c7503b7508df9a873355d89fdf4c0330040274e0191ebf4fe19de604766","observation_id":"721fd5d2-f459-4a16-bb02-45c142a95eb7","resolution":{"observed_at":"2026-05-12T13:56:36.684737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:fdc7c5e8a79494d70116a4434de87038f63494d6c02e6ebab84bdd014d4f8d66","observation_id":"9d32ec0f-a3ba-43e5-bbd1-5de9823bc9c3","resolution":{"observed_at":"2026-05-12T06:01:24.281809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:96e9eaff826edb98f327a60c8afc7ccff76921b3d4b81a1480a69d1e60caa259","observation_id":"e76484cd-742b-4f30-89b0-7804273f59ea","resolution":{"observed_at":"2026-05-12T06:01:24.444129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:26.457128Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence","venue":null,"work_id":"b5a5843d-47c0-432e-88d5-c9eaac555a7f","year":2026},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:f00043e8510d7d7afb03a551161574d83e5899b5df787a0184f99d336be860d9","observation_id":"63e8f2bc-c183-470b-a1c6-d7a81ff910b5","resolution":{"observed_at":"2026-05-12T13:56:36.698451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.175131Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models","venue":null,"work_id":"82bab183-1c79-4673-9bd9-d609312d9127","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:bc5c4bcaccc4c75288dabdbf22707c0b8e3656bf561337caf9eebbe7ba61743d","observation_id":"4a7e8e15-c74a-41b7-9da5-85144ed0bd88","resolution":{"observed_at":"2026-05-12T13:56:36.692834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arm-thinker: Reinforcing multimodal generative reward models with agentic tool use and visual reasoning","venue":null,"work_id":"1d33f4b0-de71-411a-9ec9-358b038fa3e0","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:999aff7564ad7ebef4adfd493d85833dbbe33406fa7159ef0db84fccbc94d3bb","observation_id":"e557804f-5c5e-4380-88d4-25009bd235b7","resolution":{"observed_at":"2026-05-12T06:01:24.429052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":"2501.01957","doi":"10.48550/arxiv.2501.01957","metadata_source":"pith","pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":"cs.CV","work_id":"510354f3-222a-48da-bda9-96a2df30bb68","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:884e6452b782e08b885387936dbb347a8f850fede89880d8a889d95c1b1ea4a5","observation_id":"0c44c035-3c16-4f7a-b0ea-0d993eedbdd5","resolution":{"observed_at":"2026-05-17T21:08:19.955297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:7d54b8417ee40ec36d92d32313d4f02c2fe7e02fc65601df3f574a5a244c02c7","observation_id":"cf011423-04e0-46e1-98c8-978acf86f2a8","resolution":{"observed_at":"2026-05-12T06:01:24.506738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:2ac912d17b78f2daea0c761ab4dbfefff39f615f1ad92db01dd8b62813cd8564","observation_id":"b3e0c731-125b-405c-851e-0013630e2485","resolution":{"observed_at":"2026-05-13T06:07:56.884714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:9290f7ddd663512338964f6477f478f4113bb0b81e654299d20cbf084a26ba3f","observation_id":"d5b69159-a3cd-4b4d-9d6c-41c5f44e20e6","resolution":{"observed_at":"2026-05-12T06:01:24.470450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"3e7257ce-66e1-4b32-bd24-65433f76c182","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:3a78e577edd9c3dab6e622e0318fd7f78bd4fd635f86d3bb93cdda51d7a393c0","observation_id":"523982d0-2968-4c72-8130-c3fd81a068b7","resolution":{"observed_at":"2026-05-12T13:56:36.734575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-07-06T22:14:21.107961Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:5dbacbf33a27d7461c794cf077d73450ea560165b36075bcd84c961dc5e1f582","observation_id":"51564e78-31fb-4dc0-a3a0-559410604284","resolution":{"observed_at":"2026-05-12T06:01:24.455347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14738","last_updated":"2026-04-18T22:41:52Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T14:40:02Z","title":"AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":"2510.14738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14738","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning","venue":"cs.CL","work_id":"5f1b48ba-9e2b-403a-9bb9-3eda09671dee","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2510.14738","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:16eecc739748e72f829ecb0eb2545eeba562cf58b6c5a6f811fc5b045b43ced3","observation_id":"19145b6f-a13f-44a0-93dc-15ecfaa5f144","resolution":{"observed_at":"2026-05-12T06:01:24.590349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models","venue":null,"work_id":"c6f7f7b4-8a70-41d4-9e95-6987fc49ba3a","year":2023},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:bd835c3ed60f721df132533bcda2193a071ef2c4011d73c97ffa514f46264bf5","observation_id":"b220222e-417c-4acb-87c9-4d0357f2f929","resolution":{"observed_at":"2026-05-12T13:56:36.756042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-04T23:27:39.749680Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":11},"cited_work":{"arxiv_id":"2504.12501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12501","snapshot_observed_at":"2026-07-10T10:37:01.560058Z","title":"Reinforcement Learning from Human Feedback","venue":"cs.LG","work_id":"3549c6b0-ffea-452c-ada3-ea7744fe6d2f","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2504.12501","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:cbbd0e90a1a08668ca304cdc315ffebb928f85a01be2ec59c9d29c992171171b","observation_id":"fd478e17-5cc3-4e11-a8ca-58fdda61b457","resolution":{"observed_at":"2026-05-12T06:01:24.420238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:1341c682d650ce757f73433aaaec817085fdbadeb9a2b03b49a60578848c25ac","observation_id":"f597b9fb-6654-4b1b-8dec-2bf762075d70","resolution":{"observed_at":"2026-05-12T06:01:24.260624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.262041Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":"88bb8269-395a-4ea1-8efb-39cba2e8c436","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:44acf1105a5fc3c8aca419a969b70b563885424bd3a49117801f41f269d36a20","observation_id":"aeddf4f5-023a-4ad1-84c9-aed1bc01d76e","resolution":{"observed_at":"2026-05-12T13:56:36.769381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-rewardbench: a challenging benchmark for vision-language generative reward models","venue":null,"work_id":"e1215073-8f60-4c12-8d6a-804d65f95f1e","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:c9b93050a79aae00360b06fb8420044e816cead22f5fd910af1c7ede3343b576","observation_id":"c46d7b98-661c-4377-80a2-e04da4941c49","resolution":{"observed_at":"2026-05-12T13:56:36.751702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:9e3c5e2908527e378e5aac234b1cf0b116eefc5983b67496d248893b5cef2cbd","observation_id":"ca736119-30ee-4cae-9c82-f376cb704189","resolution":{"observed_at":"2026-05-12T06:01:24.251497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.404131Z","title":"Stable and efficient single-rollout rl for multimodal reasoning","venue":null,"work_id":"73a31322-9e67-40d3-8e03-0d781eb8fa65","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:33cbdb342e90048e1432732fa32630e8613f216be4ded7a37ee11fc562ee4c45","observation_id":"725f7bef-73d7-4d9a-b52f-75d9f9a78d84","resolution":{"observed_at":"2026-05-12T06:01:24.216769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:39:46.072456Z","title":"V ogue: Guiding exploration with visual uncertainty improves multimodal reasoning","venue":null,"work_id":"68f80ef3-f364-4bb2-9193-83ea68d5b8da","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:f09b9fdabb33b01e992674f721a236969342dbf82a035e48b56455f1e05491ec","observation_id":"32e8f812-a10f-45f5-9af5-50317690d48e","resolution":{"observed_at":"2026-05-12T06:01:24.388524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07743","doi":"10.48550/arxiv.2510.07743","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2510.07743 , year=","venue":null,"work_id":"b59a07ee-6a84-42cb-8d41-9b665841aa2b","year":2019},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:a66a4abccc6016fe14d8701c760d4eab3174facf246b618bf8c33a799d2707b4","observation_id":"aef104c3-1531-41d6-8438-dfae74c1807b","resolution":{"observed_at":"2026-05-12T06:01:24.242097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/scirobotics.aaw1329","metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:20:47.132190Z","title":"Decoupled weight decay regularization","venue":"Science Robotics","work_id":"b15de20d-9c9e-44eb-8eea-5179244ece5a","year":2019},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:5e9ac61f016dc2de848d870414b1530b359568c8ecf3f8b9fb617ba1d7ddcba8","observation_id":"b6efb9dc-d12f-432a-9d13-b20f05622242","resolution":{"observed_at":"2026-05-12T13:56:36.765087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:fe8033e283eb7511be2b5113db9b64ca2391dca8c2b4aee52968eaa60e5181db","observation_id":"2603bb94-aa15-46d5-abb0-9e2a6b308547","resolution":{"observed_at":"2026-05-12T13:56:36.743511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:50.108470Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"5d2e1082-e73f-4c1b-a18c-bf0ba1772c23","year":2023},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:3f9c424979866f7fa3228b08c6cbe88dab3a833885ee84a58e1247bc0ed40548","observation_id":"21ac7b83-9bd5-4d5b-8aef-b8f8d329fa74","resolution":{"observed_at":"2026-05-12T13:56:36.717473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:b004b518ecd55663363f1c3d67ed33f239a2f7fb9b568b0fb789933d103872dc","observation_id":"ef7f680b-328d-47bf-a816-051e1af342cc","resolution":{"observed_at":"2026-05-16T20:25:41.981797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:91b65a9e11589c0e851be3a6477502f1682ada9cf88c063318e0b9150a51ef15","observation_id":"e5ff6404-54a1-40ab-b09e-c11afc607563","resolution":{"observed_at":"2026-05-20T00:00:28.487879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:101bee91512fad3a9aa1d37745cfc3458304e1f35350b51715d513bd539493a8","observation_id":"d852f360-6bb7-4d8f-a8a5-d40d39f39964","resolution":{"observed_at":"2026-05-12T06:01:24.366769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10885","doi":"10.48550/arxiv.2602.10885","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2602.10885 , year=","venue":null,"work_id":"5d8fc15f-7645-43a2-a321-8f789d8d2d56","year":2026},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:bddd51e6139e146ab3f9dad184c99970b0ffdc6e411e9f645541a6950ede707e","observation_id":"932d95d9-3453-4e4a-85e8-5af2d9cf89d8","resolution":{"observed_at":"2026-05-12T06:01:24.271966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":"2310.03716","doi":"10.48550/arxiv.2310.03716","metadata_source":"pith","pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A long way to go: Investigating length correlations in rlhf","venue":"cs.CL","work_id":"23d0dfe6-c919-4498-8696-1e298c7834e9","year":2023},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:211f7967f314fafe242ca02c0892212cc8cff7360a40d05c72b366908bc21ef1","observation_id":"da880bd9-6413-4078-b427-eb13109afe13","resolution":{"observed_at":"2026-05-12T06:01:24.374651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.724944Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"1c12808e-17ea-4f7d-9d9a-b8fec0b803a0","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:6218f37164b296a708062fdcd6b5e5c83110b75fc06a7512f3b4b56da57ffddc","observation_id":"ff946a35-3462-4f25-afcb-daa9f650cf43","resolution":{"observed_at":"2026-05-12T13:56:36.707894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ReFT: Reasoning with reinforced fine-tuning","venue":null,"work_id":"9831e4f0-7150-4eb0-b329-13c8b293030b","year":null},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:13937cc0b218cdb48dc7973215e37742acf85cc8217aafc044d4b5d121b57820","observation_id":"3517bce8-c0c5-4222-a544-0919d999f018","resolution":{"observed_at":"2026-05-12T13:56:36.712808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.410","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:02:01.421191Z","title":"R e FT : Reasoning with reinforced fine-tuning","venue":null,"work_id":"336896b7-87f2-42e9-bc33-af3376adccf7","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:392e57ed4bc621560d5ea19c62aa329ce0064950d52071f42da0102ddd598681","observation_id":"74e056fc-f5d1-4b6a-9dc0-272562497052","resolution":{"observed_at":"2026-05-12T05:16:23.874409Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.18624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:07:56.281064Z","title":"Chenglong Wang, Yang Gan, Yifu Huo, Yongyu Mu, Qiaozhi He, Murun Yang, Bei Li, Tong Xiao, Chunliang Zhang, Tongran Liu, and Jingbo Zhu","venue":null,"work_id":"abc3554a-fc47-41fe-9ec1-6b7611921c63","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:904279925af031259ac7acd611d145f5ef9d6190a3b5a7c7eabdf34a4b528e57","observation_id":"813ab63e-583d-4ddf-9d75-735ff016222d","resolution":{"observed_at":"2026-05-12T06:01:24.401201Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msrl: Scaling generative multimodal reward modeling via multi-stage reinforcement learning","venue":null,"work_id":"8912e2ac-3457-46dc-b3f4-b4eebeddd6cf","year":2026},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:21fafc29072a2c0c970f79fc0140fc1af162359f63c6ce755ab5113e7243edf0","observation_id":"12b6094e-4cc1-4e5a-ae09-2b5122137a63","resolution":{"observed_at":"2026-05-12T06:01:24.484234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03318","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:55:45.279626Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine-tuning","venue":null,"work_id":"8167d0a3-c6ee-498c-88f6-0a5757a3a9e3","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:4dfa45b02e797ce448303544dcfad0752d4436c68de91b111570e18b86d8fdd2","observation_id":"af2cc219-e8a8-4cc8-9b79-1180bdc3fa53","resolution":{"observed_at":"2026-05-12T06:01:24.410905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.595164Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a3ac3b4d-8c58-4772-ad55-18e8fb162bd1","year":2022},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:da491711b8c6c896134f159274363f9228fcc481fe4a5c46bd3eac471fa97966","observation_id":"4d4cfac3-a999-46fb-9a3f-a68183138aa6","resolution":{"observed_at":"2026-05-12T13:56:36.760409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":"f26d94bf-1d39-4025-8a8d-6a38f472572a","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:36cbb3e6148946fb08e2c28023f6d66bc3a1d7006ef3c3b4011bd36217437ee3","observation_id":"48325d23-b0ba-4b51-82cb-733e2e0cf397","resolution":{"observed_at":"2026-05-12T13:56:36.747646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:38.647682Z","title":"arXiv preprint arXiv:2602.01511 , year=","venue":null,"work_id":"e335e839-8b57-4dd7-9e80-eea9b45fff33","year":2026},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:26f386e60c5bac5d1113c1b96add700c2b15ed395d56f522709d6b5c24b0c50f","observation_id":"880f99d9-7df2-4c46-89cd-d2a57caebb1a","resolution":{"observed_at":"2026-05-12T06:01:24.573347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-07-06T20:39:33.620222Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2502.14191","doi":"10.48550/arxiv.2502.14191","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Multimodal rewardbench: Holistic evaluation of reward models for vision language models","venue":null,"work_id":"bc36790d-ed2b-48af-a57b-4a8399efb59a","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:4bc9dde095814e63f6a4c536f29bfcee5b0281c5aa1d453630c133e9cef14cf2","observation_id":"5a2bc0ff-d920-4e03-8077-660d03fc6295","resolution":{"observed_at":"2026-05-12T06:01:24.318015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:d07e7b6e3c4693173d3f1a599da58effaa1170b59d99d544901ef4bae13f2008","observation_id":"90fb2227-de76-4f6c-9864-882575feae60","resolution":{"observed_at":"2026-05-12T06:01:24.303618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"09df2f6c-8958-4be6-bc34-69c90c5d4961","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:6568910cc6e88182fa78f9d3d96001782db255402476239e713a369f6cb475f4","observation_id":"0a3fb8f6-bc8a-4139-a563-448799a4da7b","resolution":{"observed_at":"2026-05-12T13:56:36.730161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlaif-v: Open-source ai feedback leads to super gpt-4v trustworthiness","venue":null,"work_id":"f6be57eb-5be1-4c4c-9c8e-e0d80c3246f1","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:0aa9ea5c06d3481bec8a661027628d421e9900906d9d347ea65ab1b977256184","observation_id":"bc0a6206-20c3-414f-b6fd-b9c53bd5925a","resolution":{"observed_at":"2026-05-12T13:56:36.721727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11943","last_updated":"2024-01-22T13:33:53Z","snapshot_observed_at":"2026-07-06T17:18:44.456380Z","submitted_at":"2024-01-22T13:33:53Z","title":"Benchmarking Large Multimodal Models against Common Corruptions","version":1},"cited_work":{"arxiv_id":"2401.11943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11943","snapshot_observed_at":"2026-07-04T13:19:50.433054Z","title":"Benchmarking large multimodal models against common corruptions","venue":null,"work_id":"5c0dae25-b3fe-4380-8b4b-e826d514b26c","year":2024},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2401.11943","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:070d58ae529f0d97bca8d6c3c8bc2770c0ed09c64ca6070bb2f880648f13c2c0","observation_id":"26517c6e-f81a-43aa-95a6-ff49946f9574","resolution":{"observed_at":"2026-05-12T06:01:24.267389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-07-06T21:19:14.621187Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:5b5dfd7c59906fbd980e5c70505080489968c2b132ae284e93316feb6c5b5468","observation_id":"a04a95b7-c373-4b04-8db4-ace8ef5aa026","resolution":{"observed_at":"2026-05-12T06:01:24.224742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-07-06T20:36:45.378436Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:107d6e43d0c17c8f883d8f3c115e8abfd3759decbe0555c55bd41bd8302a4d9a","observation_id":"6868191b-257a-47b9-9050-a49334d09a96","resolution":{"observed_at":"2026-05-12T06:01:24.331700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Basereward: A strong baseline for multimodal reward model","venue":null,"work_id":"52ddd5af-a81d-436a-a047-658b28f38465","year":2026},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:03e6ed147dab743535f5671cc14bf326ba03b9f5b60806dc4a0ba552e120e197","observation_id":"787fec71-615b-40f6-ac3e-5b0818cb4e29","resolution":{"observed_at":"2026-05-12T13:56:36.773460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:56:18.729506Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems, 36:46595–46623","venue":null,"work_id":"b509e457-b4ed-40f1-a7f4-893bc84cf1f1","year":2023},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:3bbf851d5b6afddd7ca18f21f86748006070585f668c845510e9e627f4d52905","observation_id":"2cbe5227-9cba-44b3-a2c2-257944ce121e","resolution":{"observed_at":"2026-05-12T13:56:36.726088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-04T21:28:47.405179Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:aa27c6655eef5fbb785b43bb88e173614b2337f799692c9f9da4540b10b0b563","observation_id":"cca0ac9b-fc25-41ba-a2b9-ef19002ac348","resolution":{"observed_at":"2026-05-12T06:01:24.337093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":"282d4413-fa01-423c-8948-1519ed415968","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:e5f48cff855ba8ec57d382a73aa26b11438e6fff1cb3c0d4453ab654b667f1a7","observation_id":"1e6090ce-cd54-4a0b-a880-4601e42475f1","resolution":{"observed_at":"2026-05-12T13:56:36.738458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-07-06T21:10:31.989050Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":"2504.12328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-07-02T05:46:41.076602Z","title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future","venue":null,"work_id":"66d2bc8c-9efa-4c86-b7b3-262ebc90877f","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:5b64e81e87c8e3ba1bf6ca85a4c0003c851c46e71c20170f66070c6d27710149","observation_id":"35a22826-9bed-4c54-ad0b-4b26450c99e0","resolution":{"observed_at":"2026-05-12T06:01:24.230952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-11T03:17:51.831519Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:57ee01870f37a4044d4e0c8dfeafaf027793531ddd559b7ff28db3cb4361cf8c","observation_id":"ec9d4ab1-8589-4aa9-b5f2-0a0bbd25eeec","resolution":{"observed_at":"2026-05-12T06:01:24.379421Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07fb5f9c-6b82-4885-b427-bc568c2e643b","year":null},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:175d02614a2b35576dbf29b474e3528cde0a89eaee4a657ddc8116a07289a868","observation_id":"d5b12c00-4a40-4616-a19e-63b611fcaced","resolution":{"observed_at":"2026-05-12T13:51:38.004569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"690f1c53-ffde-408e-986d-bc3f2c65ad4e","year":null},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:16986c4610361739760a38e35df8a38bb0ddcd5ee44c8f9cabe2bd08495dc128","observation_id":"e78a21ec-1ec1-43fb-90d8-845a7129140c","resolution":{"observed_at":"2026-05-12T13:51:37.989158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7e1b2340-17a8-47cf-b038-88931dd61141","year":null},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:6efe1b6a09456d903e809d2b5c8e8412b688571e8f2ecad684adf0355bbe3b5b","observation_id":"c6a62fd2-3ccb-4bd2-89ba-9697b5d693f2","resolution":{"observed_at":"2026-05-12T13:51:37.994662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7411ce86-4505-4490-8536-d3b3b1b1a7ac","year":null},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:aa2576ac1525d5cf318ff15719433162426c55af770a17a8f2ca81375cce4cc0","observation_id":"2e9dfcfa-35b5-45ec-b8c7-8c690445f80e","resolution":{"observed_at":"2026-05-12T13:51:38.000376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeltaRubric Evaluation Prompt You are a fair judge","venue":null,"work_id":"e324cb6b-3658-4ccd-af21-938f2e3fb51b","year":null},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:b2520946f534dbb3b4116f04e1b2890ac99ddabea240bde4d4b6024069bb951a","observation_id":"1dab923f-89f5-464c-a8db-e70758b72d13","resolution":{"observed_at":"2026-05-12T13:51:37.984268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":4,"verified_exact":32,"verified_fuzzy":21},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2605.09269."}