{"as_of":"2026-08-05T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:740efc8dac63635af9c2ceb5882cb79829d216eacf46e709f229657496cbad2e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T21:03:31.606674Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:28:49.329292Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:38f10bdda9a04202cb98357929f695273393ee4a3231ea21a3a7ea4b57c0c052","observation_id":"2eafd2e8-7aed-48ad-a766-753d8f68af19","resolution":{"observed_at":"2026-05-18T19:21:48.797520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-04T21:28:49.329292Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-04T21:28:47.405179Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.329292Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:339e8feaeee63589e4d8a12d614dcc9bbdd73b2cd195f3c1c81a3734f20b8528","observation_id":"af4ec024-5037-42b1-81e7-713b7e716b3d","resolution":{"observed_at":"2026-08-04T21:28:49.329292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-04T18:53:02.707977Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.707977Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f7055bb0f3779c1a060621b9357925cd51fd22f8b6033fa319915fdd713662de","observation_id":"b36915be-0427-4923-9bf1-971eaa09ee47","resolution":{"observed_at":"2026-08-04T18:53:02.707977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2509.20912","last_updated":"2026-05-21T02:54:31Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:58:10Z","title":"DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T22:35:36.136639Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.20912"},"observation_digest":"sha256:af22ae8ba3db53dbc3b630f59f65320047b69b309ec8eb33b4ab16017d0830bb","observation_id":"d84ad3ba-d1df-450b-b707-2ee2ae46435e","resolution":{"observed_at":"2026-05-21T22:35:42.650352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2509.20912","last_updated":"2026-05-21T02:54:31Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:58:10Z","title":"DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:36:06.229352Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.20912"},"observation_digest":"sha256:11f67d46d98503893998f576bfdfd061ac729953a8fc998a098a1262e176f589","observation_id":"bcd44945-aecd-4afd-8a2c-2b81dfa37b58","resolution":{"observed_at":"2026-05-22T13:36:35.958576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-07-31T14:35:45.739240Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:9ebe3a9991ec5c50b8ee89062cf6b4a442738968f7411a477928e74ef707e5d4","observation_id":"2c6590ce-6977-40c4-a451-9f9dda7cdd27","resolution":{"observed_at":"2026-05-17T22:25:22.650022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-03T21:09:23.052942Z","title":"Self-rewarding vision- language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-03T21:09:20.139311Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:23.052942Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2511.16672"},"observation_digest":"sha256:7107ec6a984e6f778d3a533c0ffd0c0b0ed56ff3bf89756d326361d451120899","observation_id":"cd83fee7-a67b-43c8-a9ed-008127e27ec1","resolution":{"observed_at":"2026-08-03T21:09:23.052942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-03T20:23:04.725008Z","title":"Self-rewarding vision- language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.725008Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:279da520074439caf6637b65dce71d46b460ba2b207153a168763296a4bd5c7f","observation_id":"9ea4dfa3-11d9-4158-9b50-b17e8074ccdc","resolution":{"observed_at":"2026-08-03T20:23:04.725008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-03T10:10:54.216618Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11178","last_updated":"2026-07-29T14:55:28Z","snapshot_observed_at":"2026-08-03T10:10:53.063766Z","submitted_at":"2026-01-16T10:52:12Z","title":"TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T10:10:54.216618Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2601.11178"},"observation_digest":"sha256:988f66192c8b985929273a06ef4112493b16ca38d30cbdb5d007e3b36ba23c47","observation_id":"d62a3ddf-6928-4790-86fb-d5dc65b530b8","resolution":{"observed_at":"2026-08-03T10:10:54.216618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-02T20:19:14.531269Z","title":"arXiv preprint arXiv:2508.19652 (2025) 4, 7","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23615","last_updated":"2026-07-08T09:59:15Z","snapshot_observed_at":"2026-08-04T03:41:58.938743Z","submitted_at":"2026-02-27T02:43:35Z","title":"HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:19:14.531269Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2602.23615"},"observation_digest":"sha256:59ff3aed3b765bd246beba24ba1c1b05eb8991a8f5c24fbd4181f37995a3c5d1","observation_id":"1b94b329-7fd3-4851-b138-f5d515deb13f","resolution":{"observed_at":"2026-08-02T20:19:14.531269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2603.01993","last_updated":"2026-05-17T10:26:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-02T15:45:33Z","title":"Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T11:16:30.368440Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2603.01993"},"observation_digest":"sha256:eb15d22fafa111f7123a59b750150d106351c980967b15ab676caeacb944b6a0","observation_id":"81a68ae1-201e-4c4b-aef5-0b97f88d6cca","resolution":{"observed_at":"2026-05-21T11:20:02.501807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2603.24935","last_updated":"2026-04-07T10:20:22Z","snapshot_observed_at":"2026-08-02T05:07:12.659001Z","submitted_at":"2026-03-26T01:56:01Z","title":"SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T01:06:42.421062Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2603.24935"},"observation_digest":"sha256:21072b41f971354717af14a79a235bbb1cadf9aafc5c8df6af3ce5507323dfa1","observation_id":"514393f7-012e-4e33-abb1-d27bd40f88ef","resolution":{"observed_at":"2026-05-15T01:08:25.727193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2604.02467","last_updated":"2026-04-27T18:17:15Z","snapshot_observed_at":"2026-08-02T13:43:39.563153Z","submitted_at":"2026-04-02T18:58:56Z","title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T21:14:42.021240Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2604.02467"},"observation_digest":"sha256:42e322f6afb0647a71c06ea1d4d57038e8ad042b18c5b8840e8c6ec83fe7f746","observation_id":"632d624b-3df6-4891-b991-456f302384e8","resolution":{"observed_at":"2026-05-13T21:18:17.211861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3aea157c3cee12483af04874ca06241f5186c1ba8fa9a7b46e2c8f4a44802ecb","observation_id":"62c89ad5-fd68-4c0f-af40-27ecefbed93c","resolution":{"observed_at":"2026-05-10T14:00:28.148434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2604.18320","last_updated":"2026-04-20T14:20:44Z","snapshot_observed_at":"2026-08-02T05:38:32.357591Z","submitted_at":"2026-04-20T14:20:44Z","title":"EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T05:23:45.814042Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2604.18320"},"observation_digest":"sha256:c256b0d2ecedaf123c83bcdbe247824a3ab86fc25f538d25addccbad9e561315","observation_id":"b2ca0511-8271-4181-8935-f98229babc5f","resolution":{"observed_at":"2026-05-10T05:25:54.882531Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:35166993c47edfb1aa39152af9e3bce85b2be1faf30beadde4d87c2f5cbd9e53","observation_id":"4608f550-acd6-40c2-ad73-24abc60bcef4","resolution":{"observed_at":"2026-05-10T05:36:02.006979Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2604.20987","last_updated":"2026-04-22T18:17:17Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T18:17:17Z","title":"Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:07.017420Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2604.20987"},"observation_digest":"sha256:a5f7dbb1f169153d5641fc8bcb1c28d48ec8781654438e4686f5dfa454831a7a","observation_id":"25cba037-6055-41dc-8be2-e261c579c7e2","resolution":{"observed_at":"2026-05-10T00:14:46.441646Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:40bad4b8e2f2f265ea595787f15155855724214449eca6579d65474722dba963","observation_id":"0b8bdd2f-9b5a-4524-a485-fd9e7bacebc3","resolution":{"observed_at":"2026-05-11T18:46:09.475805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.08816","last_updated":"2026-05-09T09:10:00Z","snapshot_observed_at":"2026-07-31T05:32:25.461400Z","submitted_at":"2026-05-09T09:10:00Z","title":"Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:39.884350Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.08816"},"observation_digest":"sha256:302082d0df825f4265bfe352dc06322a3da7aae6d1f57ea5dca2a39fdeec09ab","observation_id":"468708aa-c229-4320-8bd0-d3f3ad7d69ed","resolution":{"observed_at":"2026-05-12T03:36:18.582096Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.09262","last_updated":"2026-05-10T02:17:14Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:17:14Z","title":"Reinforcing Multimodal Reasoning Against Visual Degradation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:21.451146Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.09262"},"observation_digest":"sha256:48ce5cb59878d356b9ddb5462817790bb41e7221aeb1c9ec2d92f6591b434bcc","observation_id":"28ba0451-294d-4223-9158-aada18d5ab5d","resolution":{"observed_at":"2026-05-12T06:06:25.272467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:9e3c5e2908527e378e5aac234b1cf0b116eefc5983b67496d248893b5cef2cbd","observation_id":"ca736119-30ee-4cae-9c82-f376cb704189","resolution":{"observed_at":"2026-05-12T06:01:24.251497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-03T01:46:31.336725Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:a87b358a24393b360149a875126211beeace753e71b9ac30803abc092770a8e8","observation_id":"f74b90da-2ddc-45f2-b32c-3af7f623c520","resolution":{"observed_at":"2026-05-14T19:22:50.506455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-03T16:06:14.906537Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T06:40:55.537488Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:2631a50dcf77e9969980f6c7fc3409662253c095ba81f22f3cdc7af14b519a1d","observation_id":"8e6cd266-c765-47e9-8415-ab40275e0e21","resolution":{"observed_at":"2026-05-20T06:43:05.841371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-03T16:06:14.906537Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:2df941795a161bb1f5b68229d853155e593a4065dfb0b3e1448dffe4798b8374","observation_id":"d0de086b-62db-40ae-92d4-842f5e7410dc","resolution":{"observed_at":"2026-06-30T18:55:00.783814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:cddae767104fdb217b8dee60dbf0a4af68077d2e867646e01af600ab4690b15c","observation_id":"a6bf4ee8-f21d-4db2-bb37-e88da72484fb","resolution":{"observed_at":"2026-05-20T05:28:04.551335Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:26.590720Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:063bc30c7970bfd07017bf88ddbd16a8685afbbf90989afe00a82b1d54697624","observation_id":"4362425c-f3d1-4614-8545-2e3e350b214b","resolution":{"observed_at":"2026-05-21T05:39:40.542640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T17:19:09.596950Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:b78b32c6c00c5a5e16db58b503509bdb9189946affcecc6c7350062e6edf094e","observation_id":"9fc96a1f-4e3c-40ab-b7ba-a66b812737d7","resolution":{"observed_at":"2026-06-30T17:24:57.576003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:256cc7330c2246787912bc959b71893ef14dfc0125633ad4065794ab2e5fa97f","observation_id":"b8713252-d2d9-4d04-97b3-73766edbde3a","resolution":{"observed_at":"2026-05-22T07:24:42.889722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.21931","last_updated":"2026-05-21T03:00:35Z","snapshot_observed_at":"2026-08-04T00:34:51.754881Z","submitted_at":"2026-05-21T03:00:35Z","title":"EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:30.508843Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.21931"},"observation_digest":"sha256:a3eb3165e60546cd5b9f9101569857cee8a05afa1c930a0918e47ce61b523a7a","observation_id":"32aa04c6-5614-4ca7-a836-7414863dfabe","resolution":{"observed_at":"2026-05-22T07:21:12.876596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.28070","last_updated":"2026-05-27T07:28:25Z","snapshot_observed_at":"2026-08-03T11:47:22.689668Z","submitted_at":"2026-05-27T07:28:25Z","title":"Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T12:37:16.138816Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.28070"},"observation_digest":"sha256:2722840ab00f54f44c05862c4854fae0647cf06edecc1ca155671939eefd1173","observation_id":"7506bc9c-35d5-4bff-82ab-9a4724f08313","resolution":{"observed_at":"2026-06-29T12:43:25.856065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.30257","last_updated":"2026-05-28T17:20:31Z","snapshot_observed_at":"2026-08-04T01:53:43.113803Z","submitted_at":"2026-05-28T17:20:31Z","title":"Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:26:06.346326Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.30257"},"observation_digest":"sha256:378cf59bc4d2839d8407bcd78d629d197176c5e8d256c33d1823f9290e1589d6","observation_id":"03f0b52c-3524-409b-8772-9488da3ff4d8","resolution":{"observed_at":"2026-06-29T08:33:15.656607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T19:26:37.281563Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2606.00564"},"observation_digest":"sha256:c68ebcbb8b7e36e2a13263f68da4a7ab82bc1293ac794f519ef1a9805ccabac4","observation_id":"44e5e864-636f-4cb6-aac4-f912c2b5abe2","resolution":{"observed_at":"2026-06-28T19:32:34.996398Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2606.07812","last_updated":"2026-06-05T19:39:35Z","snapshot_observed_at":"2026-08-03T03:54:05.305322Z","submitted_at":"2026-06-05T19:39:35Z","title":"Scaling Participation in Modular AI Systems","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-06-27T21:49:27.042616Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2606.07812"},"observation_digest":"sha256:b4c37072a9fbb72259728d92ead7ee0dee625bde16744512829e528e61e11885","observation_id":"dd3849ca-ca49-4b81-ac7e-096a3b9bdfd2","resolution":{"observed_at":"2026-07-02T18:57:16.640238Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":284,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:f1c8da41e4d1ef8415d6756c5f6dc6e80b3510e4edc45b7bf27f5d866185b3f7","observation_id":"1afc69ce-5bca-4bf7-88dd-56d96514fbef","resolution":{"observed_at":"2026-07-03T01:37:30.255619Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2606.22158","last_updated":"2026-06-29T19:38:11Z","snapshot_observed_at":"2026-08-02T21:36:00.131706Z","submitted_at":"2026-06-20T17:33:07Z","title":"Improving Reasoning in Vision-Language Models via Perception Verified Self-Training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:51.635039Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2606.22158"},"observation_digest":"sha256:6fa455e0b12a1e4c68c5948206d226e1110bbcb3392a35fbcc46fbef4c0a494e","observation_id":"7b7ec798-908f-4efb-a064-20eabcfc5268","resolution":{"observed_at":"2026-07-01T09:35:39.626458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2606.28845","last_updated":"2026-06-27T10:12:09Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T10:12:09Z","title":"Personalizing MLLMs via Reinforced Multimodal Reference Game","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T10:08:38.106708Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2606.28845"},"observation_digest":"sha256:9c871d4db89f05e9ef6b777833e1865635d72adbdcf945fca756d1bf216bfd6e","observation_id":"eb47cb2f-387e-4298-b916-725573a4bb5c","resolution":{"observed_at":"2026-06-30T12:44:40.065540Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2606.31599","last_updated":"2026-06-30T12:47:30Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:47:30Z","title":"Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-01T05:36:43.609602Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2606.31599"},"observation_digest":"sha256:37c678934d909b11514ebf54f5877a24c32885a3e99b2495071ad21e46b3c0aa","observation_id":"3c179be6-3bc0-407a-a340-25139bc23a3f","resolution":{"observed_at":"2026-07-01T10:15:45.188616Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2607.01707","last_updated":"2026-07-02T04:59:56Z","snapshot_observed_at":"2026-08-02T06:22:23.690891Z","submitted_at":"2026-07-02T04:59:56Z","title":"LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T16:53:43.427625Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2607.01707"},"observation_digest":"sha256:f5d5380628cb3d1870c1c5f800be8a55b165aee56612e07fdcbd4e994246268d","observation_id":"a7aa0d15-ecfb-42d8-b703-5f3bd601bbc6","resolution":{"observed_at":"2026-07-03T16:58:42.352796Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-13T05:28:45.311405Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-07-16T23:18:48.719406Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T05:28:45.311405Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:c36baa570e445916a8c692935639537e9f243ffbe820f01f1e179c57ed03d86b","observation_id":"3158a5c5-bf95-4637-8211-a8dc6661c89f","resolution":{"observed_at":"2026-07-13T05:28:45.311405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-07-16T23:18:48.719406Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:714f4c3127e30b82d10b1b80d38d8e22a14054ed191146978308c5c77a985604","observation_id":"3a164a77-f953-4015-a040-5be20571ce00","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-02T06:36:35.384825Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16303","last_updated":"2026-07-14T07:08:28Z","snapshot_observed_at":"2026-08-04T14:30:35.784737Z","submitted_at":"2026-07-14T07:08:28Z","title":"Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:35.384825Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2607.16303"},"observation_digest":"sha256:7accb019aac562a3a2ba4af028e7043d08a58f9f13e1cdec46f6bd532d7ac593","observation_id":"c3e0ded3-08e6-48e1-aa33-eefd0bad2c28","resolution":{"observed_at":"2026-08-02T06:36:35.384825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-31T14:46:28.736812Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24447","last_updated":"2026-07-27T13:52:09Z","snapshot_observed_at":"2026-08-02T19:54:25.493460Z","submitted_at":"2026-07-27T13:52:09Z","title":"RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T14:46:28.736812Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2607.24447"},"observation_digest":"sha256:827923e6bc53a686bca6c3941bd7b2fca098e1892c4e2f7f1ee65f47d1e94c8a","observation_id":"f60e0dd2-6991-47d1-977c-6a66da0f9a18","resolution":{"observed_at":"2026-07-31T14:46:28.736812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19652/citation-record","integrity":"/paper/2508.19652/integrity","json":"/paper/2508.19652/citation-record.json","paper":"/paper/2508.19652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:e54772a1fcd6393081e842a955957e7270ee7514232ce7bac9552e4fecf0cfb1","observation_id":"293fc308-5472-4b24-a02f-8d6ba918037d","resolution":{"observed_at":"2026-05-18T21:06:50.854009Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17510","last_updated":"2024-07-31T21:02:12Z","snapshot_observed_at":"2026-08-04T04:04:53.743132Z","submitted_at":"2024-02-27T13:50:34Z","title":"Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning","version":2},"cited_work":{"arxiv_id":"2402.17510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17510","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, et al","venue":null,"work_id":"89377e88-b7d2-4c3b-8c71-f30fefbef9a2","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2402.17510","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:8a6fa26dc0fff05f875d0257ebfd0488e78e08aac9b2eb89d796c7e3dcbbfc10","observation_id":"a0f187c4-8a2f-4b11-acc3-86415fc8e676","resolution":{"observed_at":"2026-05-18T21:06:50.894430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:8c0e62b002c54a27f833e6c44bd1bbcd2e28779058e77ba6297bec3b86328497","observation_id":"27f72ccf-f6e7-47f0-8be2-cb46e75ae1dd","resolution":{"observed_at":"2026-05-18T21:06:50.842818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:39c348e14726d8b7c6ca220783d747e3b648c36851e71428b532f2cf0c6774ed","observation_id":"ff9d0d59-9f98-4a59-a587-6a834c107b71","resolution":{"observed_at":"2026-05-18T21:06:50.859408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:09f8681ca7435ff1a1009af828784d67215470f08df0d21ab3a011540a4d2140","observation_id":"e1a50a99-75c1-4344-9b2e-db4716f94233","resolution":{"observed_at":"2026-05-18T21:06:50.904071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:b6649b27adf10fe300cd76f3f2e7de169005317e4322ebf3197fbf880ddbb852","observation_id":"d009ac87-0d15-4c3b-a2ce-d4a802682aad","resolution":{"observed_at":"2026-05-18T21:06:50.819432Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":null,"work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:cb3759d2d438a92e5c7eb500ccd74b12ec20709118f4354c0bb1991e06488c66","observation_id":"f1f2f615-d4f8-4f43-a686-c92943506c4b","resolution":{"observed_at":"2026-05-18T21:06:50.884482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10802","last_updated":"2025-05-16T02:43:05Z","snapshot_observed_at":"2026-07-06T21:24:44.443919Z","submitted_at":"2025-05-16T02:43:05Z","title":"Attention-Based Reward Shaping for Sparse and Delayed Rewards","version":1},"cited_work":{"arxiv_id":"2505.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10802","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Yao Hu, and Shaohui Lin","venue":null,"work_id":"ded3a8e7-35fa-47e3-b3f5-ea1f4d324826","year":null},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2505.10802","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:3a30a5a5986af7ca0d05bdbcf8bf82f1118445365e1998915b290d7a9818fd89","observation_id":"ef2dc4f0-e265-4679-b6d4-e2dd59127887","resolution":{"observed_at":"2026-05-18T21:06:50.924903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-07-11T03:17:51.684746Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:d70fe60a5b217e4bfb6b1cb09c1e01f0b9f98710af1e320b0d0061313672021d","observation_id":"8d7105e9-bd1a-4901-b191-bf3c75b8f53e","resolution":{"observed_at":"2026-05-18T21:06:50.870094Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14604","last_updated":"2024-04-26T02:34:29Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T21:59:35Z","title":"Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training","version":3},"cited_work":{"arxiv_id":"2404.14604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Describe-then-reason: Improving multimodal mathematical reasoning through visual comprehension training","venue":null,"work_id":"29b530c1-80b0-4313-9e08-444e596aad3a","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2404.14604","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:cf3912cee359488f560068d3de27b19923c7e5e01cb0c3c4d3df9c8e3145f083","observation_id":"cb772b72-8f4e-40bf-b00a-250d364a23e4","resolution":{"observed_at":"2026-05-18T21:06:50.889155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08772","last_updated":"2025-04-03T07:11:18Z","snapshot_observed_at":"2026-07-06T21:08:01.403325Z","submitted_at":"2025-04-03T07:11:18Z","title":"Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.08772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08772","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pengyi Li, Matvey Skripkin, Alexander Zubrey, Andrey Kuznetsov, and Ivan Oseledets","venue":null,"work_id":"5a0f8174-d429-45e3-be75-5ad1e26799dc","year":null},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2504.08772","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:7bbeda2816f400321d768e959fea00089162e102ec3cc588cd4fcf8cbb462979","observation_id":"b0093d23-a9f9-4116-a40b-b88bbc091e5f","resolution":{"observed_at":"2026-05-18T21:06:50.909122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21523","last_updated":"2025-06-20T08:41:41Z","snapshot_observed_at":"2026-08-03T19:13:55.105957Z","submitted_at":"2025-05-23T05:08:40Z","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":"2505.21523","doi":"10.48550/arxiv.2505.21523","metadata_source":"pith","pith_arxiv_id":"2505.21523","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Advances in Neural Information Processing Systems , year =","venue":"cs.CL","work_id":"bb9acd95-b27a-4709-9dfa-75f62a65c716","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2505.21523","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:ec3aeecf4389fa5233b2d222b725b9ff5bf72236a2c0ce66856023caa913f373","observation_id":"7ae09349-ea87-48c8-8ee1-e57bfa4b6b35","resolution":{"observed_at":"2026-05-18T21:06:50.807141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.00253","doi":"10.48550/arxiv.2402.00253","metadata_source":"pith","pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A Survey on Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"d92dd1ae-69e1-403f-a254-307f138cf24f","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:669d68a8ba065f83003a5b84e050ff7d0fa8890b6d46a5e62141657f300dc927","observation_id":"b5311bb5-c27b-48c5-8d9b-294a3bd75f35","resolution":{"observed_at":"2026-05-18T21:06:50.874660Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T22:53:40.09616+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T22:53:40.09616+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12822","last_updated":"2025-06-15T12:05:08Z","snapshot_observed_at":"2026-07-06T21:42:30.134963Z","submitted_at":"2025-06-15T12:05:08Z","title":"Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12822","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12822","snapshot_observed_at":"2026-07-04T09:59:44.448427Z","title":"Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Bin Xu, Lei Hou, and Juanzi Li","venue":null,"work_id":"11577eb7-4459-4c05-a117-f82c0c80a920","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2506.12822","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:ab1bce1c784fb4f8525933f9e664a382c15f940f771bb2f3a14df3b24c7a1e3e","observation_id":"5b704c8c-fc4a-4656-9aa9-60b8aa3f330d","resolution":{"observed_at":"2026-05-18T21:06:50.849423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7305.1948","doi":"10.1002/j.1538-7305.1948","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Bell System Tech- nical Journal27(3), 379–423 (1948) https://doi.org/10.1002/j.1538-7305.1948","venue":null,"work_id":"3a63a46f-71c1-4210-af1b-8883de24b497","year":1948},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:cd09fc48296f09b28944a3f896ff219698c7bc26c578c9c24eb1026be1a23fa3","observation_id":"b4282b8d-24b2-4d02-b756-5486ebf3b871","resolution":{"observed_at":"2026-05-18T21:06:50.351996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T14:20:55.337964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T14:20:55.337964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:751f9bfdd9e49315d01b4492a8d274d2f2e5e3933e14a7f7e8490b7b4ce173f6","observation_id":"e84b70b4-5be6-47c1-8bf3-377ccab63756","resolution":{"observed_at":"2026-05-18T21:06:50.837840Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:74ce158de8cc560e9862b6fc3082784ac427c1e8aea8fb2d75fdca3baf7585b7","observation_id":"2bc5ef9e-81fc-4775-99e2-e3b867943254","resolution":{"observed_at":"2026-05-18T21:06:50.913499Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language prior is not the only shortcut: A benchmark for shortcut learning in vqa","venue":null,"work_id":"00358b4e-0cad-4df9-971b-66b659602cf2","year":2022},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:98b4d5f8bb1a6372ad00e6a37b265fd20dc5a7fb524fd5cf8e5730057bc9e25e","observation_id":"0d7a78ad-feb8-40cf-8637-6f2f438b3313","resolution":{"observed_at":"2026-05-18T21:11:51.929614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08827","last_updated":"2025-08-06T23:51:16Z","snapshot_observed_at":"2026-08-03T03:40:47.819174Z","submitted_at":"2025-05-12T23:51:04Z","title":"RLSR: Reinforcement Learning from Self Reward","version":2},"cited_work":{"arxiv_id":"2505.08827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.08827","snapshot_observed_at":"2026-07-08T21:25:38.647436Z","title":"Omkar Thawakar, Dinura Dissanayake, Ketan More, Ritesh Thawkar, Ahmed Heakl, Noor Ahsan, Yuhao Li, Mohammed Zumri, Jean Lahoud, Rao Muhammad Anwer, et al","venue":"cs.LG","work_id":"456391de-7d99-4030-bc68-6b40bd8f35ff","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2505.08827","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:37ae6e7a56f5e9e7c9f42e68c40de40057aa5f71c2d7f8b3d8629f6eb429d957","observation_id":"00c1700a-e9b8-41b0-a2e4-0874cb7e3076","resolution":{"observed_at":"2026-05-18T21:06:50.865244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-07-06T22:04:39.570642Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:0f24c7ab51db46c4c0352fce707a8265d4549c83bc3156164c09d164b83bd5ee","observation_id":"8a3bf153-0a8b-470d-b7ea-f08e298d5ef3","resolution":{"observed_at":"2026-05-18T21:06:50.793278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:68a1893c126a5f89053cecdc9c73b5008d574af1c4e0162b22f98d7f0f2a5466","observation_id":"7d132ff0-3378-46e0-82d5-13dc69765dc4","resolution":{"observed_at":"2026-05-18T21:06:50.824810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14939","last_updated":"2025-07-31T09:21:08Z","snapshot_observed_at":"2026-07-06T20:55:09.392546Z","submitted_at":"2025-03-19T07:07:43Z","title":"VisNumBench: Evaluating Number Sense of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.14939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14939","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visnumbench: Evaluating number sense of multimodal large language models","venue":null,"work_id":"54cea296-cb39-4b4c-9809-fbf5e9f5d79d","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2503.14939","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:f08ad33bc3ecc2a51a560f9960cb31f3c8c3394e456bfcaa072cbe8acc9cabc7","observation_id":"b9bf60ec-d0b4-4ef7-a010-e50bf0495250","resolution":{"observed_at":"2026-05-18T21:06:50.831375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:06.399223Z","title":"Perception-R1: Advancing multimodal reasoning capabilities of MLLMs via visual perception reward","venue":null,"work_id":"23f6cb13-af2a-42da-b1a6-609b24d61e5d","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:8d5ce3f8ddebdc2873315b4da5dfe3265445abc233b31052737c2e286f9127f8","observation_id":"74f7f39e-8c50-4111-bd88-6f6e8c4d0c9a","resolution":{"observed_at":"2026-05-18T21:06:50.780707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-05T00:57:29.086061Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"cited_work":{"arxiv_id":"2505.23646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23646","snapshot_observed_at":"2026-07-10T10:27:02.392963Z","title":"Edward Yeo, Yuxuan Tong, Morry Niu, Graham Neu- big, and Xiang Yue","venue":"cs.CL","work_id":"cbb24d0e-0a95-46cb-a43e-115b3c4115d7","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2505.23646","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:41d3818e4167565170874cc9cf502da5b89a1a16f7fe32e0e5dd3f3cd37e4460","observation_id":"114e4901-c09a-4c47-a19e-8362aa4a6701","resolution":{"observed_at":"2026-05-18T21:06:50.899623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:8911e91eb4bc1fa140a6de81c5c9b2fe7e4a1672c1b7bf5dbd516032dc5dc57d","observation_id":"b58b8565-ac9d-418f-baf7-a7c69adfc8d5","resolution":{"observed_at":"2026-05-18T21:06:50.919220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:9efd1113258a3430802f2cae5e6c4a199f9f648d9c44837d2ae18f7e2ec7524c","observation_id":"52c95987-247e-43bb-b0ff-d8df4fd4ccb4","resolution":{"observed_at":"2026-05-18T21:06:50.787426Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:fb5cf6b217756ebd4031094d0fc150831442be2bd1006758b985bf353860a89f","observation_id":"14aebc15-4c08-429c-a69f-337bf607fea9","resolution":{"observed_at":"2026-05-18T21:06:50.800944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-07-31T07:01:13.724738Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2503.12937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-07-10T05:16:48.080500Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":"cs.AI","work_id":"e1614961-16d2-43bc-908a-8c57da5b151c","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:663e4b69004942f32ea3ba068355fb6304ac1bd3744fa79bc4258dbacd337e86","observation_id":"8ac18930-0a43-4dde-8022-f2def321c5e8","resolution":{"observed_at":"2026-05-18T21:06:50.812882Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":"2505.19590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-07-10T12:07:03.461827Z","title":"Learning to Reason without External Rewards","venue":"cs.LG","work_id":"7286f998-80ea-4c9e-8736-a39c53696142","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:6ddbceb810d81eb05d4614457c26d28afe8f5dd68fcede7326d48dbbbd7f24b2","observation_id":"ada79fa5-e828-46fa-b761-45f3a4215ebf","resolution":{"observed_at":"2026-05-18T21:06:50.879153Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-07-30T21:22:18.339303Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":"2405.14622","doi":"10.48550/arxiv.2405.14622","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"humanoid","venue":null,"work_id":"4433a3ea-a276-4d66-8497-cf99c60dced0","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:282de0082ac9c06840dded8b89758504b2ed675ede2fb301fb1861cbc896ca81","observation_id":"6c929866-b6dd-492c-98de-e715d255ec40","resolution":{"observed_at":"2026-05-18T21:06:50.930423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":17,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":1},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 42 inbound Pith citation observations for arXiv:2508.19652."}