{"as_of":"2026-08-18T16:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47734bc70dd579acb9668bf2f56bd55bb107f109da55e09502031eee5b4acfda","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:39:05.892968Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08021/citation-record","integrity":"/paper/2608.08021/integrity","json":"/paper/2608.08021/citation-record.json","paper":"/paper/2608.08021"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:05.800340Z","title":"Tool- r0: Self-evolving llm agents for tool-learning from zero data.arXiv preprint arXiv:2602.21320,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.800340Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:596ce1f54ab919e94300b213cf86d23c72cf79ff22862982244c629e39617233","observation_id":"c9dfa458-87c4-4632-a537-45085cdb9cd6","resolution":{"observed_at":"2026-08-12T00:39:05.800340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:05.812847Z","title":"Sophiavl-r1: Reinforc- ing mllms reasoning with thinking reward.arXiv preprint arXiv:2505.17018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.812847Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:8ad4159dfbdbe6c53f9a22ce5c5c7f6edb13bda66f93e0f5e85777521abda073","observation_id":"dfb1ce76-87af-4d5a-af9b-c0bec83ec15d","resolution":{"observed_at":"2026-08-12T00:39:05.812847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:05.820629Z","title":"Spotlight on token perception for multimodal reinforcement learning.arXiv preprint arXiv:2510.09285,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.820629Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:1411acc1a535c6c73640bd696cf73ac91829e5a0331aea3a7ed56639b19517ba","observation_id":"0069c6a6-1118-4305-bf8d-fab3f2f31596","resolution":{"observed_at":"2026-08-12T00:39:05.820629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T00:39:05.824676Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.824676Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:122785a31c64e6e0a7078781a6819844523069c7600eff3ee41579d8474b605a","observation_id":"bf88e92f-4dac-4959-a799-4f1a421fbda7","resolution":{"observed_at":"2026-08-12T00:39:05.824676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06169","last_updated":"2025-03-17T08:11:52Z","snapshot_observed_at":"2026-08-17T14:07:57.009857Z","submitted_at":"2025-03-08T11:13:05Z","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06169","snapshot_observed_at":"2026-08-12T00:39:05.828512Z","title":"Treble counterfactual vlms: A causal approach to hallucination.arXiv preprint arXiv:2503.06169, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.828512Z"},"links":{"cited_paper":"/paper/2503.06169","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:5efc5c329666372d387e24b7f98cb591f675d06c1fde28f4daea4a20418e0063","observation_id":"0d76588c-f76f-495e-8348-11704440b442","resolution":{"observed_at":"2026-08-12T00:39:05.828512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:06.830902Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"9b230428-bdb1-4e95-9635-a36fbcacea39","year":2023},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.832213Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:80d97128bb3028172b24f0d99c22331c9edea52e352704dec48ac3d65be41a84","observation_id":"5078d6ed-8519-4389-9a3e-c77b9b33bfdb","resolution":{"observed_at":"2026-08-12T00:39:06.834391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-18T12:32:09.276205Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-12T00:39:05.848942Z","title":"Vision language models are blind: Failing to translate detailed visual features into words.arXiv preprint arXiv:2407.06581,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.848942Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:19778a91ebbe040c663fc220a7b57a45ca19fa1f350438b21967e60104221d94","observation_id":"7310bdba-2adb-4724-b15b-138f74838505","resolution":{"observed_at":"2026-08-12T00:39:05.848942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T00:39:05.852736Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.852736Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:0f07651e6370d6c7542831668bba3051d258043f7a5c57a1cb94235cb6727453","observation_id":"ab05cd7b-14b8-45f5-b9c3-6f8fbadddbaa","resolution":{"observed_at":"2026-08-12T00:39:05.852736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-12T00:39:05.859671Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.859671Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:bd1f54a442b3a9aa3b8bd8d9c3d6b6972892611d40d402614a7abc81374ea22d","observation_id":"83875587-b800-4e2a-967b-0d3497eddaa7","resolution":{"observed_at":"2026-08-12T00:39:05.859671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03733","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:06.430894Z","title":"Regionreasoner: Region-grounded multi-round visual reasoning.arXiv preprint arXiv:2602.03733,","venue":null,"work_id":"8487b87a-4ad5-4acd-a13d-eaf13213408c","year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.863676Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:cbfca78a5e1e5c4ae1b91917497191f0cb896f528374a0376ddff26b2b16691c","observation_id":"91acbfc0-b453-420d-8c8a-c9233ded11e4","resolution":{"observed_at":"2026-08-12T00:39:06.437720Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-15T04:02:04.964450Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11991","snapshot_observed_at":"2026-08-12T00:39:05.867332Z","title":"Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.867332Z"},"links":{"cited_paper":"/paper/2506.11991","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:3a96ca82cd4fb77d8ba68c00ccf592941cecdb73ba9fb4499a552f35ffa89869","observation_id":"58f1fe84-3691-401f-a38a-f504f8d93ee9","resolution":{"observed_at":"2026-08-12T00:39:05.867332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-12T00:39:05.871309Z","title":"Internvl3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.871309Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:b16f3807b724cdcebbca144a50a797de45be42c2928ed3e6d06cc43d2c2a8d61","observation_id":"4cd0f623-b3a5-4ecf-8725-a9fa58ff3ad1","resolution":{"observed_at":"2026-08-12T00:39:05.871309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:05.875271Z","title":"Perception-r1: Advancing multimodal reasoning capabilities of mllms via visual perception reward.arXiv preprint arXiv:2506.07218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.875271Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:f162652c98b449366b1c1ac8fc1892b1e9e74567109d120d132208637baef508","observation_id":"0b9ee68d-1667-4c91-9ad5-7fa053eb388a","resolution":{"observed_at":"2026-08-12T00:39:05.875271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10425","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:06.270956Z","title":"Hii-dpo: Eliminate hallucination via accurate hallucination-inducing counterfactual images.arXiv preprint arXiv:2602.10425,","venue":null,"work_id":"e2478b80-1ab8-439e-baaa-912aa2729662","year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.878812Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:2511979b0117617cd33d7214fd1e04cdb1be9b818d8903086de4d219550e8ac9","observation_id":"b5db48f9-afc0-46a5-8235-258bbb94fddc","resolution":{"observed_at":"2026-08-12T00:39:06.277276Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:05.882355Z","title":"Freak: A fine-grained hallucination evaluation benchmark for advanced mllms.arXiv preprint arXiv:2603.19765,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.882355Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:df75ff690b4873ac16f6eee2585a9367d26c3ac5680ae53cf3f35550f07fc769","observation_id":"06b610bd-3c22-45c7-9776-6449837c9e14","resolution":{"observed_at":"2026-08-12T00:39:05.882355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-12T00:39:05.885814Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.885814Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:d724066a925b273e3631f600f06dfff919ae7dac1b093078741040d26403890a","observation_id":"c753def7-f0a6-499a-81b6-d320da5fcc95","resolution":{"observed_at":"2026-08-12T00:39:05.885814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7800.6602","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:06.059018Z","title":"Paper notation","venue":null,"work_id":"ab9bc80d-c3c9-4672-9e9d-519f553c1c95","year":2014},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.892968Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:04fcc6a62bcea4ba218b55183c57c7663c05bca249985bbded00400fad2b6db3","observation_id":"9516e083-2882-474c-8f15-0af076e07cb9","resolution":{"observed_at":"2026-08-12T00:39:06.067597Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:05.889512Z","title":"Perceptual-evidence anchored reinforced learning for multimodal reasoning.arXiv preprint arXiv:2511.18437, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.889512Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:9fc81111c1a554cd85c6d763bf8300efbff90a6c8c669b5d160cc5238310dee0","observation_id":"f72541ce-2575-4e66-a224-da6f4a59053c","resolution":{"observed_at":"2026-08-12T00:39:05.889512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-12T00:39:05.856137Z","title":"Deepseekmath: Pushing the limits of mathemat- ical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.856137Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:969ccbd15fe4a4897e1eba1e1d8265ce4a8808a35d71cabe1f8cad8435d41722","observation_id":"7e209b76-8d90-4769-aba2-610a8b897fb5","resolution":{"observed_at":"2026-08-12T00:39:05.856137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-17T03:34:43.784005Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-12T00:39:05.844143Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens.arXiv preprint arXiv:2511.19418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.844143Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:07fa304fe13f737bf30a09159aa24ef4ac5ce548a13fa2918e90b83ccca1cc5c","observation_id":"44272ef2-07fa-4948-8519-60251738e985","resolution":{"observed_at":"2026-08-12T00:39:05.844143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-12T00:39:05.839955Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.839955Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:8c293cac01df65a63bea2f40df78a8047d2603d3f0086706f1ac6f0f0062feaa","observation_id":"e30091e1-c254-4316-92d6-4ce14204807c","resolution":{"observed_at":"2026-08-12T00:39:05.839955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-15T16:01:07.680571Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-12T00:39:05.835943Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.835943Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:c8ba9f2599536cdc3a788f449f98c894d0a55c9e9ae9b6378749896bf9390816","observation_id":"617224c5-5421-4b07-a6ad-723238812bb3","resolution":{"observed_at":"2026-08-12T00:39:05.835943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-12T00:39:05.816731Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.816731Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:85165c7119f51961485e6deea37f1d993e8df03a9fb05f64145adeceacf15227","observation_id":"47b179b8-5d6f-4126-9d5f-2f3a457ac9fb","resolution":{"observed_at":"2026-08-12T00:39:05.816731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12149","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:39:06.750487Z","title":"Linking perception, confidence and accuracy in mllms.arXiv preprint arXiv:2603.12149,","venue":null,"work_id":"fcd366b8-5bd5-4c41-ae68-363dd9595bc7","year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.808738Z"},"links":{"citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:ad6202b92a1538c57d812a9ac26cd89af441b48b660ef970aea6b74591e1920a","observation_id":"399ab30b-0d93-4c76-bfa4-48d46c04ad39","resolution":{"observed_at":"2026-08-12T00:39:06.755512Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-12T00:39:05.804628Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.804628Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:439adde53a33782eb92a4d70ffc401cc5e7a39e5ebc9c2b0b6a931627ed83a02","observation_id":"e7fa1d77-bdc2-4f9a-8d4c-d92eb13948eb","resolution":{"observed_at":"2026-08-12T00:39:05.804628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:21:42.965431Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.08021."}