{"as_of":"2026-08-08T05:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:226bab2f3014bdee088ec4c585b2dbc5a9ccc03ba609e4198320e47d58af1da1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:12:06.014106Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:24:40.386203Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-07T14:12:06.014106Z","title":"Scaling inference-time search with vision value model for improved visual comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-07T22:12:59.102228Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:06.014106Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:520822228dcdcf1fbe1bfbddb7b4c075d4a8a03da5054dfd4dea6ea78d66dce2","observation_id":"b69cd9cc-54b3-45bf-9283-819838cacd21","resolution":{"observed_at":"2026-08-07T14:12:06.014106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-07T05:54:03.181743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06729","last_updated":"2025-06-07T09:27:26Z","snapshot_observed_at":"2026-08-07T05:48:30.660932Z","submitted_at":"2025-06-07T09:27:26Z","title":"Mitigating Object Hallucination via Robust Local Perception Search","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:03.181743Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.06729"},"observation_digest":"sha256:7fbbc5a8d60d63140f42b1b05cd30972b0408a8fd23cfbd2e8d28cfbba807b43","observation_id":"246c9b34-c7f0-4ca4-bee2-4043cdf08d90","resolution":{"observed_at":"2026-08-07T05:54:03.181743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-07T05:52:18.661384Z","title":"Scaling inference-time search with vision value model for improved visual comprehension.arXiv preprint arXiv:2412.03704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06998","last_updated":"2025-06-08T05:08:32Z","snapshot_observed_at":"2026-08-07T14:49:41.287025Z","submitted_at":"2025-06-08T05:08:32Z","title":"What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:18.661384Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.06998"},"observation_digest":"sha256:eef2156a120a6253c1b9fc010ebb2412701705d89a729f965694f69ab52cc4ef","observation_id":"b54b5691-eafa-49dc-87b5-550f54f6c437","resolution":{"observed_at":"2026-08-07T05:52:18.661384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-07T04:40:11.741673Z","title":"Scaling inference-time search with vision value model for improved visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-08T03:17:29.512287Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.741673Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:5f7e169f55a8c8e3e6c76212652b1c5110fe111d1c91031ec7ee25e763ee667b","observation_id":"d0da67b2-01d5-4d05-a158-b71c70f17dfa","resolution":{"observed_at":"2026-08-07T04:40:11.741673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-06T23:57:22.096140Z","title":"Scaling inference-time search with vision value model for improved visual comprehension.arXiv preprint arXiv:2412.03704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.096140Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:5cc939709ef41aee0455b58406bf361845dc8ecc75355b2979433766dc11c342","observation_id":"6add957d-08f8-48a0-9bdf-d3f310ccc30a","resolution":{"observed_at":"2026-08-06T23:57:22.096140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":"2412.03704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-05T13:24:40.386203Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","venue":"cs.CV","work_id":"c1f8f2e3-f159-4193-b5f9-d1ce0694c852","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.858355Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:f40cd5e8de07d5a38fa0463a54e98c2684668b315e736d82e9b7a6a437a41d5f","observation_id":"e74bdea1-5859-4b61-a8b2-633f4646b1b9","resolution":{"observed_at":"2026-08-05T13:24:40.393917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03704/citation-record","integrity":"/paper/2412.03704/integrity","json":"/paper/2412.03704/citation-record.json","paper":"/paper/2412.03704"},"outbound":[],"paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2412.03704."}