{"as_of":"2026-08-08T04:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca7f6d74a6bb1011e162cfa9fe6c8d0f004f6efe0c61a7a55138feef7e695f31","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:11.856611Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:36:29.321068Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:a6242e5aa2a309e4a8d70f5bc62d806601ec6d2d0a39d55801604e1d47f7b6de","observation_id":"faf09f6d-4f16-4a6c-8a93-5ef9b397e69e","resolution":{"observed_at":"2026-05-15T17:18:53.755858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T14:42:56.565621Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2505.14362"},"observation_digest":"sha256:63b5a1faf7fd388964881c8b13582c29b105da05407782e08bbc22d8f279ac99","observation_id":"38fc3d37-2127-4eb3-a83a-f32fb43120d9","resolution":{"observed_at":"2026-05-11T14:42:56.692480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2505.17015","last_updated":"2026-05-22T13:26:59Z","snapshot_observed_at":"2026-08-02T12:28:29.672279Z","submitted_at":"2025-05-22T17:59:39Z","title":"Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T08:38:02.944230Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2505.17015"},"observation_digest":"sha256:ccd11da1d3aa024a445b624cb9010120a2ca6373b96391acf9aae892a4a3b8b3","observation_id":"0efdf565-d8a1-4c28-8a44-98498760094c","resolution":{"observed_at":"2026-05-25T08:40:33.070174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T11:55:11.856611Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.856611Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:dd80ca924794bea3e79a15b13cf4a88be4f94be4b51343b9d370b825f42cbe86","observation_id":"38f64302-aa0c-470f-99a1-8791e16daa41","resolution":{"observed_at":"2026-08-07T11:55:11.856611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T10:41:26.797359Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.797359Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:fc205d203447f5830f0100bc4186ebf91b061aac6246195eeee283dfc13a578a","observation_id":"c4bcaab8-ae48-4db9-ab60-0dfbb21133f0","resolution":{"observed_at":"2026-08-07T10:41:26.797359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-05T12:27:04.877627Z","title":"Perception tokens enhance visual reasoning in multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.877627Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:2b1e5e3627c3c6266cec4497c9843851d4a92919238694b6131dcad514b8b7db","observation_id":"9cfda28d-3101-4897-bb86-cda98321c705","resolution":{"observed_at":"2026-08-05T12:27:04.877627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-03T00:00:10.613016Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:9fa2f1897948943583ff04ad7fece5076210d6d64b078174b2ce75be5a1bb3cf","observation_id":"ba36fc91-b07d-4dfb-ab52-00c26823f393","resolution":{"observed_at":"2026-05-12T03:26:19.617713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2606.03988","last_updated":"2026-06-03T04:16:22Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:59:17Z","title":"Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T09:56:05.047862Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2606.03988"},"observation_digest":"sha256:e0f05ee1e4c52787c454a7c59fa5e5dfdc99cae7dc918bf1dfc1892382692ecd","observation_id":"e3344295-1764-4060-b955-552c45fd8ff8","resolution":{"observed_at":"2026-07-02T03:36:29.323266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-06T00:25:21.143352Z","title":"Perception tokens enhance visual reasoning in multimodal language mod- els.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01297","last_updated":"2026-08-02T15:06:15Z","snapshot_observed_at":"2026-08-06T23:26:13.801298Z","submitted_at":"2026-08-02T15:06:15Z","title":"Data augmentation as a framework for modeling hippocampal contributions to generalization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:25:21.143352Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2608.01297"},"observation_digest":"sha256:cd37fd3ebd902e95c2a657b1d2662e3432ee84acd2ac74f00023ca3bbc5c46be","observation_id":"6f931824-020f-4dcc-a548-06bb9e63a773","resolution":{"observed_at":"2026-08-06T00:25:21.143352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03548/citation-record","integrity":"/paper/2412.03548/integrity","json":"/paper/2412.03548/citation-record.json","paper":"/paper/2412.03548"},"outbound":[],"paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2412.03548."}