{"as_of":"2026-08-10T00:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c39f61ddb82c5a451b9d90d040779fc24053c8270b95a2f2a9d26fe5a43452b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:36.765233Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:709ae475c8f3ea76ea05a385909b1ad030864d69e225aeb464a3f1164056d828","observation_id":"f2d0cd6a-a6de-4a82-aeb9-aee55ccb2dbc","resolution":{"observed_at":"2026-05-16T11:39:22.451307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-07T00:34:36.765233Z","title":"Grounded chain-of-thought for multimodal large language models.arXiv preprint arXiv:2503.12799, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.765233Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:4c4e4d6a6cf63ecd1fc82f8e85123f5c9a5d8a567be2c5030fbfd76d7a35d4fa","observation_id":"2ea0c3d6-bc3a-43b0-b421-951261aefd76","resolution":{"observed_at":"2026-08-07T00:34:36.765233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-06T20:24:57.113550Z","title":"Grounded chain-of-thought for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.113550Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:ca7012e5126bbecb97b5842a6bb59bd09a38dd0cc1d32f1b6649e51189314d3b","observation_id":"33aafc2c-50ed-4f2a-8985-4d80ee31dcc9","resolution":{"observed_at":"2026-08-06T20:24:57.113550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T11:40:24.078659Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02359","last_updated":"2025-09-02T14:22:43Z","snapshot_observed_at":"2026-08-08T06:17:37.928618Z","submitted_at":"2025-09-02T14:22:43Z","title":"Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T11:40:24.078659Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2509.02359"},"observation_digest":"sha256:0dbd9e2bfb9cfdb75139a61cb505d3e7d284bc09ee2ac71a605cf54dc72208b0","observation_id":"f2774bf3-af99-407d-af29-21f65c5c471d","resolution":{"observed_at":"2026-08-05T11:40:24.078659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T10:39:02.881423Z","title":"Grounded chain-of- thought for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.881423Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:df6cdef8c2896806378dc412852c7ce8af0704994a67e2d2506ec388b486599c","observation_id":"51891bc4-500e-4224-9a61-e537c1f404e1","resolution":{"observed_at":"2026-08-05T10:39:02.881423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-08-07T17:13:19.123990Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:098e568fd0190e77b12cd1bc63e753e7fbc122e71a7613588a10eff86fda9313","observation_id":"17b940df-2077-4fa0-ac82-5b632675a6f1","resolution":{"observed_at":"2026-05-18T13:36:25.208637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2510.04225","last_updated":"2026-04-21T18:16:55Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T14:29:01Z","title":"Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T10:13:08.112072Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2510.04225"},"observation_digest":"sha256:8db86e87f6ee0621e56af641534d38041bbd8137a28b9cb59c065a40c6d1e8ef","observation_id":"59ee0f4e-8e78-40bf-9884-17d6dddf6adb","resolution":{"observed_at":"2026-05-18T10:16:14.393486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-03T20:57:33.489899Z","title":"Grounded chain-of-thought for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:33.489899Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:cd42505a063440d15a48a800925ef222f21c48bca8a373fa5808f39cbeb4e8de","observation_id":"0c874784-5226-47e3-b452-a4842a504355","resolution":{"observed_at":"2026-08-03T20:57:33.489899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-03T17:15:17.698711Z","title":"Grounded chain-of-thought for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10414","last_updated":"2026-05-30T03:42:16Z","snapshot_observed_at":"2026-08-09T16:57:47.996624Z","submitted_at":"2025-12-11T08:27:02Z","title":"Boosting RL-Based Visual Reasoning with Selective Adversarial Entropy Intervention","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:15:17.698711Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2512.10414"},"observation_digest":"sha256:23e3132630ba2b10cbeb5fbb81b840f3aa206bc89813f3bad9d581f1bc406f65","observation_id":"8edea675-28c1-49e9-8a8c-c67c7668c18f","resolution":{"observed_at":"2026-08-03T17:15:17.698711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.09266","last_updated":"2026-05-12T14:15:36Z","snapshot_observed_at":"2026-08-09T05:50:10.563415Z","submitted_at":"2026-05-10T02:23:58Z","title":"SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:39.571227Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.09266"},"observation_digest":"sha256:5d6037c699658c61d1898254fc07c6bb3d98af3337a30072fa1fa90954185e6e","observation_id":"4d3f4706-9dff-476e-8931-6d15122eac37","resolution":{"observed_at":"2026-05-12T05:11:22.875299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.09266","last_updated":"2026-05-12T14:15:36Z","snapshot_observed_at":"2026-08-09T05:50:10.563415Z","submitted_at":"2026-05-10T02:23:58Z","title":"SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T07:43:50.633779Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.09266"},"observation_digest":"sha256:7cd7d4f2fa844308b313a1537c3ca20adf6fb0d83ca4a771079f7d1d474b0c77","observation_id":"ab30d83a-a8e2-433e-87cb-8c060130f687","resolution":{"observed_at":"2026-05-13T07:47:31.637135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.16416","last_updated":"2026-05-13T16:50:24Z","snapshot_observed_at":"2026-08-01T18:16:06.477491Z","submitted_at":"2026-05-13T16:50:24Z","title":"CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T21:10:56.533649Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.16416"},"observation_digest":"sha256:0fefa4b0058fd5ba746df8bfe12750e7860935e9583d97517e75aa91db4c53b8","observation_id":"4a50d179-76ff-46a8-bce4-4ffcff692ba5","resolution":{"observed_at":"2026-05-20T21:13:44.773975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:ea0aef9650ebc9f44e3b9e958b7bdcf4b59b7e99146d1b091b922f6e590f2c5b","observation_id":"05970f97-2491-4dfa-be92-e26319b89bde","resolution":{"observed_at":"2026-05-20T05:53:04.527660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.20158","last_updated":"2026-05-19T17:46:40Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:46:40Z","title":"Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T05:37:23.299943Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.20158"},"observation_digest":"sha256:62be39355eac83759868e3e76c4ca5a13e563a4db6cde8f0b6c062662da693fd","observation_id":"c014bab5-6996-423b-b930-9bf9c6509f2e","resolution":{"observed_at":"2026-05-20T05:38:05.063163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.25524","last_updated":"2026-05-25T07:27:28Z","snapshot_observed_at":"2026-08-02T22:33:46.152327Z","submitted_at":"2026-05-25T07:27:28Z","title":"ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:23:38.178195Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.25524"},"observation_digest":"sha256:19f6df4887a5f46a0821fcaa350ccbf442ebd6fd50fdfcf2332aeb6544be17ff","observation_id":"b4dbc6f8-3b17-445e-92ae-457a0d065b00","resolution":{"observed_at":"2026-06-29T22:23:59.845931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.27959","last_updated":"2026-05-28T03:13:45Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T04:52:42Z","title":"ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T13:41:44.049230Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.27959"},"observation_digest":"sha256:e0ab6a0ee3423f59ae2c7f4438baa8f904ee7318428443aa10888378d4195f5c","observation_id":"85f17c59-249d-408c-acc2-0d3fe13fe54e","resolution":{"observed_at":"2026-06-29T13:43:28.642947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.27960","last_updated":"2026-05-27T04:54:07Z","snapshot_observed_at":"2026-08-03T00:24:19.442122Z","submitted_at":"2026-05-27T04:54:07Z","title":"Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T13:38:01.819121Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.27960"},"observation_digest":"sha256:02bdfc574c43e3af221d66f8303a9c40aa3a56f19edc7b6abaa303c420c472f7","observation_id":"c3d27d2b-00ff-46ed-bcdf-653d8dd7df31","resolution":{"observed_at":"2026-06-29T13:43:29.020880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2605.30307","last_updated":"2026-05-28T17:51:38Z","snapshot_observed_at":"2026-08-02T22:39:52.853482Z","submitted_at":"2026-05-28T17:51:38Z","title":"Grounded 3D-Aware Spatial Vision-Language Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T08:08:36.012761Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2605.30307"},"observation_digest":"sha256:d4811fddb0a88d70af2be1a57201c857b75001f10cd5f48d1f1a5fd29b9afe95","observation_id":"65dd6ab2-5237-4ff1-9f72-0d32f2290ac7","resolution":{"observed_at":"2026-06-29T08:13:15.379490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:439c8caf3249661cb41baf3f0058085a7d88545c057e1a44878b37e975de8a5e","observation_id":"d9c0e8e4-f5d4-4704-9801-13007a9e5f77","resolution":{"observed_at":"2026-07-04T19:20:07.212605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-02T06:24:28.750079Z","title":null,"venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2607.12815","last_updated":"2026-07-18T02:07:01Z","snapshot_observed_at":"2026-08-08T00:31:08.602182Z","submitted_at":"2026-07-14T14:27:58Z","title":"Visual Access Boundaries in Vision-Language Model Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:24:28.750079Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2607.12815"},"observation_digest":"sha256:8e998e32660c1c93e43988168785d900f4f630b874d56861087cf5159c4ebe6e","observation_id":"d07fa59e-6f8d-4f08-aef1-664a84ff5b83","resolution":{"observed_at":"2026-08-02T06:24:28.750079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-07-31T16:13:17.383178Z","title":"arXiv preprint arXiv:2503.12799 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28154","last_updated":"2026-07-30T12:57:45Z","snapshot_observed_at":"2026-08-03T12:39:00.211104Z","submitted_at":"2026-07-30T12:57:45Z","title":"OPLD: On-Policy Latent Distillation for Multimodal Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T16:13:17.383178Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2607.28154"},"observation_digest":"sha256:b85b74679f50a4dd22b379627f366bc53363e3efc25d7b35b4b3146ef9d05dd7","observation_id":"5c1400db-a6ca-4bb0-afa2-ed604e0e375d","resolution":{"observed_at":"2026-07-31T16:13:17.383178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T19:03:11.202535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03450","last_updated":"2026-08-04T10:46:10Z","snapshot_observed_at":"2026-08-09T08:30:22.690408Z","submitted_at":"2026-08-04T10:46:10Z","title":"Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:11.202535Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2608.03450"},"observation_digest":"sha256:5260239529c1f2874a523867e3359af983a50cab98aa694de526f25e5e87aba6","observation_id":"23fadc11-0a1a-41f7-9d4d-9088468e9795","resolution":{"observed_at":"2026-08-05T19:03:11.202535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.12799/citation-record","integrity":"/paper/2503.12799/integrity","json":"/paper/2503.12799/citation-record.json","paper":"/paper/2503.12799"},"outbound":[],"paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2503.12799."}