{"as_of":"2026-08-07T22:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:759f9a9b9d6b9d1cabe5a62f2492e476654ea708912c351435794899e71b5b1d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:18:57.344627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T08:57:47.799001Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T05:36:15.540187Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07575","last_updated":"2025-06-09T09:20:20Z","snapshot_observed_at":"2026-08-07T05:28:03.889420Z","submitted_at":"2025-06-09T09:20:20Z","title":"Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:15.540187Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.07575"},"observation_digest":"sha256:d47ff9c159c86f1bf91d340a5ab1326dacb712b23f84ea9fb2435985d00bc4de","observation_id":"2347e678-cf70-4e00-b626-809cef25365c","resolution":{"observed_at":"2026-08-07T05:36:15.540187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:22:55.838095Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.838095Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f2b867bc1ad19662e05b7704bf27cfd2eee2b610dba9521303ee02a2954cf882","observation_id":"9675d94b-f65d-4fbb-a217-82b0059f9647","resolution":{"observed_at":"2026-08-07T04:22:55.838095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:07:32.061606Z","title":"Video- of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.061606Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a4d09d603c558e2b5a78273ca4e8fef63c4cfacdeb5d35c9cddfb7fced725890","observation_id":"90ecb6a8-ce9f-4510-9908-270fc34ff20f","resolution":{"observed_at":"2026-08-07T04:07:32.061606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T11:18:57.344627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14805","last_updated":"2025-08-12T17:07:53Z","snapshot_observed_at":"2026-08-07T11:11:27.738711Z","submitted_at":"2025-06-03T13:44:14Z","title":"Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.344627Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.14805"},"observation_digest":"sha256:360c08d60d76946c873143827df637b806dc5d02bb38f075a0756c35bdebe7b3","observation_id":"480c83b2-d71e-49d9-a101-d9b45129049b","resolution":{"observed_at":"2026-08-07T11:18:57.344627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:08:53.934003Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition.arXiv preprint arXiv:2501.03230, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14827","last_updated":"2025-06-13T13:39:53Z","snapshot_observed_at":"2026-08-07T07:12:40.611388Z","submitted_at":"2025-06-13T13:39:53Z","title":"DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:53.934003Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.14827"},"observation_digest":"sha256:111bbd30098277ead3ebf3674f45c153db78e6d4343e5295aef91d9dfc85e1d6","observation_id":"2ce8fd4d-5cef-4121-8368-d09de60cdb0a","resolution":{"observed_at":"2026-08-07T04:08:53.934003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-06T15:14:17.320440Z","title":"Fu, C.; Dai, Y .; Luo, Y .; Li, L.; Ren, S.; Zhang, R.; Wang, Z.; Zhou, C.; Shen, Y .; Zhang, M.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16878","last_updated":"2025-07-22T12:29:13Z","snapshot_observed_at":"2026-08-07T21:56:12.554033Z","submitted_at":"2025-07-22T12:29:13Z","title":"CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:17.320440Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2507.16878"},"observation_digest":"sha256:6f5842246de43f77aee4033b771fd18f8db10bf190a1dd78e5fe79218f9aa10c","observation_id":"01f3cec6-94bc-4467-b9a8-00f90c6b63fb","resolution":{"observed_at":"2026-08-06T15:14:17.320440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-05T20:28:57.362974Z","title":"Fei et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-07T18:23:08.889281Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:57.362974Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:b0b3f4220af9a26a0805d1b73b42e04ae0dcc06691fde063d67f8f97b5891da3","observation_id":"4359e34a-b13d-4732-aa9a-1f327d90bb74","resolution":{"observed_at":"2026-08-05T20:28:57.362974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-05T16:05:18.612817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19024","last_updated":"2025-08-26T13:42:48Z","snapshot_observed_at":"2026-08-05T16:05:02.921452Z","submitted_at":"2025-08-26T13:42:48Z","title":"ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrieval","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T16:05:18.612817Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2508.19024"},"observation_digest":"sha256:647d4d775d05690cb69b60810a06c5b3472700f45a39bec4562f4819da7ed4e8","observation_id":"f57066a7-b0b7-4587-9c3a-b9919b65d70d","resolution":{"observed_at":"2026-08-05T16:05:18.612817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-04T20:20:36.704406Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-06T13:15:27.312512Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.704406Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:f9772019a7b614c7d8c4d261812c8c36afad4c10784851a669e5382486b19219","observation_id":"06ccf859-2cfb-4de3-bcfe-fe36e36c6fe1","resolution":{"observed_at":"2026-08-04T20:20:36.704406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-04T00:15:15.354915Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02360","last_updated":"2026-05-26T12:26:50Z","snapshot_observed_at":"2026-08-04T00:15:08.705793Z","submitted_at":"2025-11-04T08:28:46Z","title":"LaRe: Latent Refocusing for Multimodal Reasoning","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T00:15:15.354915Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2511.02360"},"observation_digest":"sha256:a17575b5e3f2b1e3259902202a6f954fc0ecca2dbc2bd7b4672690ed01f3151d","observation_id":"0cab05a2-37db-4e22-9ab5-6e1e9e8df3d7","resolution":{"observed_at":"2026-08-04T00:15:15.354915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2603.03944","last_updated":"2026-04-03T20:11:12Z","snapshot_observed_at":"2026-07-06T22:47:46.409064Z","submitted_at":"2026-03-04T11:09:39Z","title":"SCP: Spatial Causal Prediction in Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T16:47:44.523606Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2603.03944"},"observation_digest":"sha256:a2e7ee54f405c261be6fd347c710207d6e4a46cce5cdad6f1381cf64f8bec19a","observation_id":"ffab02f4-3f31-4207-9b4f-1da7cea574b9","resolution":{"observed_at":"2026-05-15T16:50:11.257532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-14T22:25:04.080629Z","title":"Video- of-thought: Step-by-step video reasoning from perception to cognition.arXiv preprint arXiv:2501.03230,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.12252","last_updated":"2026-06-18T07:56:55Z","snapshot_observed_at":"2026-07-14T22:25:02.474086Z","submitted_at":"2026-03-12T17:58:48Z","title":"EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T22:25:04.080629Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2603.12252"},"observation_digest":"sha256:23c8e15f5d3fe9389c843285c431e49ea64e4e9d48d609320acae9ebafd54ecc","observation_id":"0fdad807-aa9f-4112-b2a9-f42f8e0db055","resolution":{"observed_at":"2026-07-14T22:25:04.080629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2604.11399","last_updated":"2026-04-13T12:41:50Z","snapshot_observed_at":"2026-07-06T22:59:49.614780Z","submitted_at":"2026-04-13T12:41:50Z","title":"Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:43.948462Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2604.11399"},"observation_digest":"sha256:c1f177b084f6a9aaa6982a46121b009405092b61c50275d9aa79f5e6d9187c4a","observation_id":"0d6f5247-243e-4e29-b227-e69e78685e10","resolution":{"observed_at":"2026-05-11T09:56:05.690356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T12:03:09.408019Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:fe8ac5f2a3571e96d6b3dcfaa426b344a2cee1b21fd58de9bbf65bc3c93ff629","observation_id":"6d566b1f-c33e-478e-be43-1413a3faa1dd","resolution":{"observed_at":"2026-05-10T12:05:22.155788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T17:34:10.344111Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:40a5b36de18750b15c5823dc5d7451e3a29505db6563319979db442986c5476a","observation_id":"e74bd42d-a812-4456-a4f0-cd6f30bd7042","resolution":{"observed_at":"2026-05-19T17:37:41.741853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2604.17375","last_updated":"2026-04-19T10:58:40Z","snapshot_observed_at":"2026-08-02T21:21:44.410489Z","submitted_at":"2026-04-19T10:58:40Z","title":"When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T06:41:59.641410Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2604.17375"},"observation_digest":"sha256:9a56e783fc4bc45c117c206156c88ab908d7f0572b1e002831cf315dfee07f63","observation_id":"ab8ee26b-d76d-4004-a8de-38e451d00b96","resolution":{"observed_at":"2026-05-10T06:46:37.539454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2605.01657","last_updated":"2026-05-03T00:52:51Z","snapshot_observed_at":"2026-08-02T06:05:08.178689Z","submitted_at":"2026-05-03T00:52:51Z","title":"Act2See: Emergent Active Visual Perception for Video Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:53.683729Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2605.01657"},"observation_digest":"sha256:0b1e6de540bbf5484333db34a9fcb6f7620672f082df0cb956c8e1933adc8204","observation_id":"aecfa82f-bb1c-4e17-b1ea-9835a388b5e2","resolution":{"observed_at":"2026-05-09T05:45:22.936174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2605.10106","last_updated":"2026-05-11T07:20:09Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:20:09Z","title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:23.681682Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2605.10106"},"observation_digest":"sha256:001a930d66c182c0707ad9c6dce946c09eb2f50d3e10955db4507e18beb0d656","observation_id":"09ead882-9a5b-48be-b467-633f37849428","resolution":{"observed_at":"2026-05-12T06:46:35.770004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2606.02724","last_updated":"2026-06-01T18:00:08Z","snapshot_observed_at":"2026-08-02T20:01:29.972723Z","submitted_at":"2026-06-01T18:00:08Z","title":"AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T15:00:41.632699Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2606.02724"},"observation_digest":"sha256:66d36e4116c11634e580b19590383f931508c060e6bd195efd96c79bce3734f0","observation_id":"bbb98392-7b8e-4250-bac0-197f37dd3781","resolution":{"observed_at":"2026-07-01T22:46:20.158878Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:84be35b8cb4d012f7f21f8e334099a86b2bfe52a731c838ad8019125b40e5d89","observation_id":"db96b895-cc57-46af-b777-73f535fa5fc5","resolution":{"observed_at":"2026-07-02T17:27:15.742811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2606.09181","last_updated":"2026-06-08T08:20:42Z","snapshot_observed_at":"2026-07-06T23:48:35.190418Z","submitted_at":"2026-06-08T08:20:42Z","title":"Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T16:55:35.743040Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2606.09181"},"observation_digest":"sha256:5567bdf42bd5d74ded9bea9d7efd945a52a930ce1e426d0fcff906458d1b47e3","observation_id":"d3fa565a-c03c-4bc6-82f0-7c6b65c5f10a","resolution":{"observed_at":"2026-07-03T00:57:30.197957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":"2501.03230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-07-03T08:57:47.799001Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b4d9e906-847b-4771-a19d-e9934b8c86e7","year":2026},"citing_paper":{"arxiv_id":"2606.11838","last_updated":"2026-06-10T09:18:14Z","snapshot_observed_at":"2026-08-06T21:17:53.881790Z","submitted_at":"2026-06-10T09:18:14Z","title":"Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T10:37:52.186246Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2606.11838"},"observation_digest":"sha256:ae1a1f9550472bd950eef0ff0be65dfd7edd78340f6c4647c3db92bc06ad4dd1","observation_id":"cce4ce6e-70f5-48c3-bd5d-1e146ed7bfbf","resolution":{"observed_at":"2026-07-03T08:57:47.800558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03230/citation-record","integrity":"/paper/2501.03230/integrity","json":"/paper/2501.03230/citation-record.json","paper":"/paper/2501.03230"},"outbound":[],"paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2501.03230."}