{"as_of":"2026-08-07T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebb4b1f0358bc8cafdb6534fc730d972b8b38e2020d8feed503189db475d5fbc","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:05:52.524432Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:05:08.124096Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:26:14.022696Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"cited_work":{"arxiv_id":"2506.08817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08817","snapshot_observed_at":"2026-07-01T21:26:14.022696Z","title":"Video-cot: A comprehensive dataset for spatiotemporal understanding of videos based on chain-of- thought","venue":null,"work_id":"8d9acd65-4bc7-4f3b-805e-dfb46b9f4a1f","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2506.08817","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:be4b230acd3314c528b90d15f39d54386b9a51e2b358f5e56709afbabc7408c3","observation_id":"3c1f2cfd-c49a-4438-a077-9db5e8271014","resolution":{"observed_at":"2026-05-15T20:50:17.350435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"cited_work":{"arxiv_id":"2506.08817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08817","snapshot_observed_at":"2026-07-01T21:26:14.022696Z","title":"Video-cot: A comprehensive dataset for spatiotemporal understanding of videos based on chain-of- thought","venue":null,"work_id":"8d9acd65-4bc7-4f3b-805e-dfb46b9f4a1f","year":2025},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-07T02:28:05.002889Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2506.08817","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:b71e9b96afccb95b7fbde40766919b7fef68d67cfe43e9019c3ddb77b8236fc4","observation_id":"24ee94e1-8303-4108-aa2e-2f058298ad39","resolution":{"observed_at":"2026-07-01T21:26:14.024501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08817/citation-record","integrity":"/paper/2506.08817/integrity","json":"/paper/2506.08817/citation-record.json","paper":"/paper/2506.08817"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:05:48.635476Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.635476Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:b5cf36d51731f81d52597322f37f6c9360e0630a71cbf6d0247cef4808bb8de6","observation_id":"5bb3a05f-3d51-4414-aa4a-eae77d525432","resolution":{"observed_at":"2026-08-07T05:05:48.635476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:48.718880Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.718880Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:a7e1029653246f8dd2645625f74ada40cbef179ec4fb13159c753c4bf84a5a5a","observation_id":"0c20c3de-2ff6-4232-adf4-ecdb902442a0","resolution":{"observed_at":"2026-08-07T05:05:48.718880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:48.783213Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.783213Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:daf4fdf38b618c57637162f78b42322910603775b46b7a3e46fa5c38f9f4d632","observation_id":"dc856c4e-d01d-4bd3-b423-99e84f180559","resolution":{"observed_at":"2026-08-07T05:05:48.783213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:05:48.907545Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.907545Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:598c658b82ffbb50b0c4e7afe6d800b807a37b1e5c84fb9feda44908f965c8b5","observation_id":"ad00dba6-a2b0-420e-8401-97d03d124e81","resolution":{"observed_at":"2026-08-07T05:05:48.907545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T05:05:48.972426Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.972426Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:8a3ed7c265aea7df3e38c125c1073782fe9ac92200ac32f06dd6c188924003d5","observation_id":"2d51afe6-d7e0-45e8-9e31-499e2dac66c6","resolution":{"observed_at":"2026-08-07T05:05:48.972426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.587507Z","title":null,"venue":null,"work_id":"73845a41-685e-43a2-97de-6708057ecd45","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.032774Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ee24a2df832ff142392f7df4a322838af3224b9285faf5f0a89b7dc2d20be8a4","observation_id":"e8f286c9-559b-43cd-9f87-03f5b28a30cc","resolution":{"observed_at":"2026-08-07T05:05:54.623729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.127473Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.127473Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:c44199449d9a7fa21ad2b480d2de657e787c5d356ab1ba3822727dbd57ac122d","observation_id":"45845968-340f-41a2-83e0-240c62ece8e1","resolution":{"observed_at":"2026-08-07T05:05:49.127473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:05:49.226801Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.226801Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:04547a0e0ad17fff5e9bce260b04215f515d4b2212b5432d294f104af3d22a7e","observation_id":"be30a964-10a9-4205-8fd0-0c8eb3993f5a","resolution":{"observed_at":"2026-08-07T05:05:49.226801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.455258Z","title":null,"venue":null,"work_id":"740d0de7-b864-4dc0-935f-95af0900eeb9","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.272926Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:545d2d47a7b0edca33ec6c42d52cf178377bb1e27da98be180c1eccf7da2599b","observation_id":"34742e67-040f-4a7a-9e70-068b551af868","resolution":{"observed_at":"2026-08-07T05:05:54.503344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.377669Z","title":null,"venue":null,"work_id":"51d4875f-1079-43d2-9ff0-2501f593b25f","year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.337060Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:739780954a83bd7d5b3b208aa3b3f92613377e4392ef6d019b7c2394c75578ce","observation_id":"7289eca3-1ae7-408e-9086-e68a09dd1326","resolution":{"observed_at":"2026-08-07T05:05:54.412188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.298085Z","title":null,"venue":null,"work_id":"f037ddf6-516a-45aa-a511-8a93d8bd46d1","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.405079Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:81eada61b6a01e717a9507c716ee9d4d938a3c5651c87dfe2add890b1ff68807","observation_id":"8dc862f6-e5e3-43bd-821d-b8a7a9c1b479","resolution":{"observed_at":"2026-08-07T05:05:54.336836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.226395Z","title":null,"venue":null,"work_id":"787a6bff-657c-4388-98d1-e85d6f51ed4a","year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.482878Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e50a1deece0a9db8da0c12673a3f2a49a7414aad044f57d896e78f3595d2ab2e","observation_id":"e6b18c16-faef-4a5a-b53b-8358cfceb7fa","resolution":{"observed_at":"2026-08-07T05:05:54.249080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.162515Z","title":null,"venue":null,"work_id":"b0af32ef-cf4c-4826-bd0c-27c814edcf77","year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.536320Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:92a8765e1397c542aa708487c966431388cd036d88789b135413f284543cde03","observation_id":"c35d9176-81e6-4102-8e60-d4847392f46f","resolution":{"observed_at":"2026-08-07T05:05:54.197627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.556596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.556596Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ae88e58f41e7bd0a87685cba077e756bc6aefc645e72698857c8ac2a19de5a5f","observation_id":"f7ca53aa-bc24-46c9-91d9-710152be3999","resolution":{"observed_at":"2026-08-07T05:05:49.556596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-07T05:05:49.657151Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.657151Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:d5b1eb1bb5b631046c5cac3597415f41e11e4ad3c5b91865e31695d365210103","observation_id":"a9fb629d-3629-47a8-91f8-94e5bb752c8c","resolution":{"observed_at":"2026-08-07T05:05:49.657151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.733931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.733931Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:45ccc4f278ee451b0c12fc57e4e06ed222429a9a289d51ace6ccd5ee532aa3c6","observation_id":"870a9dec-b907-4825-8931-9b5e0a04c1fe","resolution":{"observed_at":"2026-08-07T05:05:49.733931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:05:49.800282Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.800282Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ba3b6c37c85ac2f9c8b5d6a5897f1eb4dfa8413fe34de2c14903e16b41126f79","observation_id":"37db3b06-e5cb-4610-a43d-2823f7bed0c4","resolution":{"observed_at":"2026-08-07T05:05:49.800282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.086502Z","title":null,"venue":null,"work_id":"e788977f-1c53-494a-8372-cacb614d7844","year":2014},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.844975Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:782f0b4ba7f8ba1ccf2656698d35d754c5d7ad3cf341ac370806dee9197155bb","observation_id":"6bfa53ee-8221-4807-8584-9be349890b09","resolution":{"observed_at":"2026-08-07T05:05:54.107770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T05:05:49.922593Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.922593Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:df05ec40e7a879a2e0a2e6cbfaf5ab9cb9b37da49101d22b17f3926b39208ce2","observation_id":"9244296b-2b9f-4ed3-876f-d9d4dd91443a","resolution":{"observed_at":"2026-08-07T05:05:49.922593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.998300Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.998300Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:374d34b1894323abf5129cf93483aecf03875ce953654c31050def9ac732334c","observation_id":"a3a44d40-732c-40c1-bdc7-c74c8059104a","resolution":{"observed_at":"2026-08-07T05:05:49.998300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:50.106312Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.106312Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:845865e1d0b75e8e2240154afb08294dab1c7c1a134a6d6b20ed3b55b7d7d920","observation_id":"d0f136bc-4194-4ab5-9013-016a1e8bf1f0","resolution":{"observed_at":"2026-08-07T05:05:50.106312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:05:50.302426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.302426Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:bcda890983ddc929d323efb9f4146e45c424d988b613d659d245519154291066","observation_id":"eb9729d3-c2fb-440f-8cb3-93a959fc0ed8","resolution":{"observed_at":"2026-08-07T05:05:50.302426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:05:50.381964Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.381964Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e161ed2dde4657505aae2db5ab8c1092755671ef27fff9efa7d5e728b6383e06","observation_id":"85e6105e-b847-47d6-90f3-150fec9a4228","resolution":{"observed_at":"2026-08-07T05:05:50.381964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:50.434498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.434498Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:d49395c721f57219c67e64177d8456716900e5812464840dbaf64063ca6fd8b5","observation_id":"011268a2-bc2b-48f8-b15a-1da400af515b","resolution":{"observed_at":"2026-08-07T05:05:50.434498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.879032Z","title":null,"venue":null,"work_id":"246a320d-44b0-4e15-a2e9-d3e4f808c069","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.524811Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:88346236d3451d74dbc9a4426fdc889b8de53f968545a167f071de18aefc4d6f","observation_id":"ce02b562-e23d-4321-8962-9fb6545b3e90","resolution":{"observed_at":"2026-08-07T05:05:53.914958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.804896Z","title":null,"venue":null,"work_id":"73776ea7-3c04-4dbe-9211-158f8c8368e8","year":2019},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.570583Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:9209fb3e691784bd2827a6038c4ded5a3650fe5ce1fafbd8ceec355b09b0e2c9","observation_id":"07fb5ba5-d66d-4b7f-9f0d-f28c1cc6b393","resolution":{"observed_at":"2026-08-07T05:05:53.838608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13132","last_updated":"2025-01-22T02:41:36Z","snapshot_observed_at":"2026-07-06T20:24:36.194914Z","submitted_at":"2025-01-22T02:41:36Z","title":"A Hierarchical Reinforcement Learning Framework for Multi-UAV Combat Using Leader-Follower Strategy","version":1},"cited_work":{"arxiv_id":"2501.13132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13132","snapshot_observed_at":"2026-08-07T05:05:52.854484Z","title":"A Hierarchical Reinforcement Learning Framework for Multi-UAV Combat Using Leader-Follower Strategy","venue":"cs.MA","work_id":"7d7b82e9-5957-421d-86a3-ec451aeadfe8","year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.617505Z"},"links":{"cited_paper":"/paper/2501.13132","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:689e20127f7c95ee1ae84869e5730e70cc0089cfa716037ef4cfd6551e3576b5","observation_id":"5f02ac96-0acf-40be-bbac-f1541978648b","resolution":{"observed_at":"2026-08-07T05:05:52.891078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.695858Z","title":null,"venue":null,"work_id":"e6ac124d-feb9-427b-af1a-a7240c5e68c5","year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.695041Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4a191fb33552fd621ab9f4e1616656be01c646ab29fa4edc9ed410f20ef93761","observation_id":"52826fff-791f-4ee0-b6e3-2dc7c6cc644e","resolution":{"observed_at":"2026-08-07T05:05:53.733960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.540905Z","title":null,"venue":null,"work_id":"ffa3f90b-6675-4faa-bb36-3309abcb0456","year":2020},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.749177Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e2f3bdb2a3ff3ea81dd5c141c121f46b75b79e7a06e19ddc7d088bc3edeef245","observation_id":"545ae7e5-360c-463b-94b1-9b9bbdeb0933","resolution":{"observed_at":"2026-08-07T05:05:53.623654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T05:05:50.794819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.794819Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:3c3fb7d7bfeb8d0024e491a550bb11f1ed5dba3f80bba1d1bea684607963d7ce","observation_id":"9b435fac-ba84-4bce-a64c-509e62ab856b","resolution":{"observed_at":"2026-08-07T05:05:50.794819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.432260Z","title":null,"venue":null,"work_id":"cc093bd2-2f31-4035-bb62-c20b572f5db8","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.823238Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:2426aa3cbd4f37d522b62bba2aed738855eb215192952b63f73d946d3393dc9a","observation_id":"f37a610c-9f3a-4389-ab15-0faeda8ee81e","resolution":{"observed_at":"2026-08-07T05:05:53.475500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T05:05:50.986480Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.986480Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:c8afb2d77156b785ca312bbf2cf958af7d5ed3d348f065f93a993c13926719ae","observation_id":"3b56d1d7-9785-4bd2-8a21-d6024728f220","resolution":{"observed_at":"2026-08-07T05:05:50.986480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T05:05:51.040823Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.040823Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:7f3ffed628c77649daebb70e58bf9c8da9167add63e219c3947890ca6f3d7b8f","observation_id":"670e4871-610a-48f4-beaa-f688a8d2c2a2","resolution":{"observed_at":"2026-08-07T05:05:51.040823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00778","last_updated":"2025-03-02T08:04:44Z","snapshot_observed_at":"2026-07-06T20:45:08.434808Z","submitted_at":"2025-03-02T08:04:44Z","title":"AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00778","snapshot_observed_at":"2026-08-07T05:05:51.113645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.113645Z"},"links":{"cited_paper":"/paper/2503.00778","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:b0bb059e9739f627dde5177e73e46380c90fcfdf3b478110c9f1887a9c92d0c9","observation_id":"8268e98b-cb9a-496f-be14-873e0afb1ee1","resolution":{"observed_at":"2026-08-07T05:05:51.113645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.156506Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.156506Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:3019d3eec7e6ed921cfc9ba7610337f8750f7d995600ff94c655708d421f93c7","observation_id":"3c9ea9b9-9b8b-455f-9416-0a93b2cecd2f","resolution":{"observed_at":"2026-08-07T05:05:51.156506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:05:51.174239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.174239Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:00a2fc019c0f60aadd053d3d83515c7780e666009de9a51669ab3fff8bc16271","observation_id":"154ac2fd-1843-47dc-a81a-9cbd42e0e491","resolution":{"observed_at":"2026-08-07T05:05:51.174239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:05:51.222586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.222586Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4679ac255af446998b8a00f0dffad9fc87523153928a1753417fa0fed891eae9","observation_id":"dfcfbc84-64a7-471a-b4e7-bcf3b59f2c27","resolution":{"observed_at":"2026-08-07T05:05:51.222586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-07T05:05:51.278905Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.278905Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:fc3a4e9d5053ad9e9d173cd3d43f320afc2d3ca5300a215e971a814a7186d8bc","observation_id":"06d262f9-5160-4354-bb14-4ce73c8dbb54","resolution":{"observed_at":"2026-08-07T05:05:51.278905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T05:05:51.321299Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.321299Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:2a6ade8ee3114650d5eeceb9d3ddeeaa0a4412e6056894c122bed7f965a73325","observation_id":"be460529-5b58-4610-be7f-b68b835bcbec","resolution":{"observed_at":"2026-08-07T05:05:51.321299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T05:05:51.389244Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.389244Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e7d380c8ef721fdfd90dd4614108898159ed450bc59a9e2029e58968495b7f36","observation_id":"dc595d87-8263-4001-ad95-c20fdf1fbb47","resolution":{"observed_at":"2026-08-07T05:05:51.389244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.452700Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.452700Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:188ea43c8cf5d1be702e6e881f0143a6418f2687b0d8462a88bf85c546bba7db","observation_id":"fad9e6b4-fe1e-405e-810d-9ec4116d083e","resolution":{"observed_at":"2026-08-07T05:05:51.452700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.531489Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.531489Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4bd9334ebd25598eb2b5ed8538667df9d449e3657b921d3ef243ec7f8c421aaf","observation_id":"7e64901f-1273-4103-ad89-2459ca0a4ad2","resolution":{"observed_at":"2026-08-07T05:05:51.531489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.727388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.727388Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:20bf6adeb0aa41e272276a5018f1195201a1b24ac9e59d99d1771f5c82694d2b","observation_id":"383f9987-eab1-40c9-98ae-e2b977407e5d","resolution":{"observed_at":"2026-08-07T05:05:51.727388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.766666Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.766666Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:6a47a50789e94f0dbc7e6c8f8ec06742adee7cb31b319f5ec0d461942fe64b91","observation_id":"cca739ce-27b4-4b82-bfb1-b54fc1421926","resolution":{"observed_at":"2026-08-07T05:05:51.766666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.173849Z","title":null,"venue":null,"work_id":"a6531060-e399-4140-8a6c-39b127a297e9","year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.808790Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:96e08080394cb5160b280640ad5b61ca99259e292a5abe245cfb82d4ab0b74a1","observation_id":"25eb0420-15b6-4e50-a4d0-e66fe251e329","resolution":{"observed_at":"2026-08-07T05:05:53.208143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-07-06T20:38:00.177933Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-07T05:05:51.881077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.881077Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:dd9fffeb4656ef5712744d2a7c3878632ce1a8ab3bfe2f10d4bbe968c3e4964b","observation_id":"5edce4f5-8057-4003-b349-e0275c3d0714","resolution":{"observed_at":"2026-08-07T05:05:51.881077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.932240Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.932240Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:16478bd3990c9f5893f09c6200d5938d1e4f35bd7c6893dd2900df09a9546f0c","observation_id":"5c434370-7d88-4e53-9b1d-3bc0a6e97398","resolution":{"observed_at":"2026-08-07T05:05:51.932240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10906","last_updated":"2024-09-17T05:53:04Z","snapshot_observed_at":"2026-07-06T19:16:32.330760Z","submitted_at":"2024-09-17T05:53:04Z","title":"Multi-Floor Zero-Shot Object Navigation Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10906","snapshot_observed_at":"2026-08-07T05:05:52.050076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.050076Z"},"links":{"cited_paper":"/paper/2409.10906","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4d8b48a97c04d027435845c9d430c5a6a6f45aaf986919c8f2ca8cca0fb34265","observation_id":"f74ad4db-bbe2-4757-bf7f-74ee999b15a5","resolution":{"observed_at":"2026-08-07T05:05:52.050076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-05T02:09:19.150032Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-07T05:05:52.150407Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.150407Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:d387caafa0f6640279bd28ebb1edceca27d9a5e04895577bbc2937b7a84f932b","observation_id":"3aa44a55-2906-47d5-8c55-b4bd0248f676","resolution":{"observed_at":"2026-08-07T05:05:52.150407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.089044Z","title":null,"venue":null,"work_id":"efb717b6-9d50-49b8-bd44-27b54c336c8d","year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.262230Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:2f08e6972e112519dfbf9b5ea184ea4feab1dee57224fb19b1a4453172d532b3","observation_id":"f030983c-b298-4f1d-aa5a-bf5106fa7115","resolution":{"observed_at":"2026-08-07T05:05:53.121846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13451","last_updated":"2026-05-09T11:40:06Z","snapshot_observed_at":"2026-08-02T06:35:33.765328Z","submitted_at":"2025-02-19T05:52:34Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13451","snapshot_observed_at":"2026-08-07T05:05:51.969310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.969310Z"},"links":{"cited_paper":"/paper/2502.13451","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:b7b7187dd78f1a65181e0ae3e8d6f808d3a3279386d0a87ac5a2cf547390149f","observation_id":"c48b353d-8920-456e-bd51-8f4dbf33385e","resolution":{"observed_at":"2026-08-07T05:05:51.969310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:05:52.403000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.403000Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0f6e8cb9d593c57cf6db0d1ceaf6e143bce438a51ab9cb8c526fbc2983394252","observation_id":"13dd506a-9ce8-4054-af5f-43844a6ab1c3","resolution":{"observed_at":"2026-08-07T05:05:52.403000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:52.452676Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.452676Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4b3c536997defcaced409089900fce259322700d5fd7cf4c68ceb8ceb1c5c678","observation_id":"ba8c163e-b26f-4ddd-8163-f842de1875b1","resolution":{"observed_at":"2026-08-07T05:05:52.452676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T05:05:52.320226Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.320226Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:8371150613cafcdbdee8b9db4c473379a5045f4b4d993c0e67abad33df7ae001","observation_id":"f7c99c30-876e-410f-a74d-9c6175633fc5","resolution":{"observed_at":"2026-08-07T05:05:52.320226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.970138Z","title":"InProceedings of the IEEE International Conference on Computer Vision","venue":null,"work_id":"7f333bce-13d9-4999-bc2b-91a8401e5a8b","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.187477Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:d8cf48282301ed0e4e0e8f41b9e0e1a175e87e39f07bf6a74255f099804af524","observation_id":"fd1f3ac7-99db-4b8d-8c00-7f2e08109049","resolution":{"observed_at":"2026-08-07T05:05:54.009897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:52.524432Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.524432Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:d67fd13f6f0503e9d94afa9d3ca232e275ccc650132fb3465e20b51daa28cda0","observation_id":"03b014c6-c455-4380-aa62-984570a8de8e","resolution":{"observed_at":"2026-08-07T05:05:52.524432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.264157Z","title":"In European Conference on Computer Vision","venue":null,"work_id":"245efec9-14a6-4ae2-86d6-9339409cab08","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.609150Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:cb896e55e509cdb0bd3789297fe932ecf1bd181a8048636ba0cc7935135771dd","observation_id":"9bec9162-b2a2-4d5a-b069-e8adac345cfa","resolution":{"observed_at":"2026-08-07T05:05:53.292380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.353584Z","title":"InIEEE International Conference on Multimedia and Expo (ICME)","venue":null,"work_id":"3a43c2ce-e07b-49cb-8712-a9a03eb65952","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.898675Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:dbe4a816f52d15cb724e305f3285803fa65beb2ce359b0368dbd9ee63c28f279","observation_id":"50aa44b2-301c-4222-b0e4-d1aa835901ab","resolution":{"observed_at":"2026-08-07T05:05:53.399864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2506.08817."}