{"as_of":"2026-08-07T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2eb428027d8fc202a591c90617a50da01d8004de93772b445ae309f652f57c05","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:06:26.838928Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:22:42.836941Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:26:27.039487Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-07-13T15:50:48.216413Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T23:53:19.148407Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:de9014c7898a831025e1cf9065fc15444e1ee41de9c20fccf4a14586e0f121c2","observation_id":"370ffc45-bcfe-4ee6-88f1-589cbeb5489e","resolution":{"observed_at":"2026-05-13T23:53:28.169730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-13T15:50:49.083652Z","title":"Temporal chain of thought: Long-video understanding by thinking in frames, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-07-13T15:50:48.216413Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T15:50:49.083652Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:694f306c1b0232af5ab406b4a1e32ce69ef92a3cb509f10cac8281bb7dee89ac","observation_id":"1ee4d66e-d02f-4c03-80d8-7cd159425f45","resolution":{"observed_at":"2026-07-13T15:50:49.083652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2605.06185","last_updated":"2026-05-07T13:01:28Z","snapshot_observed_at":"2026-07-31T08:26:58.598336Z","submitted_at":"2026-05-07T13:01:28Z","title":"Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T10:15:15.129358Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2605.06185"},"observation_digest":"sha256:5eb7235031bbbe4aa709d556cede859242158f68790d70c99d8dbe31b481ed7f","observation_id":"18b041e5-2a84-4125-a0b2-c384cbdce99d","resolution":{"observed_at":"2026-05-11T20:06:13.284145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2605.10936","last_updated":"2026-05-11T17:59:17Z","snapshot_observed_at":"2026-08-02T15:59:41.195828Z","submitted_at":"2026-05-11T17:59:17Z","title":"Personal Visual Context Learning in Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:42:15.402131Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2605.10936"},"observation_digest":"sha256:80fb1753b321a7d910426f2dc330597c4fe0762270e3f35c1a96c176212f69aa","observation_id":"3a28ed55-3902-4a5a-bbe6-ce055291ed38","resolution":{"observed_at":"2026-05-12T07:06:37.196047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-01T16:56:58.243776Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:e57e6619884d6fed0e6c1bc94ca9ca765d701891b2993a5ae534bad6251e027b","observation_id":"09716617-b19c-4d9a-b9a6-7492d3692ca2","resolution":{"observed_at":"2026-05-22T05:56:07.853544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2606.03100","last_updated":"2026-06-04T05:13:15Z","snapshot_observed_at":"2026-08-01T16:37:35.015535Z","submitted_at":"2026-06-02T03:38:51Z","title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T10:54:02.188634Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2606.03100"},"observation_digest":"sha256:c02c697a335ec5ccf4f0cf489f79af762fcee69e6d1b5c33b53bbe0658cc03f7","observation_id":"30a53c02-f069-4af1-9e5b-240630cbf94d","resolution":{"observed_at":"2026-07-02T02:26:27.041380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:81ecdb0a80084d98737cc79214f3a58821715b75b149de5de7ffc8f724091801","observation_id":"18343c31-284e-4b4d-bcea-e216b7bff1d3","resolution":{"observed_at":"2026-07-01T10:25:41.855643Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-08-01T21:22:42.836941Z","title":"arXiv preprint arXiv:2507.02001 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-06T12:38:24.456240Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.836941Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ecce1653477cca5a170c5b1b15835a9d36d930dce2aa5e25f50b2e5db4936482","observation_id":"be4b30a9-dbd6-4ef6-80e1-276ccb3bb29e","resolution":{"observed_at":"2026-08-01T21:22:42.836941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02001/citation-record","integrity":"/paper/2507.02001/integrity","json":"/paper/2507.02001/citation-record.json","paper":"/paper/2507.02001"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.171795Z","title":"Gpt-4o mini","venue":null,"work_id":"8cf4dd2c-d232-432c-89e7-588b9238322d","year":null},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.538741Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:3426e6488c5a0b0295ccff6300c7c06c73d32dc525088addb513f43fc00f0ca0","observation_id":"bcde3505-031a-47dc-8c7e-28b63fd461ce","resolution":{"observed_at":"2026-08-06T21:06:28.175558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:06:26.543483Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.543483Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:0f24b10652e584d374cae12d711009354ec0e60b04bd74ca73b61ed5d844d742","observation_id":"387d2518-9558-4198-8746-035ed713012a","resolution":{"observed_at":"2026-08-06T21:06:26.543483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.158155Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"49cb8fdc-c92f-49eb-b025-ab7c2f2a9f38","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.548152Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:5dc08f3e6c10c7fce1859fbbf50ac5310cc88db916bb87146509814d87ac1eea","observation_id":"df9f3100-4bd4-49f7-bc8a-19f485fb67d3","resolution":{"observed_at":"2026-08-06T21:06:28.162319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.552134Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.552134Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:97e69a7691e9993d48a511844f4f9dcb4b40a988567b06279a65f46532107e33","observation_id":"a3fff511-2d54-4ba5-924c-34e764c4af5d","resolution":{"observed_at":"2026-08-06T21:06:26.552134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.133800Z","title":"Goldfish: Vision-language understanding of arbitrarily long videos","venue":null,"work_id":"86348be7-b675-4b6a-a450-9c06fdb6d5d3","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.556279Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:40a78a3f081d07c793d0b40bbbbb5b7b53c3b214da3e578dd372c18d7efecb9d","observation_id":"1d6782b4-c2e0-431a-94e4-f55867eea3e2","resolution":{"observed_at":"2026-08-06T21:06:28.138085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:06:26.560339Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.560339Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:913238dabd7e8d3f9a93586ebd1ce462ab0e16857e6b16871342d4a713180249","observation_id":"1bb50a06-d606-498e-8032-3fba727674ad","resolution":{"observed_at":"2026-08-06T21:06:26.560339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.120012Z","title":"Memory consolidation enables long-context video understanding","venue":null,"work_id":"3066b060-67a4-493e-b3d5-0de1701f6a46","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.564549Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:30556d4ac7fbe1fc151ae93da894bd3f4094458a8d93303ac4b96008f67dfbba","observation_id":"2c33cb58-731a-4887-a63f-3562ed3586e6","resolution":{"observed_at":"2026-08-06T21:06:28.124247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.568878Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.568878Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:f058e16dab67769ffa384b5d8dd415055660ce6c12c5bb0417bdc138ee94e9c1","observation_id":"3bfd2c42-7b29-4306-b3ca-7b797d31df8b","resolution":{"observed_at":"2026-08-06T21:06:26.568878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T21:06:26.572809Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.572809Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:b98e0703e2c3c2a923b149e16bf08f3166ba48c8efedee39c07f67f19a005da3","observation_id":"72cec564-9794-4885-b89a-fc12884bd531","resolution":{"observed_at":"2026-08-06T21:06:26.572809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.092917Z","title":"Revisiting the\" video\" in video-language understanding","venue":null,"work_id":"e27390af-3d3a-4c92-b477-4ef5656186e2","year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.577040Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:e8d6c9c9b1bdd8b02a604773a460408ea37d105db3ca302c8d5b4d47a828a55c","observation_id":"9eade738-2545-4b18-8bc3-c3da1305d5a0","resolution":{"observed_at":"2026-08-06T21:06:28.097441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:06:26.581070Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.581070Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:2300763f308ef813741a72a51b4f8314ad5668e8c365f10a9ac09ff1b4cf45eb","observation_id":"020fde4c-2d0c-472a-b5d5-1404fd8f37f7","resolution":{"observed_at":"2026-08-06T21:06:26.581070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.077639Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"19548f87-1194-46ab-bc00-5e46df3fffab","year":2017},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.586086Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:ba38a3f197f008432591a5e912f502aeda962a2e1b84e6468a8dc50cd3342c21","observation_id":"ccc1dec2-8b47-4260-84de-ddc1f6e35162","resolution":{"observed_at":"2026-08-06T21:06:28.081757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.063547Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"832ca69c-233d-44d8-aba2-784bb66651f9","year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.589942Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:df46f6f5e5fa6a537553f58318d06619d2c1582d97bfb7fe8cc7e6cd1059f809","observation_id":"d9f97327-4c3b-4d82-befa-5acd394c998b","resolution":{"observed_at":"2026-08-06T21:06:28.067867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05238","last_updated":"2022-12-10T07:51:52Z","snapshot_observed_at":"2026-08-01T15:45:02.127276Z","submitted_at":"2022-12-10T07:51:52Z","title":"Structured information extraction from complex scientific text with fine-tuned large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05238","snapshot_observed_at":"2026-08-06T21:06:26.593731Z","title":"Structured information extraction from complex scientific text with fine-tuned large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.593731Z"},"links":{"cited_paper":"/paper/2212.05238","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:ea141952d98c8e67c32b8adbdff9c385fec2555bf94dfca3e2afe1116afaa631","observation_id":"5b0c2ca9-0df1-409b-b09e-da75570ff7f3","resolution":{"observed_at":"2026-08-06T21:06:26.593731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.049268Z","title":"Videoagent: A memory- augmented multimodal agent for video understanding","venue":null,"work_id":"3615ac9f-faad-4bea-8840-eb3cc67d9419","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.598035Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:ddfb9c725a5baf9b3b820082b5cc2d26a346c6c1534b510f276140a83f0ed223","observation_id":"31d1563e-9bba-492c-af3d-4bf8f36f16ff","resolution":{"observed_at":"2026-08-06T21:06:28.053783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.034938Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"b27819e2-0530-41e5-9ff9-693eed622d77","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.601910Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:5f3c47d9eafb1e72c7c01dd75f16f1cc26a618f225f2580efb3741bb8dd8221b","observation_id":"292ead10-8221-4de8-baf0-223240bfdcd7","resolution":{"observed_at":"2026-08-06T21:06:28.039620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:28.019936Z","title":"Vertex api","venue":null,"work_id":"092b5e44-211c-4507-a8cd-8a1970c41bbe","year":null},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.605942Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:00a62b98d2f37b4e1d2675f3e2b6af82914b971a0d13a729cb39d13d81dfdaa1","observation_id":"1a18afce-cbae-4a1e-9105-f474d547a1b7","resolution":{"observed_at":"2026-08-06T21:06:28.024304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.610165Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.610165Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:bb3044a8f886e809efbc03afc440b6409c67c6c40d811f9f25af069eea34c883","observation_id":"890ce2db-a15c-4099-9972-913c0d04f47f","resolution":{"observed_at":"2026-08-06T21:06:26.610165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:06:26.614422Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.614422Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:7f336a46782e35e4330c289971f941c49e85dafd2e06ce736a1f2787333b5247","observation_id":"b86b1bc8-177e-4ca4-989c-95d8b663f6bc","resolution":{"observed_at":"2026-08-06T21:06:26.614422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-06T21:06:26.618589Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.618589Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:16cad8170daf01744835d20ce7ae625839907365aa8f60c3f1d320c224f3f2ab","observation_id":"55638bfe-9742-4f24-9d1a-33ba2c263953","resolution":{"observed_at":"2026-08-06T21:06:26.618589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.622743Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.622743Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a9db0d63c773a31e5f48e22d3fb5cec1ad1ad3ac9cbe2ba3bd3793c8bfe3b371","observation_id":"5c80fa2e-4634-4f6b-9b35-e3e13991eac9","resolution":{"observed_at":"2026-08-06T21:06:26.622743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-06T21:06:26.626813Z","title":"Ruler: What’s the real context size of your long-context language models? In arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.626813Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a37c8f80e0e9788fb410630d93222f1b9cf95bf14673b4a35cc39016416f3b61","observation_id":"68a1f1d5-3093-4483-970f-36a8124c05eb","resolution":{"observed_at":"2026-08-06T21:06:26.626813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.985769Z","title":"Unsupervised dense information retrieval with contrastive learning","venue":null,"work_id":"08ff8ab3-9b38-4693-bf13-88f461305369","year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.630935Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:702b4f3a15b43dc98eda8f5aa6351a1aa7a33233390b1d5e72b17f1f7587dd4b","observation_id":"8a4bb54f-4386-45f1-a7e6-378cef52d6ef","resolution":{"observed_at":"2026-08-06T21:06:27.990130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.970565Z","title":"Perceiver IO: A general architecture for structured inputs & outputs","venue":null,"work_id":"03f5c45a-b61f-4572-92ce-c22c03c34510","year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.634902Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:20761d0951cf4ac04101cccfb6b561608e04b5caebcc2cb2431fa065af153566","observation_id":"46c95784-9ad3-47d5-987f-fb2bc8b469a7","resolution":{"observed_at":"2026-08-06T21:06:27.975679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.954894Z","title":"Action genome: Actions as compositions of spatio-temporal scene graphs","venue":null,"work_id":"61b4fbc0-3997-41b7-a5cd-4c5ba7fdb41d","year":2020},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.638949Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:35cc6ada3cc7e1b3d2ef8f0ddda41f661ebf1ddcf80779f6b0ff541205480ae7","observation_id":"2c94b909-942e-498a-bd5c-b7481be88167","resolution":{"observed_at":"2026-08-06T21:06:27.959177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.940828Z","title":"Billion-scale similarity search with gpus","venue":null,"work_id":"c382ce24-3766-4ae7-ba80-97257e17a46d","year":2019},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.643001Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a5045f972abfb26555f5cf800fd5b6247e405c918d6ca737cb65d1587dfdb2ae","observation_id":"e64ffbc9-b9c6-458c-9a1f-163cf154ef0e","resolution":{"observed_at":"2026-08-06T21:06:27.945103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-07-06T17:48:35.724692Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-06T21:06:26.647384Z","title":"Language repository for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.647384Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a77c5d4c3f2af8723b87d9156e4d57b2ea3b5b34ca338aa40b1c09d0f4a643f3","observation_id":"378dba24-81bd-4297-9f4f-974a00cd3418","resolution":{"observed_at":"2026-08-06T21:06:26.647384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.651869Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.651869Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:7484ac0ddb90bede0f678ee2d33bc1c9068c86a7f69724269c86baad67601b30","observation_id":"08709ce0-90ed-46df-8326-bb7a61063c1b","resolution":{"observed_at":"2026-08-06T21:06:26.651869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.915531Z","title":"Text-conditioned resampler for long form video understanding","venue":null,"work_id":"583e97be-dca8-4ea9-b912-af5d09f96e72","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.655620Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:d58efb1ce73c6eaabeda4e40cd9b52c4d7244749c6af332a10d4a867659712e2","observation_id":"72dcd6ef-668b-4361-9d1a-ef3c4d38e50f","resolution":{"observed_at":"2026-08-06T21:06:27.920453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T21:06:26.659753Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.659753Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:3b42691176ae2f961c718c867708eca047cc332762cfcce17a0e8ff7d41cd540","observation_id":"a86a8290-85a0-4b46-9027-cb17eeb6047d","resolution":{"observed_at":"2026-08-06T21:06:26.659753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.901439Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"ef4f7068-26c3-4a0e-bb82-a1f6260373ac","year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.663923Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:1756d5af8ba66495300907302daa1150bca719dc065760f164fe37b924d484d1","observation_id":"b59e93c8-4d71-4d5e-bcb7-d983720ce84e","resolution":{"observed_at":"2026-08-06T21:06:27.905959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.667963Z","title":"Invariant grounding for video question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.667963Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:4ac0137ccf667dd7b812c46b27c9bfc2616b17947c1b4548d1c4555237bf3d97","observation_id":"3aae1bfb-1b72-4d58-9f17-afe081a67c85","resolution":{"observed_at":"2026-08-06T21:06:26.667963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.672045Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.672045Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:e0c9001bcff9b84770f5bf6b1173a99159b82b80f8d4cce2f6f9cd652dda6cd8","observation_id":"72e9616c-1eb2-4419-b41e-984702c0ae8b","resolution":{"observed_at":"2026-08-06T21:06:26.672045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.677167Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.677167Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:7c50764c9e5a292970d493f9bbfbcde0484ac09e23559b61fe9aace0cf1bceb4","observation_id":"6f2ad1ef-5f6e-4272-9f7e-b501963dcd99","resolution":{"observed_at":"2026-08-06T21:06:26.677167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.858763Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":"6116acba-2bb2-474f-b852-275c50ab6e78","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.681952Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a3f129ba78e6ddcfaf9b6f8f23344023a9c5eaaa20618b8ae1cab93a544944c8","observation_id":"c91d1091-05ce-4085-88e1-8358f049a61f","resolution":{"observed_at":"2026-08-06T21:06:27.862733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.686250Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.686250Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:d72b13142be7b48f786118e4890d38f9bca775bbd1fc72f0fa93fbb515712d24","observation_id":"9a47afc2-3c1f-4dc4-9976-eb7ea133f318","resolution":{"observed_at":"2026-08-06T21:06:26.686250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21483","last_updated":"2025-03-27T13:18:40Z","snapshot_observed_at":"2026-07-06T20:59:40.296130Z","submitted_at":"2025-03-27T13:18:40Z","title":"BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21483","snapshot_observed_at":"2026-08-06T21:06:26.690026Z","title":"Bolt: Boost large vision-language model without training for long-form video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.690026Z"},"links":{"cited_paper":"/paper/2503.21483","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:9981f120b97148321701f2ebbbb022cd152e79e88696aaa45e1ae652f1b562d7","observation_id":"0c6a7bba-51f7-4a1b-b18b-271944449f42","resolution":{"observed_at":"2026-08-06T21:06:26.690026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.694115Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.694115Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:c91bca98d0bab68183c2d9f24e028d9f29e5a4779d6958864c2859d947862114","observation_id":"0637e5cb-e5e8-4aef-8210-94ea4cecd6de","resolution":{"observed_at":"2026-08-06T21:06:26.694115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.836459Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"8b43e3e3-8fd3-4d88-820c-43fcd2e6cd0d","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.698208Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:86cb11303b69eaabde36d7ee9b3b059506d7a17e644a53a8dc8b453d3f030e99","observation_id":"936b0c68-3747-425b-9665-a59e445ecbc3","resolution":{"observed_at":"2026-08-06T21:06:27.840702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.702136Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.702136Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a5b09d2b9e5630625c69d0390b741d6dc0772d593428cfacec169a854caac323","observation_id":"f7641231-55bd-4424-92f1-d787c02454d1","resolution":{"observed_at":"2026-08-06T21:06:26.702136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.812426Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":"13f27fe6-4f21-497c-aa05-cac2925bcfea","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.705931Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:53b0e522e5e1ba2b721cecd3971420a85c13c562a977a7a572cd87a345e40000","observation_id":"65f12c65-6fcf-4e40-971e-26e749985c4d","resolution":{"observed_at":"2026-08-06T21:06:27.816727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-06T21:06:26.709761Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.709761Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:6aa23ed82bfbb7c5bc978dba999adb9301ac7ea65428b5af0070a0e055beb12f","observation_id":"ed9989cc-d9e3-4f85-a6fd-7b067971dd23","resolution":{"observed_at":"2026-08-06T21:06:26.709761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.798069Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"66e87f95-3a5e-4f01-9597-0cdd4c376bb1","year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.713878Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:f37f39c5574ab45f8b68bf6080679f18117aff5c03dbe6db1d49374c4b556fe8","observation_id":"f5c42bad-8fee-43c8-ba53-5c63d6515837","resolution":{"observed_at":"2026-08-06T21:06:27.802700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.717830Z","title":"Too many frames, not all useful: Efficient strategies for long-form video qa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.717830Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:34f0d556d75dc26bc56e009c633cc31a11e6b76b6ff91b27a2b1d0155f202624","observation_id":"8ba5c474-171e-44c9-99e1-d673a68f9c1f","resolution":{"observed_at":"2026-08-06T21:06:26.717830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.784482Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"71f9d44d-e2ef-461e-b5e9-8610e75e8e23","year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.721629Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:ec354b9c4d40b4d7c5d0fe69f5bd7e0c41a336786cef96955f067fb8fd020439","observation_id":"179bd670-daa2-447a-976c-d5715b713e58","resolution":{"observed_at":"2026-08-06T21:06:27.788784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-07-06T11:48:35.206160Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-06T21:06:26.725687Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.725687Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:6770fc6e9f33721ea90b43792f4938100d71f15998b3aaaf6fef63fed565ee5b","observation_id":"b3cd413b-2e5d-4cde-99a6-9cd73acc26e5","resolution":{"observed_at":"2026-08-06T21:06:26.725687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.769461Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? In NeurIPS, 2021","venue":null,"work_id":"affa121c-cc72-4061-b0de-85072d808271","year":2021},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.729922Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:bac5a94965e717d4a51a0bb4e3f25ec55db2fc5deea04bd7775ba40377063247","observation_id":"babb1833-a079-4dea-97c1-6dcba476389a","resolution":{"observed_at":"2026-08-06T21:06:27.774633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-06T21:06:26.733908Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.733908Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:8a3c6ba1e6057a86fbdbf38a716ae4efcd7f2d9981761a9dfd6c2e4d7d29897d","observation_id":"4a1aaef5-5c7c-4b4b-8d7b-7f3318b8541a","resolution":{"observed_at":"2026-08-06T21:06:26.733908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.754580Z","title":"Aligning and prompting everything all at once for universal visual perception","venue":null,"work_id":"674075ea-0a1f-461a-8b4d-0fdda2efe67e","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.737936Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:15f2358b685a9327af3daabc70d58fabbf1d0def7153c7e904e5e52ba5b78e22","observation_id":"cec287de-e943-4ef5-8f23-4a17d6b0da51","resolution":{"observed_at":"2026-08-06T21:06:27.758875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.740771Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":"5cc9c003-dfc9-4bce-bd33-d2f75b21705c","year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.741639Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:d3fb3fb4a4a70490f073210a60939143f4f97d5e2e49a89b54006dbc583d6ab0","observation_id":"0d671523-3eee-4c70-b7c1-dff89fd15863","resolution":{"observed_at":"2026-08-06T21:06:27.745028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T21:06:26.745808Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.745808Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:bb75aeb8b00a06fea6663cd7d281dfdb4a004de0b3be0fe02411f77a60328b81","observation_id":"bd5d0968-1d97-4b36-b179-595b46cab0f2","resolution":{"observed_at":"2026-08-06T21:06:26.745808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T21:06:26.749785Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.749785Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:de8ef6223674f4fb70497477cf3ce96238767d5cc01d147f3b853d1be82a88d5","observation_id":"4d1c2b4e-a74b-4f70-8c1c-f0b2b2932a61","resolution":{"observed_at":"2026-08-06T21:06:26.749785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.725440Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"096c09e0-b0d3-4b2e-851a-542775e1a28f","year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.753979Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:bd69766435fd1df08ea5d755a4a2d36026df44eaca23e33903806f42fe9b9398","observation_id":"010f03f9-7700-4291-ba3d-1c67a8939b41","resolution":{"observed_at":"2026-08-06T21:06:27.730371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:06:26.757838Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.757838Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:e810c9e9727a2d535bf4cecbe9982811535b76f8177ae90dabc70b932375e8e2","observation_id":"5d0abb2d-0042-4ea3-8b9c-3996a522b0fa","resolution":{"observed_at":"2026-08-06T21:06:26.757838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:06:26.762347Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.762347Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:3cebc1ed1557e413b26a40575a43b74f74baa912a52681d056eff9805343d9b9","observation_id":"19e9e558-b6aa-4f0c-a164-001f97a492af","resolution":{"observed_at":"2026-08-06T21:06:26.762347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.712143Z","title":"Vamos: Versatile action models for video understanding","venue":null,"work_id":"5f051a17-f46b-4ace-ae65-4514bc26e4c9","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.766293Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:2ce06d3c64959ec5147bd75b3da0ff1bf809d7d6fd96410ad2032104fb6cd1df","observation_id":"29234379-7dac-44aa-be2c-74cb9bb9350f","resolution":{"observed_at":"2026-08-06T21:06:27.716273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-06T21:06:26.770136Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.770136Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:e4086ee860318e94a60a40497776440f475fadd4d984f29c94466e09a29615b5","observation_id":"ec6bc11f-8871-478e-a1b9-f976c7cb2318","resolution":{"observed_at":"2026-08-06T21:06:26.770136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T21:06:26.774431Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.774431Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:89009d090a6063c264e51929ae0937d3546678d62b3506c7a0c424e4beffd7f4","observation_id":"3e25099e-ea0a-45d7-84ab-2ca445722a01","resolution":{"observed_at":"2026-08-06T21:06:26.774431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.698437Z","title":"Vila: Efficient video-language alignment for video question answering","venue":null,"work_id":"73fc46b5-f230-418d-b000-64bc08a18381","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.778822Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:98f9dc1959f3d77ff1cb7b040ef37115c03c8b96d2e69d16cfb974535334db94","observation_id":"0878dda8-ff1b-4e0b-abd1-b10f1735c29a","resolution":{"observed_at":"2026-08-06T21:06:27.702596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-06T12:50:13.936842Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-06T21:06:26.782893Z","title":"Videoagent: Long-form video under- standing with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.782893Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:47c1b8283aba67140efbaa85ab449df81796a2e9579dee012101366e6e5dde3e","observation_id":"9a207b0b-a775-4415-aac5-094f9018a8c6","resolution":{"observed_at":"2026-08-06T21:06:26.782893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-06T21:06:26.787020Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.787020Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:a4b61760af90e60b61919c2029f989cb2b702d3e251e21eea40bad22a6591393","observation_id":"f1cc9b77-687e-4840-91f8-69b982c35dc5","resolution":{"observed_at":"2026-08-06T21:06:26.787020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.791453Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.791453Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:95c87fa7993b6ffa2d484866356a080220aa97f459e5da35dd59fb4e6acebdfe","observation_id":"558c4423-1900-440e-8699-d995e8977c03","resolution":{"observed_at":"2026-08-06T21:06:26.791453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13766","last_updated":"2025-03-11T17:31:27Z","snapshot_observed_at":"2026-08-03T10:33:33.362949Z","submitted_at":"2024-07-18T17:59:30Z","title":"Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13766","snapshot_observed_at":"2026-08-06T21:06:26.795465Z","title":"Visual haystacks: Answering harder questions about sets of images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.795465Z"},"links":{"cited_paper":"/paper/2407.13766","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:ac5cc8782b909a509e14ee4eee74d64b0cee88a2a5fff231a795713c38b1e624","observation_id":"9d3bcf66-c07c-44de-9637-691bed3f7b76","resolution":{"observed_at":"2026-08-06T21:06:26.795465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-06T21:06:26.799622Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.799622Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:2a2c9d403319256b8285ac43cb528095be6dd49a576c29e9211571efa90ffd7e","observation_id":"b404a63e-0ac2-403b-b925-c13a9b907b38","resolution":{"observed_at":"2026-08-06T21:06:26.799622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.672643Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"c5c3e28f-9bf2-40fa-a27f-5e7bf8050b2c","year":2021},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.803791Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:109f175a3b9a44cddfd297535614feed7212d9e52de8a05e6d7c955bf9e01390","observation_id":"b60ec109-f39c-4120-9e14-83ded3c3a62a","resolution":{"observed_at":"2026-08-06T21:06:27.677233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.807519Z","title":"Retrieval-based video language model for efficient long video question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.807519Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:5a4af9ec95241c68516f302844ed6e89993b14f01bb7f071aaee964122148382","observation_id":"4dd48ba5-4468-46ad-9d09-6acab640dd89","resolution":{"observed_at":"2026-08-06T21:06:26.807519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.811686Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.811686Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:0cbbfa988d01e592a2d26bd47cf692c6c9b8b991c67d796fc165388985cc54bb","observation_id":"408380f8-1539-406f-a9fb-cd5719957c8a","resolution":{"observed_at":"2026-08-06T21:06:26.811686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.647745Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"adf14389-42fe-433b-95a2-d498e379b9e0","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.815384Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:ad6312fa61ad26ebcbdbad64d3bae97cabe6907f854c299dd7a20cd47a5d99c6","observation_id":"b09bf94d-d062-4b5e-8064-fafc3665cd94","resolution":{"observed_at":"2026-08-06T21:06:27.652196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.819219Z","title":"Lv-eval: A balanced long-context benchmark with 5 length levels up to 256k","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.819219Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:17241d42588b8810b741726b4b374added331549354dc4e358fab2d62d9dbec7","observation_id":"c8a105ce-1fb0-4fc7-9ab4-58b260b8c5fd","resolution":{"observed_at":"2026-08-06T21:06:26.819219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:26.823206Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.823206Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:95fdbee2fee1d27ee90a3cf22fda710c4a9ef0c7a459dc1534ee714c680cce5c","observation_id":"3e450e21-1196-4122-802d-cf414fabd1bf","resolution":{"observed_at":"2026-08-06T21:06:26.823206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.623302Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":"1a36fe8b-3f32-4b67-8628-9d3100afe0f0","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.827083Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:e17c710d9c99e001918d29204665cc07c91ba1dbab23d13d860109a88df35b1b","observation_id":"88277197-a309-436c-bdcd-3c159b1114e4","resolution":{"observed_at":"2026-08-06T21:06:27.627536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.607045Z","title":"Learning video representations from large language models","venue":null,"work_id":"4c65a434-a269-4857-8149-ff9f160fc1f8","year":2023},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.830891Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:38a4bd8555133aee273641a99467b14058e9639ca008a6e85ff131ecc247ba21","observation_id":"9359e176-943c-4861-9513-79e000d20a13","resolution":{"observed_at":"2026-08-06T21:06:27.612666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T21:06:26.834825Z","title":"Needle in a video haystack: A scalable synthetic framework for benchmarking video mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.834825Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:861bced45a851d50cbd0af5dcb842b6752555555e31f12121017c9126590be42","observation_id":"a798454b-76a3-45fa-8c2d-f29a9d1940b3","resolution":{"observed_at":"2026-08-06T21:06:26.834825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:06:27.591974Z","title":"temporal certificate","venue":null,"work_id":"6d7ace05-c638-4ab2-849e-ac6c92d2257c","year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.838928Z"},"links":{"citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:5ea91e6397d59728d11538dd2423b9bf48b03cb850459a66b03cdef23ca0b7a5","observation_id":"64cb19ff-1738-4904-bd56-a835154c65f1","resolution":{"observed_at":"2026-08-06T21:06:27.597368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 8 inbound Pith citation observations for arXiv:2507.02001."}