{"as_of":"2026-08-07T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72d6c05da1571fccdb9ea7af28d955fb57831be9d07d6b77ebfc895cbeaebf51","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:35:45.372866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T09:27:44.037400Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":"2411.14794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":"011f9457-a448-4892-acec-89adea340d2b","year":2024},"citing_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:27:43.919941Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2412.14171"},"observation_digest":"sha256:d7fd710c33d6fe11cc7fd802916491cddd8fc42b0c34eff970f63de68b2b0f11","observation_id":"3712b52b-dec3-41ff-9eb8-98ae17197a82","resolution":{"observed_at":"2026-05-22T09:27:44.041073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":"2411.14794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":"011f9457-a448-4892-acec-89adea340d2b","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:92b9d0699a037822cfd8afb4e1cde339ea3d1b26ac7be5ced042b8e046f3d6f7","observation_id":"d5d8e53a-eb28-4c15-82dd-5b8c67579206","resolution":{"observed_at":"2026-05-15T17:18:53.266805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-07T11:35:45.372866Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection.arXiv preprint arXiv:2411.14794, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.372866Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:fbd2a9130e91c809de457e7bcc44df7d6edd662b353bd4220f111566cedbc9c9","observation_id":"2771756b-e8fa-4632-881e-95c545e86d39","resolution":{"observed_at":"2026-08-07T11:35:45.372866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-07T04:22:55.852974Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.852974Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:95caa38107b9d282ba402c90547ef2d9b00851dddb25cc4372b591e3fc201d09","observation_id":"7c58fbad-de91-4d02-b625-61d4030b97fa","resolution":{"observed_at":"2026-08-07T04:22:55.852974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-07T04:08:54.039135Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection.arXiv preprint arXiv:2411.14794, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14827","last_updated":"2025-06-13T13:39:53Z","snapshot_observed_at":"2026-08-07T07:12:40.611388Z","submitted_at":"2025-06-13T13:39:53Z","title":"DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:54.039135Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2506.14827"},"observation_digest":"sha256:f6b9d4a954c63d3edc7d4624cd09ea845540f948412450a68600190cc91749cb","observation_id":"7b07519b-5ef0-457f-b17f-6d27a24ad23e","resolution":{"observed_at":"2026-08-07T04:08:54.039135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-06T21:06:26.618589Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.618589Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:16cad8170daf01744835d20ce7ae625839907365aa8f60c3f1d320c224f3f2ab","observation_id":"55638bfe-9742-4f24-9d1a-33ba2c263953","resolution":{"observed_at":"2026-08-06T21:06:26.618589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-05T19:03:10.372667Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-05T19:03:01.792773Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:10.372667Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:797d885977e469cdfdd8ad1b64febb483f6d6fc900574371b533b83856f41e34","observation_id":"83fac34c-6574-4a22-a63a-a92e08f38943","resolution":{"observed_at":"2026-08-05T19:03:10.372667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":"2411.14794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":"011f9457-a448-4892-acec-89adea340d2b","year":2024},"citing_paper":{"arxiv_id":"2604.20473","last_updated":"2026-04-22T12:02:24Z","snapshot_observed_at":"2026-07-30T08:45:43.657043Z","submitted_at":"2026-04-22T12:02:24Z","title":"Video-ToC: Video Tree-of-Cue Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:29.374012Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2604.20473"},"observation_digest":"sha256:a45f4866d8e424c58cfc3d0cf4202a990806e54d436cfb1250a7b70a7da4696f","observation_id":"c9c3a023-4234-4918-89ae-f0b15cb0194e","resolution":{"observed_at":"2026-05-11T13:36:09.642866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":"2411.14794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":"011f9457-a448-4892-acec-89adea340d2b","year":2024},"citing_paper":{"arxiv_id":"2605.15342","last_updated":"2026-05-14T19:12:20Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T19:12:20Z","title":"Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T16:02:53.887605Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2605.15342"},"observation_digest":"sha256:a0181963bfe3f261d4090145482b50ebe62681e8da258335452c8af225b457a6","observation_id":"b8bc99ed-566d-4acf-9f27-d1f693e9db29","resolution":{"observed_at":"2026-05-19T16:03:08.051371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-07-31T23:10:24.087228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T12:05:27.652747Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.087228Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:3a2af8de263b29f74ec4101e6247e8ae1fa646d241ad1a7a53add5d7a5e48906","observation_id":"258700ec-3943-4844-af85-1f3c86fba121","resolution":{"observed_at":"2026-07-31T23:10:24.087228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14794/citation-record","integrity":"/paper/2411.14794/integrity","json":"/paper/2411.14794/citation-record.json","paper":"/paper/2411.14794"},"outbound":[],"paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2411.14794."}