{"as_of":"2026-08-16T22:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0811ea6998b10d8ef94f5774e9e126ca7039ceb9b85f7cc1331c4d1251309d68","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:44:54.926584Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10720/citation-record","integrity":"/paper/2412.10720/integrity","json":"/paper/2412.10720/citation-record.json","paper":"/paper/2412.10720"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.753530Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.753530Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:3d5d6417fadcdfedcd5d46de692ffed7f383aacad45ffd6fc1669012c23adcf9","observation_id":"ee7622d1-5dfa-46c8-9bb8-a4d93a8bba3e","resolution":{"observed_at":"2026-08-11T15:44:54.753530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.766203Z","title":"Triple sequence generativ e adversarial nets for unsupervised image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.766203Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:1894e34dbf81073e206b19b5e4fc4f34fd47d44ba6d65218d70ddd1079cd4c2b","observation_id":"7a630dca-16d1-4102-86e9-6628a724d1ca","resolution":{"observed_at":"2026-08-11T15:44:54.766203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.778107Z","title":"Sketch storytelling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.778107Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:5fbd39d72e86c3473fdf06ef6908e5e047d159226649739c1788827c3aa49f68","observation_id":"1f7f8107-574d-4ca9-9461-74136da45bf9","resolution":{"observed_at":"2026-08-11T15:44:54.778107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06499","last_updated":"2025-02-15T10:01:13Z","snapshot_observed_at":"2026-08-16T13:44:27.529222Z","submitted_at":"2024-06-10T17:34:24Z","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06499","snapshot_observed_at":"2026-08-11T15:44:54.791036Z","title":"Narrativebridge: Enhancing video caption ing with causal-temporal narrative,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.791036Z"},"links":{"cited_paper":"/paper/2406.06499","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:4ece1b13c2e8a516c70897e8f7cd1c47e5f1ae6199938060457e83b0e5884510","observation_id":"4b1fbd5f-e1eb-4d48-860b-c6adca70a371","resolution":{"observed_at":"2026-08-11T15:44:54.791036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-16T13:05:52.745982Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-11T15:44:54.799390Z","title":"Rethinking visual de pendency in long-context reasoning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.799390Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:bc7c1c6d1d4f167625db11cf609ec9181cac12d8164c7de322c331d4b60c51ac","observation_id":"1b0f9cdd-c751-4ab1-b6cc-6445be56d32c","resolution":{"observed_at":"2026-08-11T15:44:54.799390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.803663Z","title":"Visual in-context le arning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.803663Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:d1c166b9662e81fe4c7add9078ff2edaf1fc7a9cdd6d9dddd94e8fd921f01db8","observation_id":"e0fda45c-3af6-47f4-b2b8-6419469532d0","resolution":{"observed_at":"2026-08-11T15:44:54.803663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:44:54.809836Z","title":"Are we on the right way fo r evaluating large vision-language models?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.809836Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:4ddd4a52e1e5905f78ca3f6c85fbbb7d8563fcc33fa81ccc154de4fc1442c838","observation_id":"421e803c-170a-4b62-bd17-366913b0296d","resolution":{"observed_at":"2026-08-11T15:44:54.809836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-16T13:43:39.938123Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T15:44:54.831133Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.831133Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:1c18e4d45568e6be960c335ae09fc0f66f99b0c2e60bb0de1499a8c31a753498","observation_id":"4e582af8-2a10-421e-bb8c-385d906994b7","resolution":{"observed_at":"2026-08-11T15:44:54.831133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:56.023363Z","title":"A su rvey on multimodal large language models,","venue":null,"work_id":"a1f8e340-2dd8-465e-8aca-ef141556a803","year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.838345Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:59541de0faae24684b9c2295eba9d352075aa31bf148d01862e74d6844132a9c","observation_id":"fc0a0539-7834-4bc9-850e-c2416b0f0f81","resolution":{"observed_at":"2026-08-11T15:44:56.029034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.842939Z","title":"Multimodal event transformer for i mage-guided story ending generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.842939Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:64efcb863019ddc02d818123af5a7b6863185157b1bd221ced7d07909118e856","observation_id":"34f69918-805c-4277-9c18-291ad00a3b46","resolution":{"observed_at":"2026-08-11T15:44:54.842939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-16T13:52:04.740660Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-11T15:44:54.848987Z","title":"Fine-tuning large vision-language models as decision-making agents via rein forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.848987Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:f52a6da04e51cf348795303c221670464defff33e2a6b37ed2c7b144bc660217","observation_id":"81961021-753c-4c11-b087-7455143f4495","resolution":{"observed_at":"2026-08-11T15:44:54.848987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.855522Z","title":"Style-aware contrastive learning for multi-style image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.855522Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:7fcd4b5a0b59202ccd96617bbe59e5ba4d821b950c927de49359774ad46a7445","observation_id":"c9795afb-6b79-4556-a418-6a729a2bbd57","resolution":{"observed_at":"2026-08-11T15:44:54.855522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:55.976262Z","title":"Improving cross-modal alignment for text-guided image inpaint- ing,","venue":null,"work_id":"3ef789d8-7fa4-412e-abdd-8e1d92d00aa0","year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.861556Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:e0d18cf501eb17f89eec71ac565fb90710bb575ba124114fc05bf715da1c999c","observation_id":"332e282d-e0f1-4489-8562-954c63e89838","resolution":{"observed_at":"2026-08-11T15:44:55.981517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-11T15:44:54.869813Z","title":"Internlm-xcomposer-2. 5: A versatile large vision language model supporting long-con textual input and output,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.869813Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:24be4128511ceb023a117bd9f8580c2bda054005469ee90b14bd5b41bc09f426","observation_id":"4f0ddb9d-d718-4827-bd03-1fc2844c8e8c","resolution":{"observed_at":"2026-08-11T15:44:54.869813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-16T14:43:11.499242Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-11T15:44:54.875118Z","title":"Thread of thought unraveling chaotic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.875118Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:a4f65f4a285795e0d5edfc6e2ec0cb79f303317cb4732e17d120307e9deefd36","observation_id":"38fb7a67-f1d4-430b-9953-5a35a52b049c","resolution":{"observed_at":"2026-08-11T15:44:54.875118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.883452Z","title":"Streaming dense video captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.883452Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:106e663be3eac7154bb3035163055b3cb4fe11baa9d881aa5ae44938de10d355","observation_id":"3681400b-2e88-4dc2-9723-10bb43ceb208","resolution":{"observed_at":"2026-08-11T15:44:54.883452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.888620Z","title":"Livecap: Live video captioning wit h sequential encoding network,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.888620Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:a57d65dee9e5ee6d2339af71e5815eaeb0fa01de882e5f5bf8457e4049fa9f35","observation_id":"46227d4c-2f77-4c3c-a2c2-594de139b5e4","resolution":{"observed_at":"2026-08-11T15:44:54.888620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.07046","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:55.545815Z","title":"Ret rieval enhanced zero-shot video captioning,","venue":null,"work_id":"663da85b-1044-4c10-bbc1-ef7a018fc514","year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.893937Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:f66e2a6a3b059ea5265c707a1adc87ad1e4b6282d89f24eda8a20ebb2107dfaf","observation_id":"48aa3127-6575-4f59-8bc3-bbb94c45feb0","resolution":{"observed_at":"2026-08-11T15:44:55.563935Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:54.911301Z","title":"Accura te and fast compressed video captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.911301Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:4eb71bb95909c723e271f5aed9e77ec56898a488eb0587aef824de93cb1db313","observation_id":"d7fb0076-51c6-4b82-8ee5-05e8022df916","resolution":{"observed_at":"2026-08-11T15:44:54.911301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2405.07046","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:44:55.143108Z","title":"Available: https://doi.org/10.48550/ar Xiv.2405.07046","venue":null,"work_id":"ac2ec7ed-f4bd-48d6-a23b-380e0111e522","year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.901405Z"},"links":{"citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:15313edae78cd7e8b27c21f31cb5386b7b09be8d84d1b56975d7c9cdae142e09","observation_id":"a6c4e297-062b-4f96-8d31-97a676d7646b","resolution":{"observed_at":"2026-08-11T15:44:55.151058Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06685","last_updated":"2023-08-13T05:18:08Z","snapshot_observed_at":"2026-08-16T15:08:52.681723Z","submitted_at":"2023-08-13T05:18:08Z","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06685","snapshot_observed_at":"2026-08-11T15:44:54.916642Z","title":"Video captioning with aggre gated features based on dual graphs and gated fusion,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.916642Z"},"links":{"cited_paper":"/paper/2308.06685","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:6fdc570ad68e21afb31eed419195728caae64d5dcac955e9b7b41c265af4e4e2","observation_id":"c9161954-b612-47f5-9f4e-5d78b07a56b0","resolution":{"observed_at":"2026-08-11T15:44:54.916642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06685","last_updated":"2023-08-13T05:18:08Z","snapshot_observed_at":"2026-08-16T15:08:52.681723Z","submitted_at":"2023-08-13T05:18:08Z","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","version":1},"cited_work":{"arxiv_id":"2308.06685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06685","snapshot_observed_at":"2026-08-11T15:44:54.979838Z","title":"Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion","venue":"cs.CV","work_id":"58f26e0a-5812-4983-8516-b4ca0c8c537e","year":2023},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.926584Z"},"links":{"cited_paper":"/paper/2308.06685","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:6826435cd1a8e710f01464e62637cec7cbc6c9efe1edd184319ff11ec0ba4b27","observation_id":"8d5e2da0-b6e7-48f7-8378-34e76cb4a432","resolution":{"observed_at":"2026-08-11T15:44:54.992595Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:44:54.816312Z","title":"Available: https://doi.org/10.48550/ar Xiv.2403.20330","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:44:54.816312Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10720"},"observation_digest":"sha256:4350e24b65b968d0cc0ac036baefc4eb3c2655b76be1698303f9ee611dec8c53","observation_id":"d1daa596-d7c4-4448-8d5a-9e83036f87b1","resolution":{"observed_at":"2026-08-11T15:44:54.816312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10720","last_updated":"2024-12-14T07:28:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:36:02.073999Z","submitted_at":"2024-12-14T07:28:38Z","title":"Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2412.10720."}