{"as_of":"2026-08-12T15:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98309b543fc7abcf1de15c02f64d3893f8931045d0cfae5f2d2368746fbb2570","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:59:13.619204Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.06182/citation-record","integrity":"/paper/2412.06182/integrity","json":"/paper/2412.06182/citation-record.json","paper":"/paper/2412.06182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.299656Z","title":"Intermediary-guided bidi- rectional spatial-temporal aggregation network for video-based visible- infrared person re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.299656Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9c66a9e272a1315ed83340172d050a92a1edfefee9ed68c6f0ed775d43bd345e","observation_id":"b76aa785-a8f7-40b9-9d24-9b0847fe086a","resolution":{"observed_at":"2026-08-11T19:59:13.299656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.304058Z","title":"Video moment re- trieval via comprehensive relation-aware network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.304058Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:01166e962fdcab241d4e2dc06ad7f16d286a03e555c2c87c86780c258f04488a","observation_id":"03b84715-37a0-4f07-9597-baef3232868b","resolution":{"observed_at":"2026-08-11T19:59:13.304058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.308146Z","title":"Self-supervised adversarial video summarizer with context latent sequence learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.308146Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:900e5dfc643bd20ede5170b14d0a8fe3203ef53e8e2d79c058b51f58c4dee295","observation_id":"3c3e072d-7723-4ee6-b14c-14fd0680d94e","resolution":{"observed_at":"2026-08-11T19:59:13.308146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.312043Z","title":"Complementarity- aware space learning for video-text retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.312043Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:6f0bb37e17981444b2ff0884a951e9d7692f921a704e0d236c1bc63fa08fa59f","observation_id":"2c88bb87-0543-4ad9-8de1-7925763f3a63","resolution":{"observed_at":"2026-08-11T19:59:13.312043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.315626Z","title":"Moma-lrg: Language-refined graphs for multi-object multi-actor activity parsing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.315626Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:b5d2ccf8ef9ad875d8b198a8e35a6855089bdd0effce5543f9a4f2384d34a6ca","observation_id":"157f858f-1c4c-4644-9cf2-07453d74dfcb","resolution":{"observed_at":"2026-08-11T19:59:13.315626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.319397Z","title":"Videoclip: Contrastive pre- training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.319397Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a761f8a5404a42ecdc05320b347939c0d4b11dceb956816f3d380d79c28db276","observation_id":"3c5484a6-9cf2-4b62-8e17-7f1bf7c1b273","resolution":{"observed_at":"2026-08-11T19:59:13.319397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.323074Z","title":"Graph convolutional module for temporal action localization in videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.323074Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:339fdd32eb285dcb6fb09344b7b1ac19e59a26293ac065749e36f7722355cee2","observation_id":"6ddc86b7-04cf-4c20-a1b1-d33e8b7c07ea","resolution":{"observed_at":"2026-08-11T19:59:13.323074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.326324Z","title":"Evcap: Element- aware video captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.326324Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:92072d3f9c57ce8d2bec991dcdc293a7ae6282e1b541872f0d4dfa3f8f41d01d","observation_id":"304fefc4-3b33-4afd-a4bb-1de82d73b17c","resolution":{"observed_at":"2026-08-11T19:59:13.326324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.329312Z","title":"Multi-granularity interaction and integration network for video question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.329312Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7add429f1c036243fbf19237739413783dad6a76c491887ccca825cc7e9a74f6","observation_id":"246b13d7-365c-4a74-bc4c-c0679c3f3802","resolution":{"observed_at":"2026-08-11T19:59:13.329312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.332350Z","title":"Video question answering with semantic disentanglement and reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.332350Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3a260b2832f97700e9b7aa51c6920191d937b3c127c102f8af78779cc2b28e7b","observation_id":"106cebde-0324-45a0-808f-ff7265d0a44d","resolution":{"observed_at":"2026-08-11T19:59:13.332350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.335894Z","title":"Multilevel semantic interaction alignment for video–text cross-modal retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.335894Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:5151e8d21ddf5d4bf6c8ce0deb8aee33e4e453cbcf1c521b64e45549fc38f24e","observation_id":"548d2b2a-2e8e-473e-85f3-74925b113941","resolution":{"observed_at":"2026-08-11T19:59:13.335894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T19:59:13.339068Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.339068Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3d7984240e55c8ca5e1bdac3c9038a60bb26c4a027e59f55ebb2ef9ad586476f","observation_id":"37202589-7b99-4879-8fac-b0d933076c10","resolution":{"observed_at":"2026-08-11T19:59:13.339068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.342311Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.342311Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9161bb43683657b82aa474275c5103787d6ef552d8a8e33ce08166856f60cb6f","observation_id":"bc909dc9-ba3a-4750-bbe9-39769e529306","resolution":{"observed_at":"2026-08-11T19:59:13.342311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-11T19:59:13.345138Z","title":"Moviechat: From dense token to sparse memory for long video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.345138Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:b3f7047a71886affde990659f9683862a1f3132850275ba38ace46ba64494aef","observation_id":"f77b4e5e-7d18-4849-a028-b1c48563771f","resolution":{"observed_at":"2026-08-11T19:59:13.345138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T19:59:13.348682Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.348682Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:4cbc6e29a2bc1a78887cffbf5adeb3247d393b94f73fed0aa7f3f3e1d208bf24","observation_id":"831d8942-a346-4f40-9a3b-25cb57a1004c","resolution":{"observed_at":"2026-08-11T19:59:13.348682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.352109Z","title":"Language models with image descriptors are strong few-shot video-language learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.352109Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:32051816384db48322998dc0460da8f3af6693cf87554f336a6e88f59ee52611","observation_id":"89fee407-103d-46cb-831e-8e19fb6d605f","resolution":{"observed_at":"2026-08-11T19:59:13.352109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.355176Z","title":"Compressed video action recognition with dual-stream and dual-modal transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.355176Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:91c726db862bf606c23130e8f2ac8d89d4b2958b6af616879d10f3ddc444156f","observation_id":"68e75ac0-42de-4cbc-8e57-69a8d3917f5a","resolution":{"observed_at":"2026-08-11T19:59:13.355176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.358243Z","title":"Dynamic spatial focus for efficient compressed video action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.358243Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e231fd61a573ad1a87af71b7bb304af19ba8fb8796f792826227c37d09802ec0","observation_id":"ccab0104-9ecf-4506-8be1-da3f20434797","resolution":{"observed_at":"2026-08-11T19:59:13.358243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.361520Z","title":"Alignment-guided temporal atten- tion for video action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.361520Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:91f23fdd24ccbe9f6cb313533aae2f09840a17ed0e285620f7f95ba509b50609","observation_id":"5f1d5e46-a24d-44ee-88fa-eee4f7a9d064","resolution":{"observed_at":"2026-08-11T19:59:13.361520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.364500Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.364500Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:59f10abe61a45fe2bc2378378d4beef1bd595d1cc6b1fbc329a8321b7e18fd56","observation_id":"787aab86-06d4-43a0-befd-c74f18c3aa3b","resolution":{"observed_at":"2026-08-11T19:59:13.364500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.367934Z","title":"Temporal distinct representation learning for action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.367934Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:98ffabd36caf955199db3178ce424707abd699f82210c6ce8efe566c3ce94dcd","observation_id":"2071a66f-0e0e-4850-9335-33bc33a806d5","resolution":{"observed_at":"2026-08-11T19:59:13.367934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.371085Z","title":"Truncate-split-contrast: a framework for learning from mislabeled videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.371085Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:834120784dd342930193b6e72f72874d45a62e1053b0e75ad93f54fe27fbc356","observation_id":"3d99e65b-f375-4487-aafe-5d7a2e96741b","resolution":{"observed_at":"2026-08-11T19:59:13.371085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.374125Z","title":"Reading-strategy inspired visual representation learning for text-to- video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.374125Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8c149ef6e8b630fa1a3d9a0a08a763e39d78dcc6722d7d085b9945d60942fa94","observation_id":"de6591e7-2ab0-41c1-a586-ed130cdf71c1","resolution":{"observed_at":"2026-08-11T19:59:13.374125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.377335Z","title":"Use what you have: Video retrieval using representations from collaborative experts,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.377335Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:96074f8a9c9d55048811c4d4d1fe67f9025cc7dec8bdcb9e3c3884577ac70252","observation_id":"903fe238-f9d2-46cb-89ec-7c40649e1aff","resolution":{"observed_at":"2026-08-11T19:59:13.377335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.380823Z","title":"Dual encoding for zero-example video retrieval,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.380823Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:45e5dbfd9fdf3d2d8e1314a51504ef9d0f08aebe51ec3e01d5bb886b6fbe97c4","observation_id":"881de220-95ef-413a-8ee8-773a53b9718a","resolution":{"observed_at":"2026-08-11T19:59:13.380823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.383984Z","title":"Locvtp: Video-text pre-training for temporal localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.383984Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:d1b68f8be3bb1de98643a6eb3b0575230889fbfa3cec04e819336e5b719a303c","observation_id":"61a2a580-296b-4df4-bf20-aff3036720a2","resolution":{"observed_at":"2026-08-11T19:59:13.383984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.387374Z","title":"Breaking winner-takes-all: Iterative-winners-out networks for weakly supervised temporal action localization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.387374Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2db25e16b1974540aa61a5f717b8bfa749aa411a08a96b47158c98a0cd582e85","observation_id":"adad5951-16a8-4bfb-83c9-20e48977a0a0","resolution":{"observed_at":"2026-08-11T19:59:13.387374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.390767Z","title":"Cross time-frequency transformer for temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.390767Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:5bf6c05f9ec72330552e67560ae5fa3a189836a439a145869d52660256bd0022","observation_id":"8c562c82-db62-4be2-bd76-c3c12052f130","resolution":{"observed_at":"2026-08-11T19:59:13.390767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.394100Z","title":"Slow motion matters: A slow motion enhanced network for weakly supervised temporal action localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.394100Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:f4e2237c82aef59b5229d6a037cfece40948af1ef5cb49c948ecc82db7f72091","observation_id":"1740bebf-8852-4dcf-87ce-0ac1d1bf3b23","resolution":{"observed_at":"2026-08-11T19:59:13.394100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.397280Z","title":"Long-form video- language pre-training with multimodal temporal contrastive learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.397280Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:40049262b8394697f7cc8fecf00ebd193f2249265ab3648a0304175a5208bad8","observation_id":"ce42a0f6-b6d2-4169-a8d3-cbee63e055e4","resolution":{"observed_at":"2026-08-11T19:59:13.397280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05143","last_updated":"2019-10-13T09:44:11Z","snapshot_observed_at":"2026-08-12T00:28:38.344751Z","submitted_at":"2019-05-13T16:57:40Z","title":"VideoGraph: Recognizing Minutes-Long Human Activities in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05143","snapshot_observed_at":"2026-08-11T19:59:13.400389Z","title":"Videograph: Rec- ognizing minutes-long human activities in videos,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.400389Z"},"links":{"cited_paper":"/paper/1905.05143","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:96416521ada50752a5a634bd3bfe0eb1ee1e93ddfa45adaa4271cb498fc5edfd","observation_id":"4320506b-7c55-417b-ad3d-d9a5b657c202","resolution":{"observed_at":"2026-08-11T19:59:13.400389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.404329Z","title":"Supervoxel attention graphs for long-range video modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.404329Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:bac8d73570bbcd08adcbc6aeaf2b18aca9459243213ce52c1e40f7e709c464f1","observation_id":"be66552c-aac9-465d-a353-7201b08941d3","resolution":{"observed_at":"2026-08-11T19:59:13.404329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.535884Z","title":"Long movie clip classification with state-space video models,","venue":null,"work_id":"8ff9628b-e955-4481-ae17-e9170c15fba8","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.407515Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:180b7b203ba44c0d76289432764e9d5bbb7ff8d4d63d581069a9f171fc4daa9e","observation_id":"0c772c00-a4df-49fe-a93a-02cc99cf828f","resolution":{"observed_at":"2026-08-11T19:59:14.539583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.524986Z","title":"S4nd: Modeling images and videos as multidimensional signals with state spaces,","venue":null,"work_id":"717780ae-d961-412a-a941-2728c5ad36e5","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.410492Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1e346497cd03d6c9cf4032a013307c6e230e76299d29f0d2810efb8a81c140fe","observation_id":"be7e0557-c7f6-41d0-93a9-e7b5db8f2549","resolution":{"observed_at":"2026-08-11T19:59:14.528911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.514059Z","title":"Selective structured state-spaces for long-form video understanding,","venue":null,"work_id":"1d19c1f2-0403-4839-a579-af0859461ee4","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.413725Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7ab33f3041cbab7a4b17b4d879401a4bf2ba6f74e3f8e9c8049df8bc808c63e7","observation_id":"6a883042-e723-4ce8-8dba-bfb316fce0f6","resolution":{"observed_at":"2026-08-11T19:59:14.518072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.503428Z","title":"Efficiently modeling long sequences with structured state spaces,","venue":null,"work_id":"4294919c-575d-4b8c-a377-dc33be95735e","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.416851Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:cf2638df8e6aa5d4390d2a3fea4abf3edabe427d1bb00308c2c63c8c7ce30589","observation_id":"3c55eb5c-84ae-440d-ba0d-78efe043e69b","resolution":{"observed_at":"2026-08-11T19:59:14.507046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.491590Z","title":"Mgsampler: An explainable sampling strategy for video action recognition,","venue":null,"work_id":"e8b14dcf-157e-49de-a512-15a6e12198d5","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.419845Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:80a12358bc65d3c6b164baa783e0a83e5908eb62e0bdb8f4751ed002bf41a62e","observation_id":"b707d111-080e-4719-841a-d0e10ae281ac","resolution":{"observed_at":"2026-08-11T19:59:14.495316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.481133Z","title":"Adaframe: Adaptive frame selection for fast video recognition,","venue":null,"work_id":"b254373f-2e48-436f-8787-b99342eac264","year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.422737Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3c4c903453928640b4e18e8bd208fc96ce1c25920ffe89acb3a75d56bb5ce0a2","observation_id":"ec1f12c2-12fd-4792-8e34-5910efa98bbd","resolution":{"observed_at":"2026-08-11T19:59:14.484590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.470887Z","title":"Localizing moments in long video via multimodal guidance,","venue":null,"work_id":"9837551b-222d-4240-ac26-ddaf0abbe9e1","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.425583Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:bea52de8f6bd709d18e947aa5123c77059256cdea944df5625d73dac7b7f70f5","observation_id":"7e4b57c6-eef4-4842-883e-935ad5c79ac4","resolution":{"observed_at":"2026-08-11T19:59:14.474385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.459878Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions,","venue":null,"work_id":"21fae1ea-9528-4a5d-8a5e-8ada889a302b","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.428711Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:6967ffe579025474dd5bea7621c1c012f031e735780a8ce857c0f1141cdc1bad","observation_id":"00a45254-eb61-4d1d-bec5-d4f60dcc6e25","resolution":{"observed_at":"2026-08-11T19:59:14.463310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.448651Z","title":"End-to-end learning of visual representations from uncurated instructional videos,","venue":null,"work_id":"ae9797e6-ac6a-4a74-bbf2-b0c7579aaa2e","year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.431718Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:f43f520c13c28a759c4d0b0904b94080c5e392d165644491484f29aa2f4d9272","observation_id":"97ae6fcd-5ebe-4097-9584-57e18ee9b50e","resolution":{"observed_at":"2026-08-11T19:59:14.452622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.438111Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":"e4fe6a5d-0416-4293-8243-9e47fad6a580","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.434656Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a28d3cac79eb01a4ef49faec7364a819443758689eef6c18374d5de496cbeaa4","observation_id":"bf90c54e-8f4c-4c1e-81b9-45c03751ff83","resolution":{"observed_at":"2026-08-11T19:59:14.441521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.428101Z","title":"Scaling up vision-language pre-training for image captioning,","venue":null,"work_id":"af8ec1f3-31c9-473a-934e-18529a69a8c0","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.437890Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:f8a18b364d0481f0735ea7efb28ed64847ad0e4437ec600bfc27bb04633ef317","observation_id":"8a745a5d-ad95-4236-9c48-2f872ed5b492","resolution":{"observed_at":"2026-08-11T19:59:14.431524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.416683Z","title":"Gbc: Guided alignment and adaptive boosting clip bridging vision and language for robust action recognition,","venue":null,"work_id":"407cdacc-f444-4fde-8be4-cc4fd871b0bc","year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.440965Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:cb259db9257424abd2b9481765951dc7eae393625ce712707e5bfb4c3365ad7c","observation_id":"6ded8614-ee68-4727-827a-9f20bc76284e","resolution":{"observed_at":"2026-08-11T19:59:14.420598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.405491Z","title":"Unsu- pervised pre-training for temporal action localization tasks,","venue":null,"work_id":"c0b93cf1-74d2-45a7-a545-3282c20d14f0","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.444160Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c482ed0ab7530cdec6390aa8979cd3aa65c3596d85f06c91057e3c60fe6cff80","observation_id":"8170842f-9f6f-46c9-b9a9-151258bcb288","resolution":{"observed_at":"2026-08-11T19:59:14.409107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.393789Z","title":"Clip4clip: An empirical study of CLIP for end to end video clip retrieval and captioning,","venue":null,"work_id":"37f80063-e074-48bb-aa6b-6717cbc0738e","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.447486Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:122cd2e8cb475e0094d881c645711a9d610465f3d5e4fcc2c9a4130f5a412749","observation_id":"548090d7-eebb-48e5-8077-948385896a68","resolution":{"observed_at":"2026-08-11T19:59:14.397729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.450578Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.450578Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:6ee9b3ffab84e59e48bdbf90c690ba72cdeb4da8258f6933a24eeef83338925d","observation_id":"7d6a0576-d691-432a-9b02-92d48310de48","resolution":{"observed_at":"2026-08-11T19:59:13.450578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.375808Z","title":"A survey on video-based human action recognition: recent updates, datasets, challenges, and applications,","venue":null,"work_id":"e33f4669-16ef-4bd2-845b-0715eeb5b213","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.453369Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:fa6e19e29b65b4a32745a79a71c3baeb0e034fd3dc5805209274406c2c468d11","observation_id":"986671f5-f4f9-4321-aa71-3a98f247ffa4","resolution":{"observed_at":"2026-08-11T19:59:14.379512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.365112Z","title":"Lavender: Unifying video-language understanding as masked lan- guage modeling,","venue":null,"work_id":"927c0c8d-a903-4d89-9655-548c13ecb24d","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.456277Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:aea5134adcbcbe44ddc8765040153c78e1f6acec34889188667337648c954b62","observation_id":"2081cbe2-ef2e-4b4b-80e2-26cf5f84a614","resolution":{"observed_at":"2026-08-11T19:59:14.368806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.354658Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre- training,","venue":null,"work_id":"e5ee7018-d778-4df1-9ea9-58597c9d0d96","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.459592Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:49f185690f8d5708794504beeabb3d5ce16dbcc3583b4f1330c89a29394cb4b4","observation_id":"be59d67c-e8a0-4cc3-b078-0cf00140ee16","resolution":{"observed_at":"2026-08-11T19:59:14.358415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.344228Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":"884c3d84-7ec8-49fe-962e-8953ff7a24ed","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.463104Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:55a84cf9d21ff7603d4c6fe4f409c828cc722fc86e3c3c8d8568035120421822","observation_id":"a6411d7e-81c2-46b2-9290-6155fde763eb","resolution":{"observed_at":"2026-08-11T19:59:14.347902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-11T19:59:13.466341Z","title":"Violet: End-to-end video-language transformers with masked visual- token modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.466341Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3c2ddcc24bcb0ffff3c5ebc4e91bdce8bdfbf1e591afa985083cce028e028837","observation_id":"a7316983-e468-4d51-9030-b1592160bf1b","resolution":{"observed_at":"2026-08-11T19:59:13.466341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.332723Z","title":"All in one: Exploring unified video-language pre-training,","venue":null,"work_id":"873686c4-020a-4d63-ac40-9b83f2c960b6","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.470172Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:d874ed040f4e98ef3f71dea3c104c779c2a6667344f9f829509849f240a3101a","observation_id":"ba31b6c5-0eb5-4468-a395-30e98376d61e","resolution":{"observed_at":"2026-08-11T19:59:14.336103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T19:59:13.473248Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.473248Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e8b6c2f3e74c8d0a0d86fa8a00ea04ea1b80114b98f8dcab7e3e652dde493dad","observation_id":"69b91bbb-8d7a-4fc6-9e55-b0d424f983e9","resolution":{"observed_at":"2026-08-11T19:59:13.473248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.322579Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":"70352bf4-0379-40e1-904e-77060e6dd63b","year":1901},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.476828Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:b30213d1dae3f4c82e38d6e0dca9fbecf0f79c16f4d874f87d10d110de85ed8c","observation_id":"03d1f286-a7fd-485c-9b5e-b3d8dbeb4c64","resolution":{"observed_at":"2026-08-11T19:59:14.325979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.311479Z","title":"GLM: general language model pretraining with autoregressive blank infilling,","venue":null,"work_id":"a6d30782-2ca3-4650-a265-ad7c59493b5f","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.480137Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:aac027e3758c8fc9cd510960fa526d71ade8425bcec7691c9eda0cf6a49973a9","observation_id":"98458942-a666-484f-8f2d-3d651a394c1b","resolution":{"observed_at":"2026-08-11T19:59:14.315557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T19:59:13.483476Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.483476Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:07eb59c17f321f20e1fda5443a8c40b57c5ec3d3d2ee2d02335091fd88361954","observation_id":"c8db19b9-f461-438d-9453-3f5b81894773","resolution":{"observed_at":"2026-08-11T19:59:13.483476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.299786Z","title":"MIST : Multi-modal iterative spatial-temporal transformer for long-form video question answering,","venue":null,"work_id":"b0986fba-b14d-48a1-8000-f5aaa54fbf29","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.487191Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c66d11fff69da19a6f7624e3ffe5cdd5b6f14cec950d00acdf820a28082fa213","observation_id":"b41f2851-7240-4be8-bf5a-73bca0b77d97","resolution":{"observed_at":"2026-08-11T19:59:14.303595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.287132Z","title":"A joint sequence fusion model for video question answering and retrieval,","venue":null,"work_id":"a5c322cf-50f3-4e22-b324-49cd0b54ea47","year":2018},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.490546Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:27a7352b8996f5ee3f93c9b713de33a07baa7a17acd4199577690d300bb8ae55","observation_id":"cd159143-971a-4beb-bada-fac3eb9a60c5","resolution":{"observed_at":"2026-08-11T19:59:14.291561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.275670Z","title":"Video question answering via gradually refined attention over appear- ance and motion,","venue":null,"work_id":"e292e685-9512-45de-8dde-97f75e03c1dd","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.493599Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7f005f568671fb7c8f67b34536894b3f8dcafefca03fe707f4397e80797747ab","observation_id":"d2387de6-656c-40f1-ab0f-432ba582b063","resolution":{"observed_at":"2026-08-11T19:59:14.279595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.264691Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":"d46bce87-ab37-45d0-973e-b90286b8e856","year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.496737Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e4602fb8e201ef2002907fbc284b9b4b5c82a7aeade843e37c8cee3f8512be62","observation_id":"bff493ec-b099-46b2-b64f-2e3d8539f224","resolution":{"observed_at":"2026-08-11T19:59:14.268566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.253064Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning,","venue":null,"work_id":"dfa11f9d-794a-4b85-8f13-5cadc4a3a78a","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.499776Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:17fbc27dd807cda86c3b37e05d0a4aa6d2e51b10e653e14731d117438a33e989","observation_id":"522cb6ed-6d9f-4a78-8400-76f8bf6ab18e","resolution":{"observed_at":"2026-08-11T19:59:14.256936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.241214Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":"56175a85-afdf-467b-8a99-0b8a4d3d7e47","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.502597Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:29630cd0bb505451ae0f93b22b39589d05242d3210ce05c49c02901b6462c488","observation_id":"08ad18dd-0240-4738-ae53-f7bf796daec9","resolution":{"observed_at":"2026-08-11T19:59:14.245299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.229610Z","title":"Dense- captioning events in videos,","venue":null,"work_id":"eb58649e-fec4-4f2a-b2b0-407a87c042b7","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.506128Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a94b3f8ae2fc8008829889b5d4f31beefc5aaa478bcd36fed63f242c9c9f05a5","observation_id":"7cadfdc3-52c4-4d92-8868-78f9cb26701b","resolution":{"observed_at":"2026-08-11T19:59:14.233671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.217928Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"0be9bf47-e660-41a5-b0c9-8c5859cdd459","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.509171Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:18ccfa382a7ce17dafea8c6e5dd2adeda06bbb78df5af487f2536a3ac00e4149","observation_id":"df2e5754-c242-4eb4-9377-621b106bdf0f","resolution":{"observed_at":"2026-08-11T19:59:14.221672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T19:59:13.512195Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.512195Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3687d0d90d2e29906ab1715cca720c609d93998876abb3f4c9298f4118f5e25f","observation_id":"0f9707f9-ad5b-47f5-9be7-fc6146ad7ac3","resolution":{"observed_at":"2026-08-11T19:59:13.512195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T19:59:13.516220Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.516220Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:20731cfea42b959aa87fcf539035334a50734902372a273484061090659db8fc","observation_id":"447ac7d9-1ccd-48aa-8c0b-d5ab82159b1f","resolution":{"observed_at":"2026-08-11T19:59:13.516220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.206314Z","title":"Pyscenedetect,","venue":null,"work_id":"825b4b29-d20a-42aa-90a2-b0014895f323","year":null},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.519600Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9e5754d4ce02dad78d47d0c29fa3b8cdad0bd033cff180b01ddc2ccd37f56d1e","observation_id":"ebac29eb-40df-406a-84f7-88fdeb1499aa","resolution":{"observed_at":"2026-08-11T19:59:14.209964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.193811Z","title":"Decord: An efficient video loader for deep learning,","venue":null,"work_id":"9a4c2a4a-5413-44f9-9a24-45bd38d56a65","year":null},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.522639Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:5d33ad009ab2c13f3cad4c4725364a1c0eb4f2d738f4af2683d27f4310166120","observation_id":"4b1ddd92-00f5-44b7-9f41-36cc95970907","resolution":{"observed_at":"2026-08-11T19:59:14.197450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.525872Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.525872Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:edb9d7a1190a3fd40603d417bae0f4a1e8ac9f12e4dfdfe0199b5464a35344d6","observation_id":"f11bf45d-6f12-488f-b4fd-81bd7de680d8","resolution":{"observed_at":"2026-08-11T19:59:13.525872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.175717Z","title":"DINO: DETR with improved denoising anchor boxes for end-to-end object detection,","venue":null,"work_id":"18cdab89-cef4-474b-bba9-b05c5da89479","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.529027Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:796fb1e358545320b597e654467ca807456b5b63ab1d1f7d2b24ec316ae3317f","observation_id":"d5849239-8def-49a6-a4c3-cd867a0ed0b8","resolution":{"observed_at":"2026-08-11T19:59:14.179339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.165004Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":"1619cceb-c3a8-449c-83a0-6f1ccdf21f90","year":2019},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.532056Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7ab3c1cfd1eb26c53fda60873102e0db7503cb0488c281b994a2fb2f1a7a9795","observation_id":"ee5186e6-8829-4917-80a0-799e771344e1","resolution":{"observed_at":"2026-08-11T19:59:14.168721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.154991Z","title":"Partially relevant video retrieval,","venue":null,"work_id":"44d35440-f869-4804-be74-934f13c44e83","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.535135Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:c601e9b5ba4ca8e37f844e747f54e525c26082455c3af106076bebe30ace8308","observation_id":"11655f67-fe3d-4ae2-a455-a70c149ca17b","resolution":{"observed_at":"2026-08-11T19:59:14.158363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.143713Z","title":"Joint searching and grounding: Multi-granularity video content retrieval,","venue":null,"work_id":"8ca65093-f6f3-43c8-8054-8580d35c8f20","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.538757Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2829e8a8a671b0ffe9d86c6cde07c66dd5f772187584355e4742abc59bf1eeec","observation_id":"5a466a5f-d901-4c80-88a4-acaad7416c99","resolution":{"observed_at":"2026-08-11T19:59:14.147009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.133030Z","title":"Hit: Hierar- chical transformer with momentum contrast for video-text retrieval,","venue":null,"work_id":"0aa99d95-e06a-47cb-9e8e-e0fcdfe61c45","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.542232Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2f3f72699abd20b6d1767b145a41595a2c2095cd741f2acd25fa463e3bcadf45","observation_id":"bef96942-deb3-4b17-ad8e-b537412a17ba","resolution":{"observed_at":"2026-08-11T19:59:14.136686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.122845Z","title":"Multi-modal trans- former for video retrieval,","venue":null,"work_id":"384d36ff-ed58-4d50-922a-428e394f95eb","year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.545156Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9297720e8261dffc0e90337cb8df435f46b587e72716f951b3743dbca7938624","observation_id":"619faa62-256d-4b58-b41f-2d23bc20fbff","resolution":{"observed_at":"2026-08-11T19:59:14.126362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.112357Z","title":"Cross-modal and hierarchical modeling of video and text,","venue":null,"work_id":"afab3826-4d2a-4315-9e37-6ab789d1301f","year":2018},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.548293Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9053e51e98cb7ffd004697975cc49e9274817f623664346810daf7ff4533bfd3","observation_id":"818e37cf-5c0d-4737-b57a-81c6e1766cc0","resolution":{"observed_at":"2026-08-11T19:59:14.115696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.102293Z","title":"Eclipse: Efficient long- range video retrieval using sight and sound,","venue":null,"work_id":"071f21ff-5751-4d67-952d-d97d9e98af98","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.551159Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:3715f9ea065015d66113193ddfe1f6afa39b0ed9335c588f44ea92573169de6e","observation_id":"05a59bbb-5df8-486d-91ba-046535002610","resolution":{"observed_at":"2026-08-11T19:59:14.105621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.092528Z","title":"TALL: temporal activity localization via language query,","venue":null,"work_id":"1cea8595-f0d6-48a1-ac44-671373b0fa10","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.554216Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:d9647fe134c08e9767f336fcec52762655dc9ffa3cbcc1e1109a98242c8844ca","observation_id":"7750a39d-77a5-481a-9aa4-1712f209efa4","resolution":{"observed_at":"2026-08-11T19:59:14.095823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.082707Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding,","venue":null,"work_id":"c06a94a6-88fa-469e-ad92-f035aec76e99","year":2016},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.557624Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1b3fe9f05244f3b3b6bf92fa554cc0db66b6ff7e7d2554c98d8244056d0e606f","observation_id":"f586d4ae-e6cc-47e5-8c52-ee0c3c2a2acb","resolution":{"observed_at":"2026-08-11T19:59:14.085989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.072616Z","title":"MSR-VTT: A large video descrip- tion dataset for bridging video and language,","venue":null,"work_id":"50f6b602-0a0d-40c0-bba1-f83d116e7b35","year":2016},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.560460Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:5ea8e908915417c6c478df811f45d72b8d3e236a575bfcc670ca8c4d42b4110b","observation_id":"2c271b89-00d5-48d8-ad34-618c428d11a8","resolution":{"observed_at":"2026-08-11T19:59:14.076134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.062789Z","title":"Question generation via overgenerating transformations and ranking,","venue":null,"work_id":"acc79760-d064-40e7-96f9-7cc096c28014","year":2009},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.563116Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:f0638b0dd661493f7a51ac6314efffbe0df79d17d5914991b45b3fc6d3660a14","observation_id":"f42f821b-3b50-472a-875e-c61b44477382","resolution":{"observed_at":"2026-08-11T19:59:14.065916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.053628Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":"da6d04c1-a76a-4e62-8a1f-eefa7e7d6d16","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.566380Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9515301fe5538335a1ca4c32b1d53b97ebea9eae77713b4174e6e7a16552335b","observation_id":"b12f594c-664e-4e6a-b75c-8f8707ec5244","resolution":{"observed_at":"2026-08-11T19:59:14.056879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.043815Z","title":"Ego4d: Around the world in 3, 000 hours of egocentric video,","venue":null,"work_id":"cc5136f1-fcaa-4f76-addc-5d78801daf43","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.569192Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:9e445314434de04e5618550e8742c89b4c4ec6ace6304a0863c64b771711f370","observation_id":"4a7c3694-66ff-4de1-bb2f-002d1f1b1d72","resolution":{"observed_at":"2026-08-11T19:59:14.047172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.032995Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"62687e87-1cd3-4b30-93bf-321991198d5f","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.572112Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:33c6f8b3ce8f487874f2293e18fbf950ae108b61254684924a415f6cce5314b4","observation_id":"884ac27b-36fd-4ab8-9bcd-0063a955b8f8","resolution":{"observed_at":"2026-08-11T19:59:14.036272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.023586Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"1e8a2ab2-867c-43c2-9e36-5a498877b8b3","year":2017},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.574991Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:df3f51437844187dcaacd53f82fc1e051870d804777249d404638d705041ba8f","observation_id":"22780f74-4a8e-43b9-8b2e-19825e63da4e","resolution":{"observed_at":"2026-08-11T19:59:14.026777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-11T19:59:13.578033Z","title":"Judging llm-as-a-judge with mt- bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.578033Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8cae2316198bea227f329d5a0b70d994044bf775b8e57d7af521f8b589a4afd5","observation_id":"de50226d-8903-4b14-bd41-818fd009af55","resolution":{"observed_at":"2026-08-11T19:59:13.578033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.013742Z","title":"Sharegpt: Share your wildest chatgpt conversations with one click,","venue":null,"work_id":"df73e5f3-a629-435e-9214-540f5e7bd0b2","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.581465Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:02c944beaf41413ec0511a6bec01a0537e380269c9ace330c477a99022ca6a48","observation_id":"3b77bdc2-774f-4302-b3fb-3a29b29d2bd5","resolution":{"observed_at":"2026-08-11T19:59:14.017304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12871","last_updated":"2024-12-31T07:56:13Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T13:52:42Z","title":"AnglE-optimized Text Embeddings","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12871","snapshot_observed_at":"2026-08-11T19:59:13.585145Z","title":"Angle-optimized text embeddings,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.585145Z"},"links":{"cited_paper":"/paper/2309.12871","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:dddabe7b11557cb2522a52ad304ffd75fd1f7c5d30b064acc9d24aa32a721a54","observation_id":"4e65467a-9dc8-4212-b7e0-f05e6b940993","resolution":{"observed_at":"2026-08-11T19:59:13.585145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:14.003850Z","title":"Video corpus moment retrieval with contrastive learning,","venue":null,"work_id":"09719421-5afa-4d30-b696-2fd449058c18","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.588390Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:1331e42f0329ee2fb862be2f8ce045edd156d2eb5f1d7f5e954dceb65353d1a4","observation_id":"7be46fc4-02ac-4d22-af5d-02c447adc113","resolution":{"observed_at":"2026-08-11T19:59:14.007278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.993692Z","title":"TVR: A large-scale dataset for video-subtitle moment retrieval,","venue":null,"work_id":"ea957618-d54f-42a2-8ea2-4543e10e4255","year":2020},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.591759Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:8c1d032c27fa2576ca113c2b56cd478bfe4f8ebf870ded1cd6c06a9d27e66316","observation_id":"8875e9a0-e7ed-4f2b-9067-a3ebc767d51c","resolution":{"observed_at":"2026-08-11T19:59:13.997127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.983474Z","title":"Dual learning with dynamic knowledge distillation for partially relevant video retrieval,","venue":null,"work_id":"bd72c90c-5908-4dd9-9343-33c3cb36e829","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.594774Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:de327562a0d3f53def4c92f55bc4e4307f57c3295d573d70e13523f9ac34f0ff","observation_id":"3aeba3ae-12b5-4ea8-96d3-233932ff55b5","resolution":{"observed_at":"2026-08-11T19:59:13.986868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T19:59:13.597852Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.597852Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:4b565df7a9b9d8b6b328686005863a45f53b3fc53b43dbb15753f4d61ec0e5aa","observation_id":"f92a385a-4186-4f2f-af3c-81ae0c0f3a94","resolution":{"observed_at":"2026-08-11T19:59:13.597852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.973213Z","title":"Just ask: Learning to answer questions from millions of narrated videos,","venue":null,"work_id":"f4841f0f-f34a-46bb-99ac-f6c66040aa8c","year":2021},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.601448Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:7a1d29a078bdd9bf41a52366dbbe3d3882f977e220ad669e517991b976d7f385","observation_id":"ab79c81a-42d1-4f97-aa46-be999033b701","resolution":{"observed_at":"2026-08-11T19:59:13.976799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.962522Z","title":"MERLOT RESERVE: neural script knowledge through vision and language and sound,","venue":null,"work_id":"dac5bd75-dce6-495f-9563-9f9eb45e08e4","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.604459Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:2c4efe7468d8b4f6654541122ba0960b74530038b061824c58c2b9dc586e10a4","observation_id":"2528ebbc-87f5-4143-8735-33589eb2ea56","resolution":{"observed_at":"2026-08-11T19:59:13.965769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.952274Z","title":"Zero-shot video question answering via frozen bidirectional language models,","venue":null,"work_id":"cc3b17ec-c2cb-41e3-8af6-121af92d3d7f","year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.607548Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:396e98d1f83c157d4fe4ff0d213981bf58993194b0bf2b91ac541862fa0d7020","observation_id":"cf7169bb-7386-4afe-a9d6-dd790f1767c7","resolution":{"observed_at":"2026-08-11T19:59:13.955780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.940626Z","title":"Hitea: Hierarchical temporal-aware video-language pre-training,","venue":null,"work_id":"a14efe9b-137c-47f9-8a48-456f9db39635","year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.610461Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:914cb392727f766de7726bf1b263836ad532f478d8f727564b1b80d426445235","observation_id":"921d8ba2-5ff9-4525-8263-44a3a5f22613","resolution":{"observed_at":"2026-08-11T19:59:13.944568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.929228Z","title":"Self-chained image-language model for video localization and question answering,","venue":null,"work_id":"d544c7b1-c8ee-4a7b-a2a0-82ba13537547","year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.613053Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:45768ffa47728978ee42194fe1f3d28ab7562c6e164a3ece75a38e71456b55d8","observation_id":"0e4515bd-6b0e-47f2-80a4-eff5f7432f4b","resolution":{"observed_at":"2026-08-11T19:59:13.933048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:59:13.918676Z","title":"Memory consolidation enables long-context video understanding,","venue":null,"work_id":"50ef2c66-0bd8-422a-bced-97ec8f5d593d","year":2024},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.616348Z"},"links":{"citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:d7aefbb27de0bc2ceb6d085bfac7adbafc3e7aa7ecbb5d8c74380f3c745c11a7","observation_id":"22431014-9daa-4649-902f-4214ea607eb1","resolution":{"observed_at":"2026-08-11T19:59:13.922071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T19:59:13.619204Z","title":"mplug-owl: Modularization empowers large language models with multimodality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.619204Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:a940430ff255bbdf135ddd04c67d8aaae0f922dda36a9bbdbbc91bd609e34c57","observation_id":"8f5f7710-bbd0-4204-ab66-f4012eaf31af","resolution":{"observed_at":"2026-08-11T19:59:13.619204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":57},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 0 inbound Pith citation observations for arXiv:2412.06182."}