{"as_of":"2026-08-12T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa33ab3a5d62abf718153a18ea7606f4722e9d06183c90a00545e5e15c947071","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:48:07.259130Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.14965/citation-record","integrity":"/paper/2412.14965/integrity","json":"/paper/2412.14965/citation-record.json","paper":"/paper/2412.14965"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T11:48:07.102344Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.102344Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:59e0b68e35747e519a585a395a45937d3d8e75e8f2f2c7aa51417c435f40965f","observation_id":"cd9a2d0f-4f81-454b-86d7-ca7e8b50d817","resolution":{"observed_at":"2026-08-11T11:48:07.102344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T11:48:07.106481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.106481Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:b6bdc222a33c9f37ce45b40712b4ba4b268e49f1b99274d4e9f87d8e71533011","observation_id":"6629e209-1133-4450-b9eb-37a1247dfd21","resolution":{"observed_at":"2026-08-11T11:48:07.106481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00874","last_updated":"2022-02-02T04:49:14Z","snapshot_observed_at":"2026-08-07T00:04:27.412290Z","submitted_at":"2022-02-02T04:49:14Z","title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00874","snapshot_observed_at":"2026-08-11T11:48:07.109873Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.109873Z"},"links":{"cited_paper":"/paper/2202.00874","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:4e26b64ef30da4c4364cfa08d0a4a34650402b31a2220adf53d4adbf9477f931","observation_id":"665c0f6b-3883-4577-8704-1dba32b7c9c1","resolution":{"observed_at":"2026-08-11T11:48:07.109873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-11T11:48:07.113036Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.113036Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:cfd9c650c9c93a52bc12f1c7c5fa3d581740396afe6d156832f8246c8dde6a20","observation_id":"5ddfea5d-024b-46a4-b01a-fb5db9d6ef34","resolution":{"observed_at":"2026-08-11T11:48:07.113036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T11:48:07.116192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.116192Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:03bccfb9d47d4d764cdedeaf2f011a590cc48d78f5dd233c33ed462c0eb43b33","observation_id":"b93bcddd-58ff-49db-b644-c6af165c04fe","resolution":{"observed_at":"2026-08-11T11:48:07.116192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T11:48:07.119559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.119559Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:54a386868c2b013f5c0c3bab79a10264ba99c02ba4493b0e306ffebc7684072b","observation_id":"d7e4111d-1e26-4fea-a0c8-528596a46b7a","resolution":{"observed_at":"2026-08-11T11:48:07.119559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T11:48:07.122823Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.122823Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:ba6c29154be6430022d2568946172b02c6deedc05a99cf3114baf4badcfe6f6f","observation_id":"f96e29d8-7ca7-4892-82c4-dc466d4740d6","resolution":{"observed_at":"2026-08-11T11:48:07.122823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T11:48:07.125832Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.125832Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:ddd7f94fadff938e1dba0b8ebb5c47521643149c5d97d5a4fdf1c82c4577158a","observation_id":"ef7a6140-d6ea-41cd-84e2-b95b63334213","resolution":{"observed_at":"2026-08-11T11:48:07.125832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T11:48:07.128749Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.128749Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c6ddbcf48c6725388c5252de846005e05542ded256228cfeeacaa02d1242f72b","observation_id":"de6d5932-b665-4bb6-92a6-5f3642cdbeba","resolution":{"observed_at":"2026-08-11T11:48:07.128749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:48:07.131658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.131658Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:40564adae0591645c7de3cbaa651727cd3b55b5d2bb6c7682a80dab1a027607a","observation_id":"7ed0f38a-da12-4fa4-9290-714370f0ffd6","resolution":{"observed_at":"2026-08-11T11:48:07.131658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T11:48:07.133826Z","title":"Jiang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.133826Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:1bb5d66692288c8c0fdc8316c4f8b0a9491dd2c63848e24e0fe372078a43be07","observation_id":"e19bf70a-4876-4679-aec0-124eb466a99b","resolution":{"observed_at":"2026-08-11T11:48:07.133826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T11:48:07.136034Z","title":"Hu et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.136034Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c3d7e8dd4332f35e6be1312fa1a715bdee9e17c0f766d9e79e1d6986d39f2c48","observation_id":"3f4e0708-b829-4151-9a3b-7db13f38056a","resolution":{"observed_at":"2026-08-11T11:48:07.136034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01255","last_updated":"2019-11-04T14:46:31Z","snapshot_observed_at":"2026-08-08T01:40:47.328408Z","submitted_at":"2019-11-04T14:46:31Z","title":"pyannote.audio: neural building blocks for speaker diarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01255","snapshot_observed_at":"2026-08-11T11:48:07.138051Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.138051Z"},"links":{"cited_paper":"/paper/1911.01255","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:9ecadf20f7850573ecb012416b7243749e3c14a3ab421af161ac85099f36bab1","observation_id":"2c77b2f8-6403-4a6f-8bcc-1d2915e1130e","resolution":{"observed_at":"2026-08-11T11:48:07.138051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T11:48:07.140182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.140182Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:79e6e0e0aa01c5ff2fef63cf25645618029dfbef95468b4a463a285a1834a213","observation_id":"9533073b-bed7-41ba-8f87-3d69b11d8777","resolution":{"observed_at":"2026-08-11T11:48:07.140182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T11:48:07.142835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.142835Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:7dbee9506348784da492b7bd0d6a4a5421b6b19b86162806c384f45dd9a00501","observation_id":"918f1167-b37f-4b81-88a2-be8fba7523a2","resolution":{"observed_at":"2026-08-11T11:48:07.142835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-10T23:36:01.623927Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-11T11:48:07.145680Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.145680Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:95fc22c945d7faa6dc6fe38bae4b4836bd86ec981d240a34f2e8d8b346601b3e","observation_id":"e7f9a7a9-556d-458a-bfbb-362be4585dec","resolution":{"observed_at":"2026-08-11T11:48:07.145680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.915741Z","title":null,"venue":null,"work_id":"f9ef9ce0-4670-475a-a8ed-59254c58ebd0","year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.148685Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:d6efde3865e2bcd551451f479747362147bae47ad0582f6ee8ad51e0a79a4c96","observation_id":"1587efce-0860-4235-a2f9-c4753eca11b1","resolution":{"observed_at":"2026-08-11T11:48:07.919248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T11:48:07.152211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.152211Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:71676dfdab4d61d91044865ea0f2195436f0820feed7eb96c577b3eb741ebc64","observation_id":"918c887c-7417-4ee4-8c50-3483b9cf65c3","resolution":{"observed_at":"2026-08-11T11:48:07.152211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-11T11:48:07.155335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.155335Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:65851e5a077739ca6f9e2e819938c9642e73dd58796a63955d7728538a0c22fe","observation_id":"0d037024-1051-4a3c-a188-cd172d282873","resolution":{"observed_at":"2026-08-11T11:48:07.155335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05665","last_updated":"2023-05-31T04:57:12Z","snapshot_observed_at":"2026-08-09T09:38:35.454027Z","submitted_at":"2023-05-09T17:59:07Z","title":"ImageBind: One Embedding Space To Bind Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05665","snapshot_observed_at":"2026-08-11T11:48:07.158316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.158316Z"},"links":{"cited_paper":"/paper/2305.05665","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:47785695e14238823062ff1232476daeced0d59b84f4ce647ec478159ccb0adf","observation_id":"b37fe7cd-2232-484e-bdc8-a2fada3b1a5d","resolution":{"observed_at":"2026-08-11T11:48:07.158316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04261","last_updated":"2017-06-15T21:15:13Z","snapshot_observed_at":"2026-08-07T16:53:02.994435Z","submitted_at":"2017-06-13T21:26:19Z","title":"The \"something something\" video database for learning and evaluating visual common sense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04261","snapshot_observed_at":"2026-08-11T11:48:07.161317Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.161317Z"},"links":{"cited_paper":"/paper/1706.04261","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:91cb0415f070a18ec1d902ec0e4814738c42c31ebcb5f5ae077957c8115692f2","observation_id":"6f95db44-06c5-461b-b93d-2fb0f6537abb","resolution":{"observed_at":"2026-08-11T11:48:07.161317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-08-11T11:48:07.164357Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.164357Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:f3b9043667e4c87db953069582db1f166b367527b3c1b6438c43663ab3887adf","observation_id":"89da694d-c378-4495-bbaf-48d4a02e93df","resolution":{"observed_at":"2026-08-11T11:48:07.164357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T11:48:07.167213Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.167213Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:ab848099ed302afccd56de57c44054403c07ded547c167a92e323a5859a55754","observation_id":"2ed91dd6-bca6-42cd-a65d-adfc38ce79bd","resolution":{"observed_at":"2026-08-11T11:48:07.167213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.169934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.169934Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:921d411001d03c70956952230b657fbf6be2c3c3c846e046945d045ac8b76f0a","observation_id":"2507dc6f-705b-48cd-8927-98653dea6df3","resolution":{"observed_at":"2026-08-11T11:48:07.169934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10002","last_updated":"2024-12-13T09:40:37Z","snapshot_observed_at":"2026-08-11T16:25:17.625871Z","submitted_at":"2024-12-13T09:40:37Z","title":"NowYouSee Me: Context-Aware Automatic Audio Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10002","snapshot_observed_at":"2026-08-11T11:48:07.172477Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.172477Z"},"links":{"cited_paper":"/paper/2412.10002","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:61a4cc4a4d7837e518d9626ec5c5880d0d083bfab5596a01c686de0fbdba5bc1","observation_id":"57a20458-e932-4b76-93c1-4b894ad55745","resolution":{"observed_at":"2026-08-11T11:48:07.172477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T11:48:07.175428Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.175428Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c8ef6564f0bb334c870b94292a06fd0456e0ddee0500b2951489a0d2ae985e01","observation_id":"0d52e13b-9464-4109-8aff-0babfde8d622","resolution":{"observed_at":"2026-08-11T11:48:07.175428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.178368Z","title":"Kankanhalli","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.178368Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:b19e340d7e210b583ed68b889d2e7a821d0cbc8620c20938181d358d9ae81834","observation_id":"ddbc04f6-4c79-4f35-b983-679adfe59a15","resolution":{"observed_at":"2026-08-11T11:48:07.178368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T11:48:07.180993Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.180993Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:f2dce9de579f7a3e918f727e9e6ca44c838b5c7d20c42243f493064a748536ba","observation_id":"fa077860-7905-48e7-87c5-3891165760c8","resolution":{"observed_at":"2026-08-11T11:48:07.180993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-11T11:48:07.183821Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.183821Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:458d2cf669464b814fedefebb2dbc0ff919a7d68c32a90210e66ef11efb11860","observation_id":"e5eb1154-0f5e-4f3b-97a6-4c520c7c4bb5","resolution":{"observed_at":"2026-08-11T11:48:07.183821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T11:48:07.186559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.186559Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:6f2fbed0a12aeeb3b47d868d937cf589b34b5e234f7a7bdbb0b421bf672e1c6b","observation_id":"234b8113-a46c-43d2-a947-c42230ea32d9","resolution":{"observed_at":"2026-08-11T11:48:07.186559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.189316Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.189316Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:9a6b3262928801cec5bc330bc5cfd704df564a4e56b90882b8d6b2e75a320add","observation_id":"8279db1b-2f6a-461b-b949-46621b2e2bb9","resolution":{"observed_at":"2026-08-11T11:48:07.189316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T11:48:07.191264Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.191264Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:35abca1a2f354ef76819423cac580fe63e4c199e156841b912ea480e65948d3e","observation_id":"c7417c79-a758-4d7a-af3d-68c16309da6b","resolution":{"observed_at":"2026-08-11T11:48:07.191264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T11:48:07.193389Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.193389Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:efbe9adf223104cd8159d4b1b8464f8130f33902fa9c0aadd154da55b896aed2","observation_id":"cef6858c-35bc-46f4-8f41-19f74e14c841","resolution":{"observed_at":"2026-08-11T11:48:07.193389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T11:48:07.195569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.195569Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:01850f54e84c1b9e5ec1522f9fccff55726401bf82fc4e16869f5f04dd0d22d3","observation_id":"96e9d748-0816-492a-909a-bb559c1a83cb","resolution":{"observed_at":"2026-08-11T11:48:07.195569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T11:48:07.197598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.197598Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2eac95f6088594db52399d3a2ae4e1fee0b94ad047ee20629e93ea844f5b2fcd","observation_id":"6ec3c927-8318-4f6e-9ceb-87ba9fa6ae6d","resolution":{"observed_at":"2026-08-11T11:48:07.197598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.901690Z","title":null,"venue":null,"work_id":"6efe48b5-c8bf-4c2d-a4d0-b6d534ba1c11","year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.199634Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:a6d2812d99562fa6ef725b27b43852da86906e97c163f0ac5d309efed879107a","observation_id":"caed6f36-bebe-43b8-9854-1642dccd3482","resolution":{"observed_at":"2026-08-11T11:48:07.904681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.201536Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.201536Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:611a10e35d76a86367e9e52b7636e9aec85d9899fab902a41ded522666f903c6","observation_id":"c9274df6-1dd0-4f2f-ab4c-c2e9eca1e918","resolution":{"observed_at":"2026-08-11T11:48:07.201536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-11T11:48:07.204032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.204032Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:b3939c2f4c691be8cbc113ed7378a223eb69e0533661cc4eaed07825039596b4","observation_id":"a9b6ac0b-271d-4707-9b02-efa9b456f11e","resolution":{"observed_at":"2026-08-11T11:48:07.204032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-11T11:48:07.207064Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.207064Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:56ce55dd15ae08d4620c3a841335fdbf04fd364aa761b1cea761cf6bdf15fd91","observation_id":"ea0ada39-3cd6-43c0-a629-3b7cd5c75c09","resolution":{"observed_at":"2026-08-11T11:48:07.207064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.468647Z","title":null,"venue":null,"work_id":"1af581bd-3775-4af7-9c08-78a292b1fd2a","year":2015},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.209868Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c9fb789fa4efde3bb4ae903ea120e26e50402ed5f023db5ee36f32cb02925ef7","observation_id":"d6ecd06f-889b-4095-9958-d7e4bc40c222","resolution":{"observed_at":"2026-08-11T11:48:07.471391Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T11:48:07.212367Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.212367Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2c24e6a518ea3ce3af02806dab2e200b5223ae6cc19e7cc23291c4c6587f5173","observation_id":"556e9dc9-89ad-4f62-bd1a-07b39e84537f","resolution":{"observed_at":"2026-08-11T11:48:07.212367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10787","last_updated":"2024-03-19T08:51:51Z","snapshot_observed_at":"2026-07-06T16:20:40.674175Z","submitted_at":"2023-09-19T17:35:16Z","title":"AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models","version":2},"cited_work":{"arxiv_id":"2309.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10787","snapshot_observed_at":"2026-08-11T11:48:07.362951Z","title":"AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models","venue":"eess.AS","work_id":"96be9e9b-1a1a-40b4-b3d8-54e8d81f7734","year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.215478Z"},"links":{"cited_paper":"/paper/2309.10787","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:c7db5429cf9ed96af85baad918d6044dd33765f0956b1a8e6e95a064ec358dce","observation_id":"7d677305-df6c-43d0-a5ed-c76897f128eb","resolution":{"observed_at":"2026-08-11T11:48:07.367997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-10T11:36:03.411225Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-11T11:48:07.218794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.218794Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:ab614fc8469eb5320366ddebbc23b6933d750b1750805b3e65736548a41ffb47","observation_id":"9cfbe0f1-63d6-407a-8981-1ef078e0e4a7","resolution":{"observed_at":"2026-08-11T11:48:07.218794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T11:48:07.222604Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.222604Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:aa6dd04b340f90b3060877c8b4e126973ed9daea1b73432976eb6033be69e0ed","observation_id":"0ce6ac81-ac32-4b5c-ac18-878f9ed0616d","resolution":{"observed_at":"2026-08-11T11:48:07.222604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08276","last_updated":"2021-05-23T09:37:24Z","snapshot_observed_at":"2026-08-11T08:00:04.375430Z","submitted_at":"2021-05-18T04:56:46Z","title":"NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08276","snapshot_observed_at":"2026-08-11T11:48:07.225318Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.225318Z"},"links":{"cited_paper":"/paper/2105.08276","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:57a60e5d8e7ccd88144e3e64cbfb78d8d0a08fcd94b587155a7e35163024deaa","observation_id":"a182f44f-cc8e-4c4e-b4c9-72f1d94c21d1","resolution":{"observed_at":"2026-08-11T11:48:07.225318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14899","last_updated":"2024-03-22T13:24:35Z","snapshot_observed_at":"2026-07-31T06:40:35.464819Z","submitted_at":"2023-06-26T17:59:55Z","title":"FunQA: Towards Surprising Video Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14899","snapshot_observed_at":"2026-08-11T11:48:07.228234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.228234Z"},"links":{"cited_paper":"/paper/2306.14899","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:dc9411893be1e9fd7e10f362bb04db27c2e7ff25094d2093a59d14157fd8df38","observation_id":"cebcaa12-1d22-47e2-9e6b-74f8d28985bb","resolution":{"observed_at":"2026-08-11T11:48:07.228234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.892799Z","title":null,"venue":null,"work_id":"2a7bba77-cc2b-478b-bd38-0b7455233ea7","year":2017},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.231041Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:3446e5781e01fa9b874eec2223de7d6ccb8385c15ec9634f07f7dd34e5de18a4","observation_id":"22177569-1448-45b4-a04e-406c37531f4a","resolution":{"observed_at":"2026-08-11T11:48:07.895738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.233568Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.233568Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:e8d9e9736a2ed4bb5764f11b8adcd092fc4b877cb1cd5461a76157a547dc63e7","observation_id":"543570b2-49ae-4006-8152-d932ba4c8155","resolution":{"observed_at":"2026-08-11T11:48:07.233568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-11T11:48:07.236231Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.236231Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:fb689134a99202ae5021e18e3e2a65b13fca8c3b91a0488c0c12f98812c12b8e","observation_id":"0e2f40d3-0671-4b39-95d9-7cfe102ba48b","resolution":{"observed_at":"2026-08-11T11:48:07.236231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14040","last_updated":"2024-12-30T09:02:53Z","snapshot_observed_at":"2026-08-12T08:01:43.221760Z","submitted_at":"2024-05-22T22:22:26Z","title":"Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14040","snapshot_observed_at":"2026-08-11T11:48:07.238929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.238929Z"},"links":{"cited_paper":"/paper/2405.14040","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:d8a94b5338ce9d9c251d36a352e1da28b9c5bded57eb736504babc6a0da22c43","observation_id":"0db9eb1f-fce8-40db-ab3f-3c67398d39fb","resolution":{"observed_at":"2026-08-11T11:48:07.238929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15857","last_updated":"2024-08-28T15:18:46Z","snapshot_observed_at":"2026-07-06T19:07:11.892165Z","submitted_at":"2024-08-28T15:18:46Z","title":"What is YOLOv8: An In-Depth Exploration of the Internal Features of the Next-Generation Object Detector","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15857","snapshot_observed_at":"2026-08-11T11:48:07.241651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.241651Z"},"links":{"cited_paper":"/paper/2408.15857","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:94f93ef182a09bcfd1559e3fde7c4ff7d6265a56e35daf5693af12a2a5c5e461","observation_id":"ee578662-6381-4d09-a55b-038b0767eb72","resolution":{"observed_at":"2026-08-11T11:48:07.241651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T11:48:07.244506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.244506Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:991b309ca5afab22c0a6b527968ea109df15fa196762922fa2ee181a45e33b9f","observation_id":"3856e7d6-087c-4f6f-99e5-df0dc02fc371","resolution":{"observed_at":"2026-08-11T11:48:07.244506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.883839Z","title":null,"venue":null,"work_id":"030e12f8-e1fb-4b82-899a-e77a6a350292","year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.247202Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:97ddd54eeb783ff37e60af9db02122e7dc6ab0a8af95e68beba0e9384aaeb155","observation_id":"260020f6-a8cf-48d9-98b7-faa274e780c4","resolution":{"observed_at":"2026-08-11T11:48:07.887203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T11:48:07.249685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.249685Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2af567b22da0dea1f9270ff9a73b60f9ca492fb99537d99a02772d172dcde26b","observation_id":"5325b058-cfc7-444b-8ad9-06d1bc24f3c1","resolution":{"observed_at":"2026-08-11T11:48:07.249685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06129","last_updated":"2024-04-15T21:10:37Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:59:53Z","title":"Distilling Vision-Language Models on Millions of Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06129","snapshot_observed_at":"2026-08-11T11:48:07.251910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.251910Z"},"links":{"cited_paper":"/paper/2401.06129","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:359d256b739bd59f780e4e81b3d72a3fd42128643b5c2e907459ff98f6f06ac7","observation_id":"98f1a2a0-8a7a-4c6e-8f91-c50e1ee5aad4","resolution":{"observed_at":"2026-08-11T11:48:07.251910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T11:48:07.254058Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.254058Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:2e79bf28a47bbe4913ae371b06b08a18eda31cf736cfae4be6f4d2bbbc5ccfcf","observation_id":"9afde8d9-d360-4f23-b161-c02b8ba82897","resolution":{"observed_at":"2026-08-11T11:48:07.254058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.256287Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.256287Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:7bf0f161628c374e8345c8ce6f88382c3af0c915ab229ab5d126566b398721ef","observation_id":"e4705e8a-b71d-4bba-a84e-73e898a89bb1","resolution":{"observed_at":"2026-08-11T11:48:07.256287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:48:07.259130Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.259130Z"},"links":{"citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:822d4967e3df54edf670df765e733f2481eca6449ab1200017d2c6f4cf3f694f","observation_id":"ce3b0de5-1f1a-4ee4-8842-fb92cebbe38d","resolution":{"observed_at":"2026-08-11T11:48:07.259130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2412.14965."}