{"as_of":"2026-08-08T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9224ab69454deac08721e207da752f13031e10ef5fa5463e68305925118debc3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:24:30.507687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.158751Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:6d242fc8677a5c7847fcc724e225fb04099c8bc439fe9a7a036511812121aa48","observation_id":"b7ee496c-307a-44e6-8f8c-40193d70a00c","resolution":{"observed_at":"2026-05-23T05:45:28.412684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-07T05:24:30.507687Z","title":"Short film dataset (SFD): A benchmark for story-level video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.507687Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:639660b6f61833b80c167631f8e57ddcd46d816b18221c2024739eeb4070420a","observation_id":"8e73c803-64ed-40bb-a691-b58d78a20ef3","resolution":{"observed_at":"2026-08-07T05:24:30.507687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2508.20765","last_updated":"2026-04-08T02:55:23Z","snapshot_observed_at":"2026-08-02T23:26:21.127911Z","submitted_at":"2025-08-28T13:19:49Z","title":"Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-18T20:26:16.133860Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2508.20765"},"observation_digest":"sha256:91d9309dc76fde80bf55d2cf7223e9e1eb988b19450e62ae8c605baeddddb134","observation_id":"3acff9a8-de2f-4358-aa47-e10ddb3e13ee","resolution":{"observed_at":"2026-05-18T20:26:51.230528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-04T20:20:36.720168Z","title":"Short film dataset (SFD): A benchmark for story- level video understanding.CoRR, abs/2406.10221, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-06T13:15:27.312512Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.720168Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:7b77abcb89b2c5ed857f3e06964230fabe230f3c2157dc651f344319c28bc1d8","observation_id":"d3f21b02-50e6-4e04-80d3-31a1a0dff288","resolution":{"observed_at":"2026-08-04T20:20:36.720168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2512.10571","last_updated":"2026-05-02T11:27:08Z","snapshot_observed_at":"2026-07-31T11:34:00.884185Z","submitted_at":"2025-12-11T11:58:53Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T23:26:21.855485Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2512.10571"},"observation_digest":"sha256:60da9ce5f78454149f749f246b6cf2da96fccc8e5897a99c34266955bb141de3","observation_id":"2685d3f7-0258-4eaf-a1a7-d7580f6b2bb0","resolution":{"observed_at":"2026-05-16T23:28:40.860847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:32.558440Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2605.18467"},"observation_digest":"sha256:2d8c0abe38ab09a58086820b59f0eda2c71223a46df889ab0d048fd21067f556","observation_id":"78eb26ea-c384-4588-bbbf-a646a07d6d9d","resolution":{"observed_at":"2026-05-20T11:38:14.766651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2605.31069","last_updated":"2026-05-29T09:38:43Z","snapshot_observed_at":"2026-08-07T07:32:37.435310Z","submitted_at":"2026-05-29T09:38:43Z","title":"Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:42.001361Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2605.31069"},"observation_digest":"sha256:c23ae70ae248e66b0394c2b8614f503e67f0d88ee4d35bbe4d735a401d57d78a","observation_id":"34787311-7470-4e90-88e8-8a6aba37de24","resolution":{"observed_at":"2026-06-29T00:02:50.355832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":277,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:01a29bc4746c01c6e60c46a644fecaafda04dec632d199b741e9cab1062b9287","observation_id":"b8748d69-e048-45e0-8ca8-82e8ffcb0d2b","resolution":{"observed_at":"2026-07-02T17:27:15.160322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":"2406.10221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-02T17:27:15.158751Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221","venue":null,"work_id":"ca99cf96-d097-4030-a04d-73ca67637c41","year":2024},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T07:18:20.501369Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:5bc9bf73d6e92ae729d3b292bcafb6ad4a33795f0c02b6660097ac723fb42b88","observation_id":"df246eb0-095b-4120-9d99-a7e1391930c8","resolution":{"observed_at":"2026-06-30T07:24:21.527026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-07-14T17:03:01.432145Z","title":"arXiv preprint arXiv:2406.10221 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T17:03:01.432145Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:521137ae433c7ddf9f957e49dab5c0ed4dd3ebd87f1a7a16eefc2c9fb0a73d7f","observation_id":"0396d090-764d-463a-a956-0ca4d8f4f1ab","resolution":{"observed_at":"2026-07-14T17:03:01.432145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10221/citation-record","integrity":"/paper/2406.10221/integrity","json":"/paper/2406.10221/citation-record.json","paper":"/paper/2406.10221"},"outbound":[],"paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2406.10221."}