{"as_of":"2026-08-20T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ec6800aa3161ac7a9b1e8cb2d3bc770d7869f36e97fc8c703b3328e2a81c835","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:16:38.550913Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:04:58.672464Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-28T19:22:35.149980Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2510.26412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26412","snapshot_observed_at":"2026-06-28T19:22:35.149980Z","title":"Locot2v-bench: Benchmarking long-form and complex text-to-video generation","venue":"cs.CV","work_id":"e499c4c0-0d9f-4a23-acfd-c3a87b928634","year":2025},"citing_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-08-12T18:55:29.657974Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:17.360697Z"},"links":{"cited_paper":"/paper/2510.26412","citing_paper":"/paper/2604.07823"},"observation_digest":"sha256:558ca74c6ebbccedc11dd872b57c557c5b1d0a4b5052e101387eb243f23cb263","observation_id":"edc69a8d-dfca-4480-b398-6ab65e330a37","resolution":{"observed_at":"2026-05-29T02:04:58.384062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2510.26412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26412","snapshot_observed_at":"2026-06-28T19:22:35.149980Z","title":"Locot2v-bench: Benchmarking long-form and complex text-to-video generation","venue":"cs.CV","work_id":"e499c4c0-0d9f-4a23-acfd-c3a87b928634","year":2025},"citing_paper":{"arxiv_id":"2604.17428","last_updated":"2026-04-19T13:17:34Z","snapshot_observed_at":"2026-08-13T13:00:07.704821Z","submitted_at":"2026-04-19T13:17:34Z","title":"Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T05:55:51.789570Z"},"links":{"cited_paper":"/paper/2510.26412","citing_paper":"/paper/2604.17428"},"observation_digest":"sha256:f45c97d666cd04520968bd1e3f9756e76913cae87a95092de5eb9c54821d2e38","observation_id":"a6e11f54-c3bd-4247-84f6-8fddb277cca7","resolution":{"observed_at":"2026-05-29T02:04:58.384062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2510.26412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26412","snapshot_observed_at":"2026-06-28T19:22:35.149980Z","title":"Locot2v-bench: Benchmarking long-form and complex text-to-video generation","venue":"cs.CV","work_id":"e499c4c0-0d9f-4a23-acfd-c3a87b928634","year":2025},"citing_paper":{"arxiv_id":"2604.17982","last_updated":"2026-04-20T09:04:49Z","snapshot_observed_at":"2026-08-12T18:21:47.619082Z","submitted_at":"2026-04-20T09:04:49Z","title":"Mitigating Multimodal Hallucination via Phase-wise Self-reward","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T05:10:45.144421Z"},"links":{"cited_paper":"/paper/2510.26412","citing_paper":"/paper/2604.17982"},"observation_digest":"sha256:f45e4f6edd577de643896f2d50c5d719ec7c2acd063fc12c96bda6703deb7e43","observation_id":"4f28fbf5-a6d1-4e20-8180-9dee5e1e5a41","resolution":{"observed_at":"2026-05-29T02:04:58.384062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2510.26412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26412","snapshot_observed_at":"2026-06-28T19:22:35.149980Z","title":"Locot2v-bench: Benchmarking long-form and complex text-to-video generation","venue":"cs.CV","work_id":"e499c4c0-0d9f-4a23-acfd-c3a87b928634","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-08-17T02:34:17.615365Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2510.26412","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:28d944181df7ec29ae6bb4ea75551d6a5c1a7e26fba366c7c6415261c2e3514b","observation_id":"3e601acf-e865-4f6b-8696-b9a30703d0a6","resolution":{"observed_at":"2026-06-28T19:22:35.151377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.26412/citation-record","integrity":"/paper/2510.26412/integrity","json":"/paper/2510.26412/citation-record.json","paper":"/paper/2510.26412"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.006979Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.006979Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:9510db43340520ac42dbbcba0311147dad86127fbec0532c0c2704ebf90a5296","observation_id":"94aa2167-5884-4922-95cd-944c272e0767","resolution":{"observed_at":"2026-08-04T07:16:38.006979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.175067Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.175067Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:5498e78303c07a0f791bbf5eadf78243cdbc95862b50f5a7a974303b1189dc6c","observation_id":"2da3adce-ff48-4a13-9fb4-5f001abc7eb1","resolution":{"observed_at":"2026-08-04T07:16:38.175067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.481808Z","title":"- Technical constraints (camera angle, lens type, lighting)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.481808Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:11c5a5875fcce196968abb24fc818dc2fcc4af8367e2d62cb97bfb5adba26422","observation_id":"f9505456-56eb-4e53-9f67-73e00447cae1","resolution":{"observed_at":"2026-08-04T07:16:38.481808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.474314Z","title":"- Number of attributes or modifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.474314Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:67541aeb5b518037c647fdb79f86157add3affd7a84fda2f97d22ac4a6d5dcc3","observation_id":"685e5717-28f1-42bd-9f53-8c53306d6866","resolution":{"observed_at":"2026-08-04T07:16:38.474314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.423554Z","title":"semantic_complexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.423554Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:7353f6e24a73c00ec29f690a6d1296797d2cea9019176922079a2e97c1e73198","observation_id":"c691edc5-02fd-41e6-8b86-b5b51939ec22","resolution":{"observed_at":"2026-08-04T07:16:38.423554Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.477663Z","title":"- Nested or hierarchical descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.477663Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:8735aaff242473298e9631b7df09c9a964e394e5b01060c251de3c7ecebd2731","observation_id":"cf351cc6-7c02-4e83-81ef-2cc5e0021b87","resolution":{"observed_at":"2026-08-04T07:16:38.477663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.485132Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.485132Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:e3d88c02eefa5f88f5c397ea5ac72e4e942510c1a90217af9b0f65148bede264","observation_id":"876a17ac-af11-4d5d-93bb-278217433858","resolution":{"observed_at":"2026-08-04T07:16:38.485132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.488576Z","title":"- Environments: Describe the setting in detail, including lighting conditions, spatial layout, textures, atmosphere, and any notable background elements","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.488576Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:0d8fb3fe9dfa9b81719977953bd27eca585375ea37d637baa268032114fd9696","observation_id":"d423037e-7b98-4caf-975a-78bcb994e15e","resolution":{"observed_at":"2026-08-04T07:16:38.488576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.491429Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.491429Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:02eb9b9d61d5d5b60bff895d42bef5880e36b0ff501318f472dbbb479648ee80","observation_id":"60409484-74a1-4f8a-ae4a-3a1f877d1a42","resolution":{"observed_at":"2026-08-04T07:16:38.491429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.494342Z","title":"subject\": Who or what is involved in the event. If there is no clear visual subject (e.g., a landscape or object), use an empty string","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.494342Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:0ec712638dc84d25985520e8e7608762fccf1b6e68cc79063a05af56de22b5b9","observation_id":"9778c077-25c0-4ec3-b9e4-e1edcaff8662","resolution":{"observed_at":"2026-08-04T07:16:38.494342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.497919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.497919Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:deaf73f67b7fb570b42e49200ba286b5592c3003011b1b1d3dfad07255839c00","observation_id":"28dfe4c5-c544-4648-8be7-0ade7852a127","resolution":{"observed_at":"2026-08-04T07:16:38.497919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.500865Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.500865Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:eae924b2f016f07e18a1721480c2e9aac77d87a33f09ac50991d0cf5a07a1a30","observation_id":"5f4c6ea7-2785-4d0e-90b5-e598c7b1de14","resolution":{"observed_at":"2026-08-04T07:16:38.500865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.503999Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.503999Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:e757c07d8baa3359ad7a8d19479f8d596e65cb8a1e5d18400e9c85849da3b419","observation_id":"b6009fdd-8669-4201-bde6-8d384f337231","resolution":{"observed_at":"2026-08-04T07:16:38.503999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.506923Z","title":"Do **not** align your scoring with them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.506923Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:76a8dd9d9dcd7e585f3680366120f85b3d06ca2eddb54722d6961a68769bb05e","observation_id":"57d4ee85-37bb-45ce-9095-88ea8d0d36f8","resolution":{"observed_at":"2026-08-04T07:16:38.506923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.517307Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.517307Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:16d81c140779760868d3347fe7f9db6ec59a23c8b994ac6786078314e92b8621","observation_id":"e6e642e3-6412-4185-b12d-9e23cb7ad8ea","resolution":{"observed_at":"2026-08-04T07:16:38.517307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.523983Z","title":"25 Preprint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.523983Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:9e44903db40d723b7d10671eb0b72c1f17948b1128e1b0d60bad610389157eba","observation_id":"fa9fee48-99a6-4259-8f42-c5c0653d3f56","resolution":{"observed_at":"2026-08-04T07:16:38.523983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.530233Z","title":"Emotional Response","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.530233Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:458978a71102e12c5d1ed92af4d7156343965c3aeffd2b9e37f45171a402e693","observation_id":"93cd004a-e8be-4c44-b62b-0c376dfbecc1","resolution":{"observed_at":"2026-08-04T07:16:38.530233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.533517Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.533517Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:42cce1a7c48d54bbb3dcf4643daab2e888d40f1983ff470aadb9f262f6de3b5c","observation_id":"183770ff-81ea-4d46-b486-bebf5ae3b051","resolution":{"observed_at":"2026-08-04T07:16:38.533517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.536382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.536382Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:e2dcce71514096515dc5e6cac8661c722e49f398a3757f06ce53f8bdedf1b6bc","observation_id":"7284caf6-db6d-4b4f-bed5-f0c7ac386101","resolution":{"observed_at":"2026-08-04T07:16:38.536382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.539397Z","title":"26 Preprint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.539397Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:d13c9ba641d632e9dc11008d77fabdb6229f4559daf48b32dc5dfc3315ce589d","observation_id":"b80ca62f-6087-455c-8ebb-b972687ee68b","resolution":{"observed_at":"2026-08-04T07:16:38.539397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.542448Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.542448Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:a4a4ed04e013c12994eb961e50106d6c735e643093f5f907fa255af8e1355f32","observation_id":"9f5d0e15-6154-4403-8042-acec258b6818","resolution":{"observed_at":"2026-08-04T07:16:38.542448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.545530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.545530Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:0c9327685293a594295953e84473bf79b0aff96a72089dae84931ba04164f65f","observation_id":"bf32bed9-845b-4064-8a0e-53ab15322527","resolution":{"observed_at":"2026-08-04T07:16:38.545530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.548308Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.548308Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:48c3e4367ed2f1108ff7c2887ce3d206fdbee376ee3ffdcaf3a27f60d5a95fb9","observation_id":"dc76f2b4-273c-4492-b9e2-fdb2d4143283","resolution":{"observed_at":"2026-08-04T07:16:38.548308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:16:38.550913Z","title":"Yes\" answer indicates the video did not meet expectations.) Output only","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T07:16:38.550913Z"},"links":{"citing_paper":"/paper/2510.26412"},"observation_digest":"sha256:5e890796bd2c64d806adc83b31d03d3bcd99808709c34dcb2b0645040c4de709","observation_id":"950525a2-5ceb-4cbe-989b-d515aba80a16","resolution":{"observed_at":"2026-08-04T07:16:38.550913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T21:21:22.234941Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 4 inbound Pith citation observations for arXiv:2510.26412."}