{"as_of":"2026-08-18T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f149440462aaba732bb91ad41821e704b17c14cc0d0ee9174554ad84d4eb6b3a","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:10:22.228795Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09283/citation-record","integrity":"/paper/2412.09283/integrity","json":"/paper/2412.09283/citation-record.json","paper":"/paper/2412.09283"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.317531Z","title":"Chen and William B","venue":null,"work_id":"c1fed6b6-a75e-43f8-8125-6cb06e107d3e","year":2011},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.885108Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:a614c005818c91dce1e505df9f24b3ea63fbea32d6488fb0402744f49ed3d6ea","observation_id":"f098c3e9-9f2f-4ffc-ae90-4dc2769f8607","resolution":{"observed_at":"2026-08-11T17:10:53.322697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.301526Z","title":"VideoCrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"853f07b8-3bda-4af6-a082-12a9582070ba","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.891074Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:45a69da85caf07efac38249177efc9ced640e4c2501940417f35aad568b46499","observation_id":"d57e239f-5270-4cfb-9c6a-ac55c55d4ef2","resolution":{"observed_at":"2026-08-11T17:10:53.306471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T17:10:21.897243Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.897243Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:d75d5e7711a2d8fe1004a6283c06af596bf640f80ebc19dfd728ce23bd42569d","observation_id":"4ebfefe2-7ddf-48c5-b74f-a80380af84ad","resolution":{"observed_at":"2026-08-11T17:10:21.897243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-16T14:13:59.779732Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-11T17:10:21.903106Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.903106Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:cd60537c4a6eb512bcb63b992e137f6979b68158a4ff2e5ec945abd91944d604","observation_id":"85085582-55ce-400c-b4df-279fb124da4a","resolution":{"observed_at":"2026-08-11T17:10:21.903106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-08-17T00:02:32.691472Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-11T17:10:21.909455Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.909455Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:cbbdc42db4a1a519224fcd604e8bfccb9f4307368c75d070393cb97a83eea096","observation_id":"d23350ec-f60d-4ba0-b2ce-ae3afb25ebc2","resolution":{"observed_at":"2026-08-11T17:10:21.909455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.285483Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"219666b5-d934-4cfd-8199-52faab2e95fe","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.915566Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:caa778525b3f275014a026e0da84c44d03a111ca0cacbe6b5436b4e1c80f523b","observation_id":"1ec20df2-4806-43e7-802c-3ede21157525","resolution":{"observed_at":"2026-08-11T17:10:53.290914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.269398Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":"c2b6d61b-d6df-42e5-8d53-b938b3328300","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.920916Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:e147db2c5abc383a2fef434ecfb659d0d2e7867aef9ac98dcafa5fffb281e77e","observation_id":"8edaebb5-2364-49c7-81e8-10cffce4725a","resolution":{"observed_at":"2026-08-11T17:10:53.274241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:21.927418Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.927418Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:2167768caa645e7b4775b6bd00600834a43c2690a2fe0dfcef29ec9845d88957","observation_id":"4c7fbfbb-a11c-4a9e-9d90-b56edcc76973","resolution":{"observed_at":"2026-08-11T17:10:21.927418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-16T13:36:00.528382Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-11T17:10:21.932432Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.932432Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:f57ba268f8e8e27323cbaec8321cfd7392e7d2c0c2648abefc6527733d623504","observation_id":"5af02d9c-2cc1-411a-8e94-3e020a7ddb98","resolution":{"observed_at":"2026-08-11T17:10:21.932432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.252275Z","title":null,"venue":null,"work_id":"92d875dc-3228-42ec-89ae-53ff5d5ae301","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.937711Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:1c09c26dad0621964512bd04ac8bbf1b698facfa22b7b304d746c067779c977a","observation_id":"6118f070-b677-4b94-bfa0-8843cfd55cb1","resolution":{"observed_at":"2026-08-11T17:10:53.257171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.236094Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"0109190e-2c20-4684-aee5-6b0729334138","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.942609Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:6a54d742440547ff6dbd0c2ba4a27711a51b80ea550fbb1ec257f39c1d2c909a","observation_id":"77183dd7-47d2-40e3-b7b2-6b85611a20a7","resolution":{"observed_at":"2026-08-11T17:10:53.241808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:21.947570Z","title":"T2v- turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.947570Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:1b6e5b9169c506a128a2a3090b7fb9183b6b97a59602c751bca265d1796444c7","observation_id":"af50f70e-e17f-423e-ae7f-d685af56199d","resolution":{"observed_at":"2026-08-11T17:10:21.947570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.218888Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration, 2024","venue":null,"work_id":"3cbb1960-9036-4cc9-8934-7eb8a8d84291","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.952218Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:a5089f2e22b7fb55f2aff0551f0379c4fac6dac05a7343fd88c6b0119e74ae4d","observation_id":"4b43d96d-9d72-4105-866b-a4156803ea0e","resolution":{"observed_at":"2026-08-11T17:10:53.223906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11440","last_updated":"2024-03-23T04:58:50Z","snapshot_observed_at":"2026-08-17T07:59:34.011185Z","submitted_at":"2023-10-17T17:50:46Z","title":"EvalCrafter: Benchmarking and Evaluating Large Video Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11440","snapshot_observed_at":"2026-08-11T17:10:21.957349Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.957349Z"},"links":{"cited_paper":"/paper/2310.11440","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:c8cff230d361693c08e1baefe72e9ac33eb6781abaffd6dcb2af8a6bd03b860c","observation_id":"73ec0bcf-72e9-4f34-a786-a13eef6bfc78","resolution":{"observed_at":"2026-08-11T17:10:21.957349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T17:10:21.963009Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.963009Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:4b056309843e886162c8cacb87fb0e1786a27dccf997832d5a8ee71f7dd13eb0","observation_id":"fd21542b-0112-4ad1-99bd-b9d3eb2f66ab","resolution":{"observed_at":"2026-08-11T17:10:21.963009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-11T17:10:21.969388Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.969388Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:da74954e05768913c575e294e0671a66e4771f6d20ece7ef04c21d00c929a66d","observation_id":"2c2e2bc9-c3de-4886-87df-a7dc1680c0ce","resolution":{"observed_at":"2026-08-11T17:10:21.969388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.200729Z","title":"Animal kingdom: A large and diverse dataset for animal behavior understanding","venue":null,"work_id":"7a9b7410-26d0-4e25-9c0a-5446c198d8dd","year":2022},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.975014Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:bd9f50e50664d41bd52822409e9e77afae57af5a9b46d87fce7732ac4775f143","observation_id":"fc576829-b7bc-4388-b783-e820dfee3991","resolution":{"observed_at":"2026-08-11T17:10:53.206937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.183824Z","title":"Pika 1.0","venue":null,"work_id":"9867deac-e3dd-4db1-9da9-255fb40bd6a4","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.980801Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:fd51c7e69e955455d08e5d1398d7648eab3bcd9210094ba48b5e76d38101a1a4","observation_id":"0054ac26-a500-4ce8-910c-64dd8e702de0","resolution":{"observed_at":"2026-08-11T17:10:53.189391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.167353Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":"ddc5913b-fa60-46b4-9500-5028e75b75c2","year":2021},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.986290Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:124b9cdc57b94ca3095dea0a8825dabf9846d8b58260c6dbda0eb8762f0e1586","observation_id":"0ec2a843-92e2-4d53-a88b-bc84f7fd44a4","resolution":{"observed_at":"2026-08-11T17:10:53.172796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T17:10:21.991371Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.991371Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:6b2e49589f5ce52d626b7986c2948ae06ebd6a3c0444f48e38135964a9665c77","observation_id":"9bea47ba-645f-4e3f-b1da-5748cc258da8","resolution":{"observed_at":"2026-08-11T17:10:21.991371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.150416Z","title":null,"venue":null,"work_id":"2063336c-c455-4322-a041-ddd785c76846","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.996655Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:19bbd4643e30d423bc90322c4f4da426cd9685b1832c1152851584948c358ef3","observation_id":"ed6640e2-e24f-4d5d-aa8e-584e8ddaf2be","resolution":{"observed_at":"2026-08-11T17:10:53.156086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.131134Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"f9257069-0268-496e-a96b-c50cd1dfd026","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.003117Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:344801d269418440fde2d62810ed7a32cfd255272f8dee89cce92ba5abac0b04","observation_id":"d9812e93-3ff8-40bc-bfca-468994f453ef","resolution":{"observed_at":"2026-08-11T17:10:53.137911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T17:10:22.008174Z","title":"ModelScope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.008174Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:0c8f9dbd41b84dc8b9a6b0010036a1bc1abd1a541f21e2610d0972adccde176a","observation_id":"fee51e57-7e0b-4dac-aff5-61ac3bdbaa7a","resolution":{"observed_at":"2026-08-11T17:10:22.008174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.108730Z","title":"Vatex: A large-scale, high- quality multilingual dataset for video-and-language research,","venue":null,"work_id":"89aac83a-a6e0-407c-9ae1-df75430dfefd","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.014362Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:b82539f9762fa70e7af65e31dee06b14cfb483bca3675848bf6132e7e5b6152b","observation_id":"9e21e2c1-3a3e-4bb0-bc4c-0e12308fd022","resolution":{"observed_at":"2026-08-11T17:10:53.114885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-17T12:21:00.357059Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T17:10:22.020323Z","title":"LaVie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.020323Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:57e9298894103531227388c6bd841b83c50dea096560d0b70be101fb968a25bf","observation_id":"aa616b46-75ad-4d33-9d72-c21d88d7e1c5","resolution":{"observed_at":"2026-08-11T17:10:22.020323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.092051Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"85761c94-40d9-4031-a368-cde7d4924c03","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.030087Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:a23ff0c8c1ca643fa700c3ac1c4cfd464bb893e3ddfdb0bb3b63ae352c1f8983","observation_id":"7c4a398b-520a-4cc2-b9ba-31dfd64e4ff7","resolution":{"observed_at":"2026-08-11T17:10:53.097058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.073771Z","title":"Ifadapter: Instance feature control for grounded text-to-image generation, 2024","venue":null,"work_id":"1ef227c0-ad38-47c4-9341-d90c37322546","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.037006Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:612d699ead87b58ad4d839e0a895882b39062c527d2d7b90b0cb801d95b1679d","observation_id":"95c1768c-6195-40ed-9b97-b37311e9020d","resolution":{"observed_at":"2026-08-11T17:10:53.079417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.056541Z","title":"Vript: A video is worth thousands of words, 2024","venue":null,"work_id":"098335d9-84c3-48a5-9e2e-269f79c9d391","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.042805Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:270ebca9a18ec9cf81fb222da20576c434eb368c4a7f21c50938c04e9e8e5fd8","observation_id":"6ac07ef2-95a5-4b98-a847-e3c1166cad5c","resolution":{"observed_at":"2026-08-11T17:10:53.061606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.040390Z","title":"Mastering text-to-image dif- fusion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":"737a0d56-654c-41e9-8cf3-fb45629c3e2d","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.055946Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:2f5f560ae1f89359bcdbf19d774e26c39d063df20d4da533bd1148ec52b9631f","observation_id":"a450c8be-4544-4f05-b717-c9bd27bf6505","resolution":{"observed_at":"2026-08-11T17:10:53.045703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T17:10:22.062619Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.062619Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:06d826be58cf0643de45507a2733fbb8f81ea8b76676c1f13ccad4838a5683ab","observation_id":"68f197f2-abba-4d39-9807-5a81253164fe","resolution":{"observed_at":"2026-08-11T17:10:22.062619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:22.069047Z","title":"Cpt: Colorful prompt tuning for pre-trained vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.069047Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:9ccf46f21f22430169e54c5594cca5b055a90bef08a66d3b038654552cc783a6","observation_id":"031a6f72-fe6e-42f0-ade5-027b6ab50fe2","resolution":{"observed_at":"2026-08-11T17:10:22.069047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.012730Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"84a05cb5-3d9a-4e30-8441-12877ca6d784","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.074359Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:642b3c1ec634666b2607df9c8e834c4bf5a14bfff8bc0ae2b5445ac5f50f26b6","observation_id":"5fa98523-e966-4445-9cde-15042c4c94a0","resolution":{"observed_at":"2026-08-11T17:10:53.018846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.996373Z","title":"Efros, Eli Shecht- man, and Oliver Wang","venue":null,"work_id":"f8f627fb-e7a0-4772-aebf-86727861f2ac","year":2018},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.081845Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:cfe233cbf4e78f398d73b24628dc92684ed87f0100706716f5e3fd96332f3ef7","observation_id":"d19740f5-efad-4cb3-a74c-17647e40ea17","resolution":{"observed_at":"2026-08-11T17:10:53.002158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.978844Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":"f36f0637-560d-4f06-a169-5541be0a70c5","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.087507Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:1c5e97f73a199be94ada7cbd1af118391cb5605eb0132ee923d70b47eef57f1e","observation_id":"ca537b78-a784-43d9-9adb-6e20807cc484","resolution":{"observed_at":"2026-08-11T17:10:52.984990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.962632Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"acbc4689-b55f-43dc-9e41-f8b8a6e4d1a6","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.095179Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:38673b8dc5ce0cb42d1309c69a7bcd9c88b2eb080031ce4b3f915c0a1540c848","observation_id":"f809e469-f5a1-44f6-a958-4e226d7f06e2","resolution":{"observed_at":"2026-08-11T17:10:52.968053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.946962Z","title":"Open-Sora: Democratizing efficient video production for all","venue":null,"work_id":"dd44339c-6274-4801-97d0-e5cfa25069c2","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.101440Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:def8c0c7e7d7faf43b561e4ab76555712f55d52668cfc2179aadd61fd8fa756a","observation_id":"cc17b6b7-170b-4017-870e-873af743e6aa","resolution":{"observed_at":"2026-08-11T17:10:52.951776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.930347Z","title":null,"venue":null,"work_id":"94880bb8-40a8-480a-88e4-a7419e1e4cbf","year":2018},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.107772Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:780a145b49eb858cd5f99d98edf2c77fa338be47621299e200679d2247d1ab10","observation_id":"95ddd32b-5419-4f6e-bcbd-1f2343d8fd40","resolution":{"observed_at":"2026-08-11T17:10:52.935738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.911167Z","title":"Detrs with col- laborative hybrid assignments training","venue":null,"work_id":"0dc5dbc7-c3f5-4cae-a878-8a52c1a4d6ab","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.113084Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:5e7a86d8d6d789766f55984ec6f55fe63f090e592bf692918568d85b90b07cd7","observation_id":"270d6517-3512-4130-80b8-5de4d34bb86d","resolution":{"observed_at":"2026-08-11T17:10:52.917077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.892877Z","title":"Conversely, we manually constructed a Negative Lexicon, which was further enriched using the powerful LLM, GPT-4o","venue":null,"work_id":"395dab42-5db5-4438-84c6-d2d5a59e7a3f","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.118425Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:49c8be242d230736eca4e9cc01c020704c97dd32a5ff6f29b858f99eae9799ed","observation_id":"318e6561-5430-4add-b673-a6b1154ef611","resolution":{"observed_at":"2026-08-11T17:10:52.899020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.876366Z","title":"Please describe the car by its color, make, model, condition, license plate (if visible), and any distinguishing features such as stickers, dents, or modifications","venue":null,"work_id":"87d059d0-f255-42c3-8978-cbeebdc0bce3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.125141Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:cef69ba91fb7c26a765d5560434937e2e9ab342a47147cd939ac6f33b54648c1","observation_id":"73d602a7-17e8-4818-a477-2f4a5bf17aef","resolution":{"observed_at":"2026-08-11T17:10:52.881436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.861503Z","title":"Please describe this video in one sentence, no more than 20 words","venue":null,"work_id":"4d3ece89-6b94-4f5c-9def-a2556aae075f","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.130340Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:11b616cd546b654106a7c6e53901c7b3ce491063841fab7235580cac173e8304","observation_id":"231bd2a2-cb13-47c6-85f5-b7a4a6953f5b","resolution":{"observed_at":"2026-08-11T17:10:52.866461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.846309Z","title":"To pro- vide more precise instructions to LLMs, we meticulously designed multiple examples as part of the CoT, which are fed into the LLMs","venue":null,"work_id":"dfcec52e-016e-4823-8306-cb22a041aca3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.135176Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:10a728b268804267e81bdeaf77d503cdbb33280bdaa01551dc2be9318dc56bef","observation_id":"57eef00a-8192-48ac-9c89-8e9d1f2d0758","resolution":{"observed_at":"2026-08-11T17:10:52.851374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.830354Z","title":"subject\" +","venue":null,"work_id":"670958fb-e06f-4758-8f81-bd24d6e978d3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.141222Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:ef6cdfc7542bbd952ffc219116fe916ef76ab97cf0f1ea660ffff06f5355fd46","observation_id":"05cacb38-087a-4f84-9b17-3324de6d7a87","resolution":{"observed_at":"2026-08-11T17:10:52.835383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.813383Z","title":null,"venue":null,"work_id":"181e804a-bcf7-4dd0-ac7d-fe09d177186c","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.146262Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:0a81ab46bf446cd00d527d50cd11d801d904133fefdfaec212d90c843bedd56d","observation_id":"88254254-5fef-4b45-a053-24043bc1c34b","resolution":{"observed_at":"2026-08-11T17:10:52.818327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.798316Z","title":null,"venue":null,"work_id":"8dbfc395-5ca6-4fcc-a851-9800ab01eb3b","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.151056Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:24ce3722e8b0af10a32241c66b7de19ac3d623b2a709977d3a6343fc91eda493","observation_id":"37a2c3dc-17c1-47f4-ac61-a21a0412bb15","resolution":{"observed_at":"2026-08-11T17:10:52.802974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.781560Z","title":null,"venue":null,"work_id":"4f3ed733-c210-4386-a735-b9cc62014091","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.156056Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:a23a24d518cdb45fc13d41cd1782cd49d6595282bdad5ac3adebd6355aa73ffa","observation_id":"86159046-675d-4300-944e-ae7f004f9195","resolution":{"observed_at":"2026-08-11T17:10:52.786731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.763138Z","title":null,"venue":null,"work_id":"21919682-b02e-40ed-b20e-a955dcdbdafa","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.160851Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:5c7b2a6791d2841511238d3815f1ce9bc353adb1656619b5b92821670b670952","observation_id":"4b89d5ee-6326-4aa5-ad58-fce3b1848ceb","resolution":{"observed_at":"2026-08-11T17:10:52.767594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.749092Z","title":null,"venue":null,"work_id":"5baf11fa-aee2-4b01-a511-f02c27955b74","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.167400Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:5629b9ea803b6f51c7b15b6293afc8f5930f2e3cf5ca3a3d5f2a6336f551414d","observation_id":"09805f3b-88cf-4c9d-ad31-12813f0b514a","resolution":{"observed_at":"2026-08-11T17:10:52.753427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.733756Z","title":null,"venue":null,"work_id":"c19a669c-b903-4cd0-8dde-9eb959dab707","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.172740Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:ecad88e10db603ff98276d1057708adbbd5a84a95ff352b50e7dc8e24d30b30a","observation_id":"68c54bb7-34e2-47d1-9e7b-eb28801a1685","resolution":{"observed_at":"2026-08-11T17:10:52.738613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.719452Z","title":null,"venue":null,"work_id":"e0a69e71-4f05-4b2e-a446-8abb9742f470","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.177978Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:38160884d3be95227740b5032bd7d338e1e69e41a96375014da7b7d69734f813","observation_id":"2733460a-5410-4e53-a018-d61641052d41","resolution":{"observed_at":"2026-08-11T17:10:52.723950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.705531Z","title":null,"venue":null,"work_id":"d3ed3df3-35f6-40d5-a0a9-1d6026eb1ed6","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.183120Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:a41ab9c68ee247e14f1a821d5e8ca03f906abdaa43260b1f8e0e5490e45058e8","observation_id":"97ad5e53-6765-42f1-98b7-882556d71f13","resolution":{"observed_at":"2026-08-11T17:10:52.709918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.690659Z","title":"Global Description","venue":null,"work_id":"80878ff8-9839-4c2c-8778-4bcf1cdcf66a","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.188382Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:3d648def39d8c19bbb7c57fb6276d9eb953757689cc76b3f09de1f0165730064","observation_id":"ea38dc8d-3864-4df4-9681-ab08e95dbe5e","resolution":{"observed_at":"2026-08-11T17:10:52.695354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.675443Z","title":"3) Ex- trinsic Hallucination: Evaluate whether the text introduces content that is not present in the video","venue":null,"work_id":"e5676e2b-6229-4a9f-b0c0-bb8b0bdd6f58","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.193343Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:30869e614e917bfe04170745132ba93703278acdaacd1bb74ecfe9a15809127f","observation_id":"6b3ff845-bbdb-4d94-a251-0079f1e3e7a1","resolution":{"observed_at":"2026-08-11T17:10:52.680131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.660704Z","title":"counter-intuitive","venue":null,"work_id":"e486b5e7-c76d-4709-be58-2401788bc21a","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.198272Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:f146deff414f4efd28b7938c3854d35cc59fea885feba287f193697315a3e77f","observation_id":"c46daef7-2472-4254-905a-553e26f6af1c","resolution":{"observed_at":"2026-08-11T17:10:52.665365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.643317Z","title":",\".join([f","venue":null,"work_id":"3e4d6d3a-f93b-43db-8d0d-eb2549066040","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.202993Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:259a0e6fe40121a90f769885d8f71fcb95ad5d81a5f31f48a634adf8c9762d65","observation_id":"02fd437d-b1f0-4537-bef6-fd4705d237b6","resolution":{"observed_at":"2026-08-11T17:10:52.648749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.626716Z","title":"subject\" +","venue":null,"work_id":"68a4530c-eb3b-41da-af2e-87b391f8adc4","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.208917Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:1b03667f3f6c4a55ff85a6d01a72f2273219bda96d42a16b29be85729426074d","observation_id":"f2da4476-454b-4771-bfa6-fb07cec18eee","resolution":{"observed_at":"2026-08-11T17:10:52.631507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.609678Z","title":"The video shows","venue":null,"work_id":"c4081cb5-e93e-406c-8d01-48a8c37102c3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.213643Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:936363972e212bdcb012191a39d551e107edf104fd194259a563566044c6505f","observation_id":"90cdd62c-75c5-439f-9dd4-c3f4f6cc0e8f","resolution":{"observed_at":"2026-08-11T17:10:52.614918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.592351Z","title":"A man... and a woman..., and a man","venue":null,"work_id":"841692bd-54a2-4529-843b-c7148081ab57","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.218481Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:6038baf76ba84103bab177f4fa8138d291ad28bf252609413cf388f0bcf5706e","observation_id":"b486091b-22ac-4c79-92e5-72752dcde0a6","resolution":{"observed_at":"2026-08-11T17:10:52.596761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.576255Z","title":"The scene is","venue":null,"work_id":"18068ad7-a85a-4cda-940f-6b07d5235686","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.223004Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:466b481c50241ac36b2cd11d0d3258d4b8be020fe49a1066dd666300fbc87f9d","observation_id":"e2d51b3a-c5fb-4e9b-ba52-394fe430e6eb","resolution":{"observed_at":"2026-08-11T17:10:52.581473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.557162Z","title":"Aligning prompt used during alignment with the open source model","venue":null,"work_id":"8d66a2c8-594c-4a19-a030-24a079a0f1a6","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.228795Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:93f3eac45da8cc9ba8e3933bf93986829c81f496d9e3ef598188059a605a7f26","observation_id":"a1f40f2a-eb5d-465d-ae52-8fc043bcb8c4","resolution":{"observed_at":"2026-08-11T17:10:52.564812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:24:51.060256Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2412.09283."}