{"as_of":"2026-08-13T00:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44d0f795f0e8bdc02e80075a1f6df45f995d29ac1d7e5de846cfff663ae2243f","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:41:46.943342Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07647/citation-record","integrity":"/paper/2501.07647/integrity","json":"/paper/2501.07647/citation-record.json","paper":"/paper/2501.07647"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T20:41:46.661593Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.661593Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:1dd3241a0d2fb2945d6543ac8f7ce442dc6429c1de9fd92aa2d2d9f55381d308","observation_id":"4b6e5f49-3636-464c-85e6-6c87130acc2b","resolution":{"observed_at":"2026-08-10T20:41:46.661593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.935876Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"ef6da9f6-fe91-46f0-a27e-e1be048fff3d","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.668067Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:03ba65c8d31f192cc33466f11c5ff29895d557c7d7f14b86800f4e9f1484de30","observation_id":"98b22be7-b64b-49b6-bb56-d74b7c0df6e8","resolution":{"observed_at":"2026-08-10T20:41:47.940970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-10T20:17:19.785772Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-10T20:41:46.673882Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.673882Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:d26ed6df45849cd96c68cf1e125633e7f89dda193e2fc69e6871bf4e22f8e62e","observation_id":"631277c9-2b1b-4913-9743-51ef281ec728","resolution":{"observed_at":"2026-08-10T20:41:46.673882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.918012Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"1f87a111-7583-4741-9b18-0c7c7aba45cc","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.679977Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:b55c572f17a426bb5be7ad1456c5df992c0891736f6e3303d21110fedd6d8d07","observation_id":"982eb44b-35c5-4c2f-bacf-68319494733f","resolution":{"observed_at":"2026-08-10T20:41:47.924160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.685336Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.685336Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:0dc4de42eb724e68465cd09441d0b3af22b3d797bb32fee5a9411474fd47d249","observation_id":"1c833fd9-240e-4cdc-b39b-776bf5163bc5","resolution":{"observed_at":"2026-08-10T20:41:46.685336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.889091Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"97503374-d274-4277-b699-f23862abab79","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.690463Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7596c8f4f87555030f0b92010cb26a825e29e79219b5b606fd949771716378c4","observation_id":"3db8ca74-d25a-4698-b9b4-01745dd7cbac","resolution":{"observed_at":"2026-08-10T20:41:47.894451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.695844Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.695844Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:c8d51bfbacb41940173a097e3d9ab3e202696d6187fe36496bded98741f02945","observation_id":"62167b68-ea64-405b-95cd-b3d5386b4fcd","resolution":{"observed_at":"2026-08-10T20:41:46.695844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-10T20:41:46.702000Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.702000Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:d7afa56df5b559cf9c989007b0d527c1ff0b5b2ea65a694fbe18c1df8d935b27","observation_id":"491fb305-9892-4bae-a1d2-045effcab649","resolution":{"observed_at":"2026-08-10T20:41:46.702000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.859771Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"556745cb-1a57-4e00-8618-bef39a7b7d22","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.707689Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a3cfcf625557d164cc4d68e3c5449d3e5aedd785fab4ef4c58ffcbc59a7f83fd","observation_id":"aef14e19-ec4e-4cf6-a00e-429c19d20942","resolution":{"observed_at":"2026-08-10T20:41:47.865422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.841191Z","title":"On the content bias in fr ´echet video distance","venue":null,"work_id":"7233d1c2-d05b-43b4-9078-1dd8700ece79","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.712470Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:b31a8925aea54f6c47f3fa2af7056de096af50f0092e19adc380bacf02149983","observation_id":"6f1c1714-89cf-4df0-a3f1-5849036a0d2a","resolution":{"observed_at":"2026-08-10T20:41:47.847242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-10T20:41:46.717039Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.717039Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7ead31fe9c21d038958f974156c41dd934d8b55a8d7ccc7f54b79fd8830dd95c","observation_id":"6e6a0b24-f824-4afb-b223-96d9176a029d","resolution":{"observed_at":"2026-08-10T20:41:46.717039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.722487Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.722487Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:aa29b7938d7779e6dbe87566bd913196544a90af2f79fd7ecf482845a041d732","observation_id":"f14832ef-e18d-4d32-a077-8c94087197b6","resolution":{"observed_at":"2026-08-10T20:41:46.722487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.812574Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":"b9c05fa3-98f4-4255-b136-9c43ce52d649","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.727435Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:e281d0e89a73552d3f6d47173466d121a1b0185978b03b27be3549e8c341cd89","observation_id":"a509f378-ab9a-4a66-b701-430e417f8341","resolution":{"observed_at":"2026-08-10T20:41:47.818003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-10T20:41:46.732481Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.732481Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7b20c1217657457d2b7a994807deeb0fd602245facb25b70f5599ddeaa64f053","observation_id":"b512f7f3-1b04-4d41-99d7-6e620314bd92","resolution":{"observed_at":"2026-08-10T20:41:46.732481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.796483Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"f592625d-a56a-49b1-94f1-610a03313755","year":2019},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.737703Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:aa594c7b3b3121aee3c2dc50b56ae1bfba6bc72828e8c5b871fc38f2175c4e2b","observation_id":"c315cf22-2268-4589-8112-96615752f09f","resolution":{"observed_at":"2026-08-10T20:41:47.801856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.779751Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"a5eb679c-f0dd-401b-857b-daa30ca62283","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.743338Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:50f441169a30270d8be64bb93c42b36146193e0d39523161e28db980544f3f0f","observation_id":"0ea4ed25-7e74-4691-ac5a-8e870a1ef29e","resolution":{"observed_at":"2026-08-10T20:41:47.785045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.763260Z","title":"Dense optical tracking: Connecting the dots","venue":null,"work_id":"f5e2d758-11c2-4f5e-9bee-2386dd87fc55","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.748409Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:ce4ae78a14c9a562b6bfb503066cc24503229540ee8beb263295db14bfa0cdee","observation_id":"f326661a-2d8c-4cec-935a-a19fc11da731","resolution":{"observed_at":"2026-08-10T20:41:47.768539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-12T23:55:32.837720Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-10T20:41:46.753046Z","title":"T2v- turbo: Breaking the quality bottleneck of video consis- tency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.753046Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:ffa76b1b6cbcc8e93b8cd289c38a3e7f6cbe81a02e16931a945766f9516a5c4d","observation_id":"4f48b987-b94a-4382-80d7-4a9ce3047b56","resolution":{"observed_at":"2026-08-10T20:41:46.753046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00651","last_updated":"2024-03-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:55:41.420301Z","submitted_at":"2023-12-01T15:24:38Z","title":"TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00651","snapshot_observed_at":"2026-08-10T20:41:46.757694Z","title":"Trackd- iffusion: Multi-object tracking data generation via diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.757694Z"},"links":{"cited_paper":"/paper/2312.00651","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:dae04c165005a47cf6255293fe4bdf105b96ee129f564513b416d49d55479eb9","observation_id":"28659284-8aa8-4c06-ab70-20953d6fe2ce","resolution":{"observed_at":"2026-08-10T20:41:46.757694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.746462Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"067c72d9-8fed-40f9-a2a1-e6d9cf411168","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.763002Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:0bc85f3128ab94087acb7f2c133b98aedf39fb3ce0574d1684b9b735dd103d33","observation_id":"2205b1eb-5f02-41b9-bafa-78dd3044cfba","resolution":{"observed_at":"2026-08-10T20:41:47.751990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.730571Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"71544636-3f7c-4a80-a062-c137ec64fcea","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.767551Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:c93a6a430ccda5c4dd14df5ac191f66400cb1ce14ae332ebc92ea5b97d55cf71","observation_id":"63ba12ee-8134-4f6c-821f-c4423f069a4f","resolution":{"observed_at":"2026-08-10T20:41:47.735277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.712184Z","title":"Llm-grounded video diffusion models","venue":null,"work_id":"fc9829df-2394-445b-89c4-b3bf418adb55","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.772368Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:4bb4b79f163c476f716a6ecb73500e82e2ddafa7d4d1a1ca34a9d69493ad92c4","observation_id":"98d54c78-f21b-462e-af0b-3d79843d08ec","resolution":{"observed_at":"2026-08-10T20:41:47.718723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-08T15:18:23.500459Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-08-10T20:41:46.777075Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.777075Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:8200b5f39f46697e06d286a5445aec57afe385718932048d0fb067abf703971b","observation_id":"79d97a22-8d0e-4683-a42c-1cbf14c23562","resolution":{"observed_at":"2026-08-10T20:41:46.777075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05338","last_updated":"2024-10-22T04:22:16Z","snapshot_observed_at":"2026-08-12T23:47:28.499464Z","submitted_at":"2024-06-08T03:44:25Z","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05338","snapshot_observed_at":"2026-08-10T20:41:46.782104Z","title":"Motionclone: Training-free motion cloning for controllable video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.782104Z"},"links":{"cited_paper":"/paper/2406.05338","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:d98c3beff3b9ac1e809b79734ace4e4c0186514edfcfc2ec5674e30f3d5168f2","observation_id":"1ca446ca-1ebd-4616-90ab-485c5903ad16","resolution":{"observed_at":"2026-08-10T20:41:46.782104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.692544Z","title":"9 Blobgen-3d: Compositional 3d-consistent freeview image generation with 3d blobs","venue":null,"work_id":"e4033475-317d-4a65-94eb-61f1daf89c97","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.786747Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:5b3a024668dffd16eb147fa67a8b0b77560c5f843b35ed42d024528d935b37ae","observation_id":"9cd566d9-8960-433c-84e1-b57251091fef","resolution":{"observed_at":"2026-08-10T20:41:47.698845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.674745Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"1e9bfbec-fd6b-4a7f-b615-8fbc28a5ef7c","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.791106Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:0dd19b489caac9413b02beeada829ffe5cbf97733c8766e8dbd8bb5562391edd","observation_id":"e8486c0f-a363-4208-a11c-460b454bed70","resolution":{"observed_at":"2026-08-10T20:41:47.679691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T20:41:46.795590Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.795590Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:71dbd0ab6f5690cc94f45f65a4b7f11bdab8a17f9034f14d29bac2c96f7a9e5a","observation_id":"0e5f15a6-bbf0-4b47-9d48-ff02b26a31f0","resolution":{"observed_at":"2026-08-10T20:41:46.795590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.657652Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":"7bdc2576-3f51-4676-a277-681667ce28e8","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.801884Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:600cf742b11ca12c1cf1be811e30961260c4ed88da00a76df3ff92d1b26500ce","observation_id":"725a678a-e2aa-42c1-bcc8-e348297e1adb","resolution":{"observed_at":"2026-08-10T20:41:47.662749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.640516Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation","venue":null,"work_id":"ce8fff09-b5ec-4045-8e16-1826d1c6dbe9","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.807182Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7f753030950433672114594d48d0b83f551b5a237ecdf9a1985d657638f8821b","observation_id":"935fbd6d-8b40-454a-9c1a-3a63c044764a","resolution":{"observed_at":"2026-08-10T20:41:47.646108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-10T20:41:46.812519Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.812519Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:b4e21e1d004e9b8aac547fcf2db08ac362bc47f12929c915926b983db5205f6b","observation_id":"60011944-a7c1-480e-9db9-e76d8c7bf9bd","resolution":{"observed_at":"2026-08-10T20:41:46.812519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.623143Z","title":"Compositional text-to-image gen- eration with dense blob representations","venue":null,"work_id":"0c80b80b-d157-4964-bfa8-44208db75d46","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.817879Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:cef1c0d0081a67bf2ea0c0215b6af375eabc1db1ca7f70a07f751919311d50b0","observation_id":"05fafea7-0cf5-4277-9f27-4771e99299a0","resolution":{"observed_at":"2026-08-10T20:41:47.628927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.822782Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.822782Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:85accf3ca6ced9849aa0922f35313d5f44d1285c6f2c26bbac6882f7db2b3cd7","observation_id":"2d717236-49e6-4c5e-ba08-857d2cbaa3eb","resolution":{"observed_at":"2026-08-10T20:41:46.822782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T20:41:46.827788Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.827788Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:60907a2aaa4a5eda1b09d49d10e15fdb3ca6ca49ba7f5bd6c2bb18b099d62e95","observation_id":"13761c41-a74a-434e-8e8f-72247be31bd4","resolution":{"observed_at":"2026-08-10T20:41:46.827788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.833115Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.833115Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:8915c692b0f9f603cd6511f123713502cbd2e89eebe8628146c13edfd918866e","observation_id":"6873bc93-5efe-403c-87a4-62149957d438","resolution":{"observed_at":"2026-08-10T20:41:46.833115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-12T23:18:27.584752Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-10T20:41:46.838351Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.838351Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:1720c8a2d209b98d81fd1318b901ee44f5d08fa60b2c80f24c336cc98c92c618","observation_id":"62089b14-6a46-4765-b1c9-f1f6b602a0d2","resolution":{"observed_at":"2026-08-10T20:41:46.838351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-12T23:08:17.593858Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-10T20:41:46.844463Z","title":"Vidgen-1m: A large-scale dataset for text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.844463Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:e52bb2fa24cd42b633457dd4bb3ebb2d5c415d2a61a55902ac4f54c26d1beb6c","observation_id":"5aa572ee-3d91-417c-9f34-4d0026793aa7","resolution":{"observed_at":"2026-08-10T20:41:46.844463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.850622Z","title":"Fourier features let networks learn high frequency functions in low dimen- sional domains","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.850622Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:2b7d2859e31ecdccfd67d240f817e5e401d94708e61d10b348b73642ee697dcb","observation_id":"14c488e3-40ff-4233-a5a9-a8794e84021b","resolution":{"observed_at":"2026-08-10T20:41:46.850622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-08-12T23:48:33.386651Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-10T20:41:46.855840Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.855840Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:66442c5e847a43006440b967baac055673ecb000fdbc344f211455fb3d3624f5","observation_id":"ac317e7e-1472-4e97-b502-6692c27daa47","resolution":{"observed_at":"2026-08-10T20:41:46.855840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T20:41:46.861690Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.861690Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:6ffb2337e39ab7270734599b30b0b5f97e697a2bfa198bebd9ec4950872f37db","observation_id":"6fa053de-4929-4f99-af7b-6c46cfe7c4d7","resolution":{"observed_at":"2026-08-10T20:41:46.861690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.573192Z","title":"Score-based generative modeling in latent space","venue":null,"work_id":"02e069c0-aca2-4e6b-9bb7-737c5a6af0f6","year":2021},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.867718Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:781ddd1d5f1c3965f8a7a010680004a06c6d111e62e3cd63a10a85000ed89403","observation_id":"42f5a13b-4a3e-41a6-840e-c7eb99a4043d","resolution":{"observed_at":"2026-08-10T20:41:47.578327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-10T20:41:46.872600Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.872600Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:f5dc02d3b7911651c0ee1dd61c3a234034e80b5daff3c44c5ebefa18a8be1a62","observation_id":"8e568363-7a99-4ff4-88c9-4ab15332b295","resolution":{"observed_at":"2026-08-10T20:41:46.872600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.556967Z","title":"Boximator: Gener- ating rich and controllable motions for video synthesis","venue":null,"work_id":"29ae649a-5ae7-45b1-84a2-441d0991f212","year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.877786Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:6cc545889f8d9eaf392366a19606b3a91399db024270da3e82c41c281778e167","observation_id":"c1ce706c-3b10-4e44-bc29-965b62ff289c","resolution":{"observed_at":"2026-08-10T20:41:47.562145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-10T20:41:46.883364Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.883364Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:bf2773a3680c3190bcc60e294e3dbd3bf0bf8231d915fb347df22c333a7c6e7f","observation_id":"237149c0-cfe4-4a60-b919-c6db8fe2eca8","resolution":{"observed_at":"2026-08-10T20:41:46.883364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.888799Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.888799Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:14c164f7bb197e78b95f46287cbe62e4711c12c7f41f276154cf43cc96321571","observation_id":"f9b1cfec-798c-4e18-b41d-b42376453dfd","resolution":{"observed_at":"2026-08-10T20:41:46.888799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.530938Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"b33da2dd-7bfa-487c-822a-3bec614fd804","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.893683Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:e81313ab946a4ecf7861ea9fb4ed0a83494e7d9080cfa3f2dceff6ace92fcf2e","observation_id":"a6d7aa9d-038b-4415-9fa3-c9886b3c3a7f","resolution":{"observed_at":"2026-08-10T20:41:47.535970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.514316Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"94c69be7-5fa8-4041-990f-40d27e1039e1","year":2022},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.898852Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:da644e2be659594c97bf8a59e886aa9c1a82435a25f21a3e2fb7381b98c78946","observation_id":"29c53d94-d326-43b2-bc10-7c6520361e72","resolution":{"observed_at":"2026-08-10T20:41:47.519590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.497783Z","title":"The 3rd large-scale video object segmentation challenge - video in- stance segmentation track, 2021","venue":null,"work_id":"c281d6f3-7b00-409e-a35f-6bd2d0096537","year":2021},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.903448Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:8aae07258c48bb33bc328c1d30bfcc987f51cd9ad9b3ac7b57fbcba12d2524a9","observation_id":"ff31b245-ad15-466e-ac4c-245d8d1ddc02","resolution":{"observed_at":"2026-08-10T20:41:47.503207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06182","last_updated":"2024-06-10T16:27:47Z","snapshot_observed_at":"2026-08-12T23:46:18.242813Z","submitted_at":"2024-06-10T16:27:47Z","title":"Compositional Video Generation as Flow Equalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06182","snapshot_observed_at":"2026-08-10T20:41:46.907745Z","title":"Compositional video generation as flow equalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.907745Z"},"links":{"cited_paper":"/paper/2407.06182","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:bdfbc1ed7fc5a5d098d1654a0955600549076504f87b5f0e6afb3db63c227d33","observation_id":"1c8caf67-ceb5-4d66-87b9-2a5e3a4fed17","resolution":{"observed_at":"2026-08-10T20:41:46.907745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T20:41:46.912771Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.912771Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:50a4edc01be3c34f4eea5ed9e3d9acc56e0c8fe8903cccb40c9d727bc857f735","observation_id":"b362f654-ab1f-418b-a79a-7247e9727bb1","resolution":{"observed_at":"2026-08-10T20:41:46.912771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.480885Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":"5df2ae6b-4c9c-4d10-b879-cfbfc65cf7e8","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.917408Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:9e4ca6eba33a6a9ff73b9425b37a59510a0923f8bcb8e6438b30b785344cb999","observation_id":"d215340d-085f-45be-b3e4-e7d42fc77633","resolution":{"observed_at":"2026-08-10T20:41:47.486813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:46.921729Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.921729Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:a083d20091c5a3da9df540b1bed63f8a22f490f0bff56bf22e8e59bd46542340","observation_id":"6ae457b4-859d-4308-aebf-f18053923296","resolution":{"observed_at":"2026-08-10T20:41:46.921729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.453628Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"a275a16a-ef74-4946-95db-568db715de09","year":2023},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.926761Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:084f2cbb207e966863d8f1e2878accfe79cf59e4a1952bea26174f083483447d","observation_id":"127e9784-ed54-430e-b1b0-ff3e5fc55929","resolution":{"observed_at":"2026-08-10T20:41:47.458369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.436210Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"d888c2a9-52ff-458a-bcb2-e2264027c1fd","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.931591Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:7628e8dde48dbd205c21f3f4ff9ef0026f2c2bdd4a298e589b79c326ff9b8f16","observation_id":"51f1e579-ef71-4ae9-9ec9-8cbd61e9839d","resolution":{"observed_at":"2026-08-10T20:41:47.442037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1610.94662","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.052852Z","title":"both foreground and background","venue":null,"work_id":"1e33990c-c8ef-46ee-b188-715b1c063ff8","year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.937177Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:2081b6a2530dddfc29b91cab1eca0afeb20b6acab91d17443b8a313d64703fcb","observation_id":"5c3d4a12-2050-450f-81be-34389c94427f","resolution":{"observed_at":"2026-08-10T20:41:47.062580Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:41:47.418597Z","title":"Frame0”: “Object2","venue":null,"work_id":"51cbac69-a686-4146-9450-1a2cd54bb6e4","year":null},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.943342Z"},"links":{"citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:3cea0cddc4ae7cf0f28e617f32c1c00fd6420f530474b6b18435985495d7cba5","observation_id":"87f0d80a-6b97-42d8-b5aa-e73017baeb4f","resolution":{"observed_at":"2026-08-10T20:41:47.424318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2501.07647."}