{"as_of":"2026-08-07T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8b6cabbec890598b5a13e9a667e8e2167d5be5c9a8203e6dfe14c3f93cc1c1e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:28:18.217598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:37:20.227358Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T21:28:18.217598Z","title":"Videotetris: Towards compositional text-to- video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-06T21:19:53.808461Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:28:18.217598Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.00162"},"observation_digest":"sha256:2bc5717c7729e72662d2f17174893be9e28245d3e2b028efbd6d8fbbbde02d24","observation_id":"4355f95f-23e8-4deb-8a1e-ed8ee5ed3192","resolution":{"observed_at":"2026-08-06T21:28:18.217598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T20:43:55.726610Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.726610Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:abf613fca40f31acfd749748b29da8e9aa8d72cc6f868e38c1b83d28f3f5f34b","observation_id":"60b811d9-46b6-4faf-b471-aa4e413b4c5b","resolution":{"observed_at":"2026-08-06T20:43:55.726610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T15:28:30.276884Z","title":"Videotetris: To- wards compositional text-to-video generation.arXiv preprint arXiv:2406.04277, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-06T15:22:40.448592Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.276884Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:ef0bbb6ef5e0ae3c8e96088d3af333c9adf9228c880e14c5212b9507fb31d427","observation_id":"adf452e4-f75a-47c8-acc9-3d2f8b7465db","resolution":{"observed_at":"2026-08-06T15:28:30.276884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2406.04277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T14:37:20.227358Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","venue":"cs.CV","work_id":"c87180ae-68de-40ad-9f1e-ba53951ce55b","year":2024},"citing_paper":{"arxiv_id":"2507.18634","last_updated":"2025-07-24T17:59:56Z","snapshot_observed_at":"2026-08-06T14:37:18.436315Z","submitted_at":"2025-07-24T17:59:56Z","title":"Captain Cinema: Towards Short Movie Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:37:19.543006Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.18634"},"observation_digest":"sha256:e224d4465424d4d7a27c4967a713bc9c4957878ef4484a624667c6e02c07cc74","observation_id":"1077ed0b-a8be-4314-b30e-be646de116ec","resolution":{"observed_at":"2026-08-06T14:37:20.241925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.04277/citation-record","integrity":"/paper/2406.04277/integrity","json":"/paper/2406.04277/citation-record.json","paper":"/paper/2406.04277"},"outbound":[],"paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2406.04277."}