{"as_of":"2026-08-07T13:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e43b708e37d7414ddf1bfef2bec28f5ab663dd71435e8ffecd0713143a820412","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:16:44.217929Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20855/citation-record","integrity":"/paper/2507.20855/integrity","json":"/paper/2507.20855/citation-record.json","paper":"/paper/2507.20855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.806071Z","title":"Slamp: Stochastic latent appearance and motion pre- diction","venue":null,"work_id":"01634a1e-b64f-4614-908c-b1df276e333e","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.664655Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:1c0d6fa06bb5056be9e4fea2112bedfa8322df9b486e345c01c698abbf9f6a32","observation_id":"4a53892a-e5ca-4463-a595-7d52443aef09","resolution":{"observed_at":"2026-08-06T13:16:44.808932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.797912Z","title":"Stretchbev: Stretching future instance prediction spatially and temporally","venue":null,"work_id":"d893bed3-2a8c-4e12-baea-bd0ce1aef4a3","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.726015Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c963b1a127e039d089a0cd6f37b1ac546da0e645689cd13367f6b77eebd8f7a5","observation_id":"eb8ca687-a7ee-4de6-87da-0115022032ca","resolution":{"observed_at":"2026-08-06T13:16:44.800561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.789344Z","title":"Slot-guided adaptation of pre-trained diffusion models for object-centric learning and compositional generation","venue":null,"work_id":"40254d3f-fdfc-43e4-a266-22b17ab7e31e","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.800382Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b6ae234208da305f3170a8638fb295ad59f8b165efd7e3069afc7fa883c18b78","observation_id":"1d62f899-9ec3-4a13-b283-b9a7c11f328d","resolution":{"observed_at":"2026-08-06T13:16:44.792481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.781347Z","title":"Self- supervised Object-centric Learning for Videos","venue":null,"work_id":"24169ac2-1481-4cc2-ad3b-81a4def98784","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.882950Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:28f7e4e74d3057ea12393951b7a34b7fdc2603165ab3331a3ebc10e15465212b","observation_id":"b98a97f7-cbe1-49a6-a34e-55b60c85acfd","resolution":{"observed_at":"2026-08-06T13:16:44.784142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.773208Z","title":"Systematic generalization: What is required and can it be learned? In Proc","venue":null,"work_id":"b8e26c91-a502-48bc-b7d3-a4065fdae064","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.996989Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:ce7115a6d9ee2493b1217e2223b1cbf1906050674a3de50717db6923b15879e6","observation_id":"fa7374ae-00d6-49ec-bd27-1016364b0d8b","resolution":{"observed_at":"2026-08-06T13:16:44.776126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.765361Z","title":"Object discovery from motion- guided tokens","venue":null,"work_id":"94fe037d-1f3c-4dea-a3e3-06708d00c7ed","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.070604Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:5349409661feeb9f5a2b7ef2f55b69d2593c50d4569c94f7569677aa29c1578e","observation_id":"95eb09a6-88ba-4d1d-b393-f1c94fef3206","resolution":{"observed_at":"2026-08-06T13:16:44.768077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:43.142294Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.142294Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:378bea0827555aabe1feff1aec63008080ec476134020fd3ffc4b21ccf953ee9","observation_id":"7533f941-d8d2-41d5-915f-96c2da1f9353","resolution":{"observed_at":"2026-08-06T13:16:43.142294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.752244Z","title":"Invariant slot attention: Object discovery with slot-centric reference frames","venue":null,"work_id":"bde7b805-f1ad-4c6b-815b-822086e9440f","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.213561Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:ea114c652cbbaeabe0a3526d32bf299df86a399be1a7031fcddc77eb289dd999","observation_id":"904ad9e4-e0ac-4776-8d6f-6d8f52199e08","resolution":{"observed_at":"2026-08-06T13:16:44.754950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.744914Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"3d946f46-20d8-4280-b21f-fbc7f723ba03","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.244544Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:12c8daa8f1a655899ecaf1880b7e951350b2089733e80e570f83c6f89a1c60a5","observation_id":"564176c5-8881-49e7-bf47-90de864fcdac","resolution":{"observed_at":"2026-08-06T13:16:44.747508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.737460Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"35b77abe-9dba-403d-8306-d4ee2ba0c037","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.317792Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b5cc7cbbf60db5c5a3fa2339bdad0c578c2308d55f43b34f74269637e50a0acf","observation_id":"7a2ab687-3873-4bdf-a200-01ed3cfdfe65","resolution":{"observed_at":"2026-08-06T13:16:44.740093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.729978Z","title":"Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis","venue":null,"work_id":"ece29162-aa19-41c4-8ded-7beea34907a7","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.429828Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:175e70dc186084e898884b60245a115a79f2fa40bec3b2d5e60b7220610ff4c8","observation_id":"707f5e7d-a837-45ad-96ec-57af4f0a52be","resolution":{"observed_at":"2026-08-06T13:16:44.732572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.722462Z","title":"Vision transformers need registers","venue":null,"work_id":"bba5b707-13af-4a0b-a67a-55bf85e2886e","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.547864Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:d378c2ee8881675401b6a5b0944909c659b53edd510d911407084c7ea5fd0c41","observation_id":"59be87bd-7ec8-4363-b3bc-ad85fe3548b2","resolution":{"observed_at":"2026-08-06T13:16:44.725128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.714971Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"25a52dcd-769c-4408-9ede-f45b219a6461","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.664202Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:257ee858dc54d64f52a53cd583c7cfe63bf0db2748eb9b8149f51eee42386353","observation_id":"9d9630db-6022-4695-9b67-8a9adce56d21","resolution":{"observed_at":"2026-08-06T13:16:44.717663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.707405Z","title":"Betrayed by attention: A simple yet ef- fective approach for self-supervised video object segmenta- tion","venue":null,"work_id":"6132e3ef-fccf-47d0-ada3-b0bd92d20319","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.782017Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:d4d5895311e68bd18806c08df5f4ee02569c5f678b348e939b739a3df2a233d5","observation_id":"8c2f57a6-5277-4fe7-93d7-3b620ce15ed6","resolution":{"observed_at":"2026-08-06T13:16:44.710132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.699692Z","title":"SAVi++: Towards end-to-end object-centric learning from real-world videos","venue":null,"work_id":"f7a580cd-7567-4873-96fc-79388c62a504","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.921894Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f76b51eba41b28376a483e0c4d18846ba73b791782e6d721c831e62b32ca11b3","observation_id":"74e803c0-7c62-43c1-b6b8-4245ad24607d","resolution":{"observed_at":"2026-08-06T13:16:44.702365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.691960Z","title":"Attend, infer, re- peat: Fast scene understanding with generative models","venue":null,"work_id":"634010cb-8182-46b2-a305-65710dc2e05e","year":2016},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.928307Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:df0641de30cc1eb02fc6b6ae0df4228a54b51d90d363613fc39eda343d410c25","observation_id":"5f54637c-c83b-4f9a-901e-cc3a1f26adbf","resolution":{"observed_at":"2026-08-06T13:16:44.694512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.684638Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"3751497c-76f2-4f5b-b58d-f094d4298fe3","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.034897Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:58d10f8f505df3392a6920f6969d8243378e8a78e60183815021aca101847d9e","observation_id":"29f9374a-5e7b-447c-a0ca-b79e2474428c","resolution":{"observed_at":"2026-08-06T13:16:44.687199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.677170Z","title":"The PASCAL visual object classes (VOC) challenge","venue":null,"work_id":"2e85f881-97f1-4073-83b1-e96fe5236b4e","year":2010},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.050887Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:6e93e4abeda66a05ca1213cce65189719f28586bccf97b711f6eb1f50131910e","observation_id":"e848e0dd-2fde-4e9c-9db3-7ee48f205314","resolution":{"observed_at":"2026-08-06T13:16:44.679727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.669481Z","title":"Connectionism and cognitive architecture: A critical analysis","venue":null,"work_id":"29a33b34-7130-416b-bb80-9cb097c1cf16","year":1988},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.057618Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:ae90ae1316b2da4910e6c6ddf7e362b69df44a16ba7478582f97fd0571748e6b","observation_id":"2c509ebe-7e2b-4dbc-ad6d-22c102cae5ff","resolution":{"observed_at":"2026-08-06T13:16:44.672196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.661778Z","title":"Understanding the diffi- culty of training deep feedforward neural networks","venue":null,"work_id":"75ca5a0f-a7d4-4e24-ada7-53a94ec07270","year":2010},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.085924Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8dd2bb75479c87d5538ebf078acc4120511ca1998bb5a95e9448b9b0e062af21","observation_id":"534e61bc-8442-41ee-9984-7d04bdbb1073","resolution":{"observed_at":"2026-08-06T13:16:44.664636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.654102Z","title":"Multi-object representation learning with iterative variational inference","venue":null,"work_id":"1ff389f1-57c2-4b79-8014-482e2ead95a0","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.088511Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e41b64576344a8168818b604a54f85324a5e2a75057c8fc90480790bc2c9dcd6","observation_id":"77e30ea2-d3d8-4895-a2cf-b9afd15ebbfc","resolution":{"observed_at":"2026-08-06T13:16:44.656961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05208","last_updated":"2020-12-09T18:02:49Z","snapshot_observed_at":"2026-08-07T12:34:15.648511Z","submitted_at":"2020-12-09T18:02:49Z","title":"On the Binding Problem in Artificial Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05208","snapshot_observed_at":"2026-08-06T13:16:44.091002Z","title":"On the binding problem in artificial neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.091002Z"},"links":{"cited_paper":"/paper/2012.05208","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:5f6e83adbaf4eeb82a37ab21dff1b6530c9af7cfb9550098d2702d780b72b548","observation_id":"58c9c3fa-53e4-411f-a45c-a0f2267e8589","resolution":{"observed_at":"2026-08-06T13:16:44.091002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.646224Z","title":"Gans trained by a two time-scale update rule converge to a local nash equi- librium","venue":null,"work_id":"0f330704-9d2a-4cb6-8974-e59ceec0c9f2","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.093688Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:01bed092e13f32484ca6d1607b06f540967360cf2ec75a01eb8443bf2cfe5f2a","observation_id":"1477d4d0-274e-45d9-b34f-952f1459db35","resolution":{"observed_at":"2026-08-06T13:16:44.648983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.638639Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"09598ce8-b464-4de3-8e20-d0b7f0a7f468","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.096080Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:fafa23b7f733170f94602bed608c22981ffb1bb686adb9764af9e1ba167b118a","observation_id":"7d369d06-fc9f-4b2d-a042-6b0553d869a1","resolution":{"observed_at":"2026-08-06T13:16:44.641276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-06T13:16:44.098463Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.098463Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:6ea87097302c9a4577e085093e9c006f7d39d5f3bb39c05622abf743ae23b419","observation_id":"8f00cd9d-d67b-4eee-9010-f96cbbebff78","resolution":{"observed_at":"2026-08-06T13:16:44.098463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.630554Z","title":"Video dif- fusion models","venue":null,"work_id":"fc3fdf23-20d7-417f-9b6c-0084f0c2a5b8","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.101111Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:6fde8bc2143bcae6eb3b19a9160bc9acaa765e6abc696f6c366cabfa3ec743d1","observation_id":"0b8f085c-cbb8-4239-b402-210cb3196108","resolution":{"observed_at":"2026-08-06T13:16:44.633260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.622834Z","title":"Object-centric slot diffusion","venue":null,"work_id":"b7cafb2f-dd71-4cef-ac47-91b75adfaa34","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.103608Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e364949ac69edf2f73b0fe2d4cd37aed9b33bf07e915ecfc12944e35014d7880","observation_id":"e8569ae3-5caf-4512-a0f6-1878af20ae95","resolution":{"observed_at":"2026-08-06T13:16:44.625355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.614585Z","title":"CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"66f0f2a4-6489-4914-9d72-922267cf8dfd","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.106047Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:6ca6bbbd72da6f90b57e4c646a922d2dd1cf2c763a905fd931f07999f04c290b","observation_id":"27f4d3f3-0c29-4eb7-b51f-4772803cad9c","resolution":{"observed_at":"2026-08-06T13:16:44.617467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.606278Z","title":"ClevrTex: A Texture-Rich Benchmark for Unsupervised Multi-Object Segmentation","venue":null,"work_id":"9711b9fc-011d-4c61-88d9-108a3520c5ed","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.108500Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7a865c247886b420ac6b202c65fdb303c78cd3d7b09c49f80c26b9541abbb2fa","observation_id":"77265028-906b-4e4e-aba8-e68f208e99f6","resolution":{"observed_at":"2026-08-06T13:16:44.609002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.597933Z","title":"Con- ditional object-centric learning from video","venue":null,"work_id":"c7baf76a-4e03-40cb-885b-074031c5167c","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.111133Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:71c6d2724aba0bcb8b28c360adf3db99fb2cd90c30a892582da61371211d047c","observation_id":"1ed7a1e7-71f1-4bc6-815d-02ac1b9c81a6","resolution":{"observed_at":"2026-08-06T13:16:44.600628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.589515Z","title":"Sequential attend, infer, repeat: Generative mod- elling of moving objects","venue":null,"work_id":"795c0ce6-cda2-4484-979b-066d562659de","year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.113684Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e7f49e9054b1cd3817e6f3407d64f8f7b7c849548a126f750192155551b555b4","observation_id":"30f913bd-9f30-4e1b-a0dc-deaa3d39e6d0","resolution":{"observed_at":"2026-08-06T13:16:44.592327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.581320Z","title":"Structured object-aware physics prediction for video modeling and planning","venue":null,"work_id":"5c847602-00ab-4b4b-a70b-ecb4ca30a0e1","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.116118Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:903f4c0507ad22f77e6f0861f4331cd9a198ff2c04d29048fec4264a9f01efb2","observation_id":"17a89202-5cc8-4743-b9af-57f04207f6ea","resolution":{"observed_at":"2026-08-06T13:16:44.584228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.572668Z","title":"Hierarchical compact clustering attention (coca) for unsupervised object-centric learning","venue":null,"work_id":"290e9c2f-7c6e-4175-afd3-578041b093fb","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.118397Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:be2c2ae553587d9d224b718ebc3d7ee7ab527e69562c0328fb42834d6d37eda3","observation_id":"e6fb7c66-938a-4e30-912d-14fc1de3b904","resolution":{"observed_at":"2026-08-06T13:16:44.575661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.120650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.120650Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:045942bc0f2ede16747f2425bc3dd622268b4b05a86f9c733f6baf9d4c6a49d2","observation_id":"5ddaa5c3-53a9-47ec-b5bc-1618ee2143fb","resolution":{"observed_at":"2026-08-06T13:16:44.120650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.559537Z","title":"Building machines that learn and think like people","venue":null,"work_id":"cb000d49-d853-44a2-aa8e-35172b047314","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.123075Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7c5b235defc4fe6c854b913ee534249e54cadeb3f01904f64e07dae85da10fcc","observation_id":"834353d7-8e1f-4680-a4b7-7da091f144c5","resolution":{"observed_at":"2026-08-06T13:16:44.562155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.552028Z","title":null,"venue":null,"work_id":"14c83c50-9bb4-493d-987f-a6c3b76738b5","year":2013},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.125394Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:949d7f11a5624f6595f1719d1ce4bde36ad1bc972d07ce96629ce2019c44b629","observation_id":"0d7f7806-0acb-42db-a5c5-f5a61b987d54","resolution":{"observed_at":"2026-08-06T13:16:44.554659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.544461Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"2068088a-21a4-4a75-a8fa-5fdf07793038","year":2014},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.127855Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:777aaa23beee8f95a98295b2ba09456261a00c57e3f5693fec48761d23b16b5b","observation_id":"eba8958f-3f05-401b-a4ab-d739601f684b","resolution":{"observed_at":"2026-08-06T13:16:44.547077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.536129Z","title":"Improving generative imagination in object-centric world models","venue":null,"work_id":"6bda5a2b-885d-4482-bdbc-eb8bd2025549","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.130351Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c2643bf6e8e53ef56fedf20e839a3f6636186354a01b5107d9316e9b20c0afaa","observation_id":"3545ae88-31fd-481a-8f73-0a4d3a4493e6","resolution":{"observed_at":"2026-08-06T13:16:44.539180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.528656Z","title":"Object- centric learning with slot attention","venue":null,"work_id":"731dc54b-0fb5-4929-b908-10ac3d60aaf5","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.132668Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e4478fc0244ca67d884f732c53dc8f7c5c9926dff66c595f63dd5776d707146c","observation_id":"0e3c82ae-6228-47e3-9f6e-e060c820ef0a","resolution":{"observed_at":"2026-08-06T13:16:44.531327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.520894Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"88ab2495-71aa-4327-99ea-c35665e01ebe","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.135327Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b8238e1c07b527ba12a8ac591d7ab9cf88c155ec0b4ffa0eecf5e05a0bd4cf2e","observation_id":"32da4fa8-bedc-423f-8fe7-39cb16b2ee4e","resolution":{"observed_at":"2026-08-06T13:16:44.523772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.512803Z","title":"Temporally consistent object-centric learning by contrasting slots","venue":null,"work_id":"ac90cc44-4d6a-4e46-830e-2df020574e04","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.138069Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:719c1fb1915e1b6f54d7f3989ff72cfc91747089f084947c070cae100d070839","observation_id":"5adc5170-5997-46c5-9570-514199a6fa17","resolution":{"observed_at":"2026-08-06T13:16:44.515469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.504556Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to- image diffusion models","venue":null,"work_id":"f3ea8cd6-d090-4cd9-9d3f-c38c4baae168","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.140512Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f5a0a23c44fb99c24be5c4237d4e062ab4e4f24bfc764c0ef9f9bb5262b902e8","observation_id":"2fc8e8f7-388a-47d0-a9ff-cdd64dffacbf","resolution":{"observed_at":"2026-08-06T13:16:44.507184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.497099Z","title":"Segmentation of moving objects by long term video analysis","venue":null,"work_id":"116c2647-c736-467a-a332-1ca5a2f4bcf3","year":2013},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.142834Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8e29cc20c7fa927fb6aa2ac124b7f20d2767a4fe17963b6b83d2d854ba8f5cf9","observation_id":"00dd651f-33cd-41ae-b79d-05ca2e1c01a3","resolution":{"observed_at":"2026-08-06T13:16:44.499643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.489203Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"604e95e6-5ad8-4294-8419-f107c0332018","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.145544Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:0e7baff7ec70d22c361645e884ef869babd10f97427f8ee5be8ef8b0bf68081b","observation_id":"7f7c8fda-9ce4-40af-8397-092a650ea45d","resolution":{"observed_at":"2026-08-06T13:16:44.491763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.481652Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"214a9a9a-8e62-4857-b3b6-1ff5a7feeb17","year":2016},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.148072Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:752ac7cd87dc42b7d9eca7b089e44d9063017b693fc3460eb09015bd5cc4e1b0","observation_id":"24f67be7-53c4-4945-9708-08e717ecb150","resolution":{"observed_at":"2026-08-06T13:16:44.484295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.473738Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"3ef60613-5149-4257-ae6d-a3b6806bb11d","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.150674Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:d6ef0fc2dda4316d94b944c39fc7977170edff80171c76f790502fb34ed506ee","observation_id":"a7e07070-f2f3-4527-867b-36a12b29eaf6","resolution":{"observed_at":"2026-08-06T13:16:44.476532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.466165Z","title":"Rethinking image-to-video adaptation: An object-centric perspective","venue":null,"work_id":"25cc5d88-a6bf-4ef3-91d5-240029f9e620","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.153056Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e6bd69770fad2248374c3bf2df66cb1438346a9f4a63801367633f595ccc6b64","observation_id":"19ade172-0b41-4ab7-91ad-6c6fd7a0acf7","resolution":{"observed_at":"2026-08-06T13:16:44.468916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.458572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"6ebbc4a7-fb77-417f-90f3-7bdee61fb79d","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.155324Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c6cdb51911bcad17a3756c99983eba17c2664b0605daedd936a42ff7623a475d","observation_id":"701887ea-ba26-49eb-8e74-852cdb8f9523","resolution":{"observed_at":"2026-08-06T13:16:44.461242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T13:16:44.157831Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.157831Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7700e97a30a28ed312c139984a53c76f591527b344ca41361cb7938fe63d3064","observation_id":"9b7f2095-64c9-4937-bfd2-2b70c1e364d3","resolution":{"observed_at":"2026-08-06T13:16:44.157831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.450643Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"4950fd78-35e4-48a8-b1bb-3b602589d34a","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.160495Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:968ed602a7dafd40b90e8b51f3af2800a1059deca6159954cd8c6d43a1f41842","observation_id":"21d5838a-89ce-4f63-b000-97a33195b8a6","resolution":{"observed_at":"2026-08-06T13:16:44.453298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.442239Z","title":"Photorealistic text-to-image JOURNAL OF LATEX CLASS FILES, VOL","venue":null,"work_id":"07407a22-5eb8-4000-8afa-936faf5b59a5","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.162837Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:9da86460b9c4d47c3386181885ca724af8e90850a4a69ba3c12b265e7abf100e","observation_id":"73df8951-2164-4f06-ac6b-f976ac6425ea","resolution":{"observed_at":"2026-08-06T13:16:44.444819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.434968Z","title":"Toward causal representation learning","venue":null,"work_id":"19b6cc69-026e-44b1-9ce2-862ddf61e928","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.165116Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8b2ee90da97024de1f681896569ba46739899abcec2937bd425d9f41adfa8c01","observation_id":"c56b3bf3-90b6-4d05-b79c-9b3d626a4569","resolution":{"observed_at":"2026-08-06T13:16:44.437460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.427204Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":"af179aed-2f99-4495-b895-bcf1a7748883","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.167520Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:384b7e3777dd78ac004768d6ea693793177d29e83f4bbdd5a238bb8197432a33","observation_id":"79c76354-ae9d-4e40-8cb6-4c0501799db6","resolution":{"observed_at":"2026-08-06T13:16:44.430034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.418979Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"27f0142c-6031-435d-9342-9ec6d638e99f","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.169814Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:cf5a48e00a546b66a6dfc3b95340ba96ffe3e85af21ce37be4510434aa516ba6","observation_id":"3ab10f8a-824f-47d9-91f1-a7c1d2ab0205","resolution":{"observed_at":"2026-08-06T13:16:44.422188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.411363Z","title":"Illiterate dall- e learns to compose","venue":null,"work_id":"3cf7e472-194a-4577-aa9c-f3595d5d7a4b","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.172171Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:1bd725295f2c0bf4c54b52cd5b079520ab8b62c3bde2f40ce898eccdf416c47c","observation_id":"8a7ca348-9b49-46d5-8aa7-70c0098f49b6","resolution":{"observed_at":"2026-08-06T13:16:44.414080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.403416Z","title":"Simple unsu- pervised object-centric learning for complex and natural- istic videos","venue":null,"work_id":"4e6331e2-a1c9-479b-843d-82874d4f6fa1","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.175236Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:dcea45eefc8be7c4dd03b96a11dc857c0f96c9eaf18dcadcd4a1e804711b2877","observation_id":"9d97a6e9-7422-43a5-8a2c-5a424caf13f7","resolution":{"observed_at":"2026-08-06T13:16:44.406073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.395803Z","title":"Guided latent slot diffusion for object-centric learning","venue":null,"work_id":"7ccaddea-7124-4c62-8545-5b7e407e6b37","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.177916Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:2d93d8cd8ecd50f921c4b58eaeb6f7a6cf569d429d18487940a0177acf3f420c","observation_id":"425ccc73-ca74-4252-bcb6-d1e1c1ad69e4","resolution":{"observed_at":"2026-08-06T13:16:44.398611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.387436Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"de01a5c1-8173-4594-8854-5906fd86fc28","year":2015},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.180311Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:cec4edd103c4150f9f91a77d07a7de414cd204b4e6e8968216fe738d2d597919","observation_id":"7ac35c2b-f2d0-487e-bede-3d8421ad2798","resolution":{"observed_at":"2026-08-06T13:16:44.390287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.379814Z","title":"Core knowl- edge","venue":null,"work_id":"20f488dd-391e-4c98-b5dc-c6b28532f9b3","year":2007},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.182654Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:471538b89eecf51eae956e3ac82b7e7176157e0430285c75f98c00f38d9d36e9","observation_id":"bd9ce06d-2791-4be4-8d9d-68151011e5e9","resolution":{"observed_at":"2026-08-06T13:16:44.382246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.372496Z","title":"Mind games: Game engines as an architecture for intuitive physics","venue":null,"work_id":"d9158e73-69e3-43b8-8ce2-e806d3e6fe27","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.185445Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8f13579ea6cd9a2d9e73003b9c1410e5fc86d504aa291b34ca90d1129659f812","observation_id":"b0fbe04d-6cdf-42a2-a350-706fcfb4e2c0","resolution":{"observed_at":"2026-08-06T13:16:44.375066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T13:16:44.188237Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.188237Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:1f4758af2f1faa28a730d27ef7309b745863adc80d19143ec578e6d836f6f23d","observation_id":"af1b4f84-5a23-4632-aedb-2b80edaab6a8","resolution":{"observed_at":"2026-08-06T13:16:44.188237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.365150Z","title":"Attention is all you need","venue":null,"work_id":"295b368b-9ec1-4e8a-bf33-381ec5db4a39","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.191030Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:afe0b2f709278217541c623c109a83727e29df482a5f35aa92e20bde123370e2","observation_id":"823ef0a0-2908-4923-874a-54a70b1d1b13","resolution":{"observed_at":"2026-08-06T13:16:44.367744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.357335Z","title":"Phenaki: Variable length video generation from open domain textual descrip- tions","venue":null,"work_id":"2ca7469a-d095-4d1b-8797-40286c44b63c","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.193315Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f427b82432b1142cf1a462c3125dd5cd6e46547b7c2fa83f6bcf94437a58a8d5","observation_id":"47df23b6-9d0d-4d93-b779-f07af27600c2","resolution":{"observed_at":"2026-08-06T13:16:44.360071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.349428Z","title":"Videocomposer: Compositional video syn- thesis with motion controllability","venue":null,"work_id":"8dd416ec-a62b-40d7-97e9-923de371df20","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.195673Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b98c839895a78e37c96235afe95bf77f3ce8adfe474c121f8e52130595c4d287","observation_id":"df72c4e7-c5a8-41bf-b7c3-552be28f8323","resolution":{"observed_at":"2026-08-06T13:16:44.352046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.341663Z","title":"Bovik, Hamid R","venue":null,"work_id":"57004741-6853-43d1-9c30-40072a4a90be","year":2004},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.198465Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:da4b6159e213f186ee7f5691d6cb61688e34cf681328f70a59077c7ad455071f","observation_id":"edcc823e-9d61-4eba-8783-04ba52c8c529","resolution":{"observed_at":"2026-08-06T13:16:44.344281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.333703Z","title":"Tune-a-video: One-shot tun- ing of image diffusion models for text-to-video generation","venue":null,"work_id":"410cb5db-8682-4b98-b871-c64dcf38c1ef","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.200811Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e291cf12f39504831dfbff0ae657c7f7270c98f41357c54cabc76d0963a163ec","observation_id":"ee08bb91-16ae-485c-939d-fdc14c5731c6","resolution":{"observed_at":"2026-08-06T13:16:44.336566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.325964Z","title":"SlotFormer: Unsupervised visual dynamics simulation with object-centric models","venue":null,"work_id":"d36fca9b-0ecb-461c-9179-7f30ddbdc0bc","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.203102Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:d2b1a5f94399be69090b06ac8d8b45e36ede27388a839bf6803c14a14a7d451e","observation_id":"430bb969-8803-40e6-b8c4-8ed33041241e","resolution":{"observed_at":"2026-08-06T13:16:44.328676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.316950Z","title":"Slotdiffusion: Object-centric generative model- ing with diffusion models","venue":null,"work_id":"2abd2293-4a1d-411d-a386-549cad221b60","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.205454Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b9d91e67e2c6c14fb082b4d132a0d3f6fd9fdc81ff6995c4925ef9c32a39ecb5","observation_id":"e0d99ffa-f4c9-4e52-b5e7-f53cfec49e3b","resolution":{"observed_at":"2026-08-06T13:16:44.319819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.308763Z","title":"Segment- ing moving objects via an object-centric layered represen- tation","venue":null,"work_id":"282426d8-592d-4be9-a3ef-03406f494d90","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.208326Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c48e63b75d7388579731b1b4177bc0cafb394e0d76dfba73301c4e6182e90ad3","observation_id":"049bc11e-77fc-4b40-946f-fe0b3b0f08ef","resolution":{"observed_at":"2026-08-06T13:16:44.311397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.300599Z","title":"Youtube-vos: A large-scale video object segmentation benchmark","venue":null,"work_id":"75709842-5514-46a7-8e1b-5c20a203db2a","year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.210743Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7c557b97a7e02492a5145d9454a5f62a1fc75d93bc603ed02a3b2b8bcf898968","observation_id":"ab3234e6-fe68-4713-a9ce-81bc16a5decc","resolution":{"observed_at":"2026-08-06T13:16:44.303372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.292706Z","title":"Video instance segmentation","venue":null,"work_id":"9f7d487a-cb24-494d-be64-fcaf849f75de","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.213086Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:9311b029fc28ebf6a39f167d737639a59ef6b8c6daf255f3e7c207e8211e693e","observation_id":"94a6aae8-6199-45ce-943e-2c72a445de2b","resolution":{"observed_at":"2026-08-06T13:16:44.295284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.284721Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":"0cc87bc4-a366-4a4d-9512-b89697d6c21e","year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.215584Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8e90e3da7304297438cc9a71832d100be2bba2b02bdc54c9569dcb5bf7909c88","observation_id":"53ca6954-638a-4aff-90f2-0f387802af24","resolution":{"observed_at":"2026-08-06T13:16:44.287579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.274395Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":"b08fe634-722c-41cb-baf0-72e45a67ac61","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.217929Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f35b82b42c54201ba45dd26b68d95cbe60f78f2cc8ce5b129a26820f94675823","observation_id":"cdae38e8-f316-438b-ab0c-21b77609e9d0","resolution":{"observed_at":"2026-08-06T13:16:44.278578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:16:41.903892Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":66},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2507.20855."}