{"as_of":"2026-08-17T03:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8e1e23cfed1055ef7669d5aab153cd11f1476324e103d777bcda6d6cbf06bbf","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:41:08.841867Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.08522/citation-record","integrity":"/paper/1908.08522/integrity","json":"/paper/1908.08522/citation-record.json","paper":"/paper/1908.08522"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.571305Z","title":"Stochastic variational video prediction","venue":null,"work_id":"18fa34bd-be3a-4f8e-89f9-8f5461e7a387","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.634515Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:6c63b88c5f720d214b010b10c4895f0dfcb05fa1242a609b99f088fcfdb6a27c","observation_id":"3d30a6e4-18bc-412f-bab8-bb3359f4fc34","resolution":{"observed_at":"2026-08-14T11:41:09.576461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.555000Z","title":"Interaction networks for learning about objects, relations and physics","venue":null,"work_id":"3a11e6af-3ed7-4b33-bd9e-04b6cfba42c6","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.639575Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:11d83c69188f04f9e0078152a66f17d0121d3656785f2a1c274395136bebc3df","observation_id":"f9d1dc5e-d080-46c1-8525-83ad428be626","resolution":{"observed_at":"2026-08-14T11:41:09.560187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01261","last_updated":"2018-10-17T17:51:36Z","snapshot_observed_at":"2026-08-15T04:21:38.631648Z","submitted_at":"2018-06-04T17:58:18Z","title":"Relational inductive biases, deep learning, and graph networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01261","snapshot_observed_at":"2026-08-14T11:41:08.644346Z","title":"Relational inductive biases, deep learn- ing, and graph networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.644346Z"},"links":{"cited_paper":"/paper/1806.01261","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:15eed6563f5d826c0ff6d9783a3d5b22dd683465b5566456c0ec22729dfe6cf0","observation_id":"bcd2b8db-aa73-44f6-a8c9-11063f67c2bd","resolution":{"observed_at":"2026-08-14T11:41:08.644346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.538416Z","title":"A compositional object-based ap- proach to learning physical dynamics","venue":null,"work_id":"65290569-2dce-4f8a-a612-ad7dbfabeffa","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.650025Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:1c7378f690be846dfd82da5747576fdb67961e6608a43a4bdba684f1c64589a2","observation_id":"234dd628-090b-48ab-9401-6ac559646e67","resolution":{"observed_at":"2026-08-14T11:41:09.543937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.522372Z","title":"Video imagination from a single image with transformation gener- ation","venue":null,"work_id":"fc570fcb-30d0-41ac-b1b4-dd3c2e6ecf12","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.654905Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:f84a7f374e0b31b18ece9fb8d9c64ce40970f07cbc33116c8ca9423c30bf3e75","observation_id":"85827209-7c76-4c93-9f3a-db5ea8ad0f96","resolution":{"observed_at":"2026-08-14T11:41:09.527550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.505828Z","title":"Stochastic video generation with a learned prior","venue":null,"work_id":"702906cd-e033-41e1-8df8-d60899b6a067","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.659791Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:32415b87efc8cf02fbe2074f28e069511a2c1c93be986c44c2a8e13d8c210bf9","observation_id":"077ac245-58c2-4875-8406-e5fcd9d031fc","resolution":{"observed_at":"2026-08-14T11:41:09.510547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.489827Z","title":"Unsupervised learning of disentangled representations from video","venue":null,"work_id":"6832136c-7ef4-4889-b555-6a343a6720ad","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.664798Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:f2cfde867786d7f458e625f654f2ae46af9a97c1f587b9fc7fdd53f933159fac","observation_id":"0f875912-5543-48c3-9f40-0492773cfae3","resolution":{"observed_at":"2026-08-14T11:41:09.494760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.473968Z","title":"RMPE: Regional multi-person pose estimation","venue":null,"work_id":"ad04d552-e45a-40c0-9b80-f4acb0dd85b9","year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.669860Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:e0f02fdb8644de679b1b220874e9414c0aa8068a25e2b00f8feab38465f0d84c","observation_id":"22df3983-089f-430d-8911-af0805b1a915","resolution":{"observed_at":"2026-08-14T11:41:09.479235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.458729Z","title":"Unsuper- vised learning for physical interaction through video predic- tion","venue":null,"work_id":"abd1fbe4-d428-43db-8c82-603cbc7f1198","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.674302Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:405d4c3d47b9a6e60401f8c294b63c8c9bff651e090ddf8af60d3e1f0f03d959","observation_id":"b65381be-5e1e-46cf-9039-7f3455984de2","resolution":{"observed_at":"2026-08-14T11:41:09.463687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.442098Z","title":"Learning visual predictive models of physics for playing billiards","venue":null,"work_id":"ac70a8bb-4496-4b5c-bec9-2766f1e08558","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.679069Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:ef169ed581407ef8bd447d5a40c137f3acc422968d3e16502f373f8e78e5fba8","observation_id":"e58683e6-acb0-4571-b04c-e841462215fd","resolution":{"observed_at":"2026-08-14T11:41:09.447847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02082","last_updated":"2017-05-05T04:19:40Z","snapshot_observed_at":"2026-08-14T21:02:40.105667Z","submitted_at":"2017-05-05T04:19:40Z","title":"Motion Prediction Under Multimodality with Conditional Stochastic Networks","version":1},"cited_work":{"arxiv_id":"1705.02082","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.02082","snapshot_observed_at":"2026-08-14T11:41:08.922537Z","title":"Motion Prediction Under Multimodality with Conditional Stochastic Networks","venue":"cs.CV","work_id":"2c7e7cab-7114-4da6-a3ed-c53502da40c6","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.683694Z"},"links":{"cited_paper":"/paper/1705.02082","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:546ba49d5a0f76c4bba23ce734800fd77165ff4b3b7b08a78913fb3598114dc4","observation_id":"a703787a-e12c-4704-a3a6-5834004fe025","resolution":{"observed_at":"2026-08-14T11:41:08.927880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.689100Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.689100Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:c1f6dae67ddd149e77720af1580f6fa0a398c9cac991c87644124b5c13dcaa78","observation_id":"74a09ed0-3509-4981-963c-2a02a0b7d913","resolution":{"observed_at":"2026-08-14T11:41:08.689100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.417063Z","title":"Shapestacks: Learning vision-based physical in- tuition for generalised object stacking","venue":null,"work_id":"b733d3bf-e2ec-4725-aea3-0beb2caefc63","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.693908Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:2c523a6a65f561a11345594dcc56876e1f4593dd7f106bbdc1eac7edf1c3730f","observation_id":"310dd530-e1d9-4a6a-a41f-0272c7f88e0d","resolution":{"observed_at":"2026-08-14T11:41:09.422057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.698483Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.698483Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:0d04fb2786e1e7768757c2ab85022a8750f0d7a74783166a31de5b4b2ba7b645","observation_id":"74966240-e9fe-4c3b-ab90-5fe762d30e66","resolution":{"observed_at":"2026-08-14T11:41:08.698483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.391665Z","title":"Learning to decompose and disentangle representations for video prediction","venue":null,"work_id":"2d1eb9ea-9fc5-427d-bb38-56f6e9ce6ad3","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.703392Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:3ec136cade49ebdc744ae6abb3379aa0a595aee5ccee6038dbc04b5ea309cb7e","observation_id":"f6830c78-1ae6-46ba-9642-53d8051fea2e","resolution":{"observed_at":"2026-08-14T11:41:09.396793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.376796Z","title":"Approximate maxent inverse optimal control and its application for mental simulation of human interactions","venue":null,"work_id":"4bf23bba-95be-423d-9e02-c3d083db9446","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.707917Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a9858778f06be9f93e009e09df7c26a165bf186230095a46c95b9c6901a73e84","observation_id":"adeec566-7bf2-4c73-b822-6a03f6767069","resolution":{"observed_at":"2026-08-14T11:41:09.381801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.361146Z","title":"Spatial transformer networks","venue":null,"work_id":"3e9f6f47-226a-40b1-ad83-735a21899550","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.712444Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:1b6e14ee882bda29662dbbd01eed24abd06b2fcde9556449520b17ca67630e84","observation_id":"1beadcb7-598e-48e1-8dc6-d930ffb5a179","resolution":{"observed_at":"2026-08-14T11:41:09.365929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.345488Z","title":"Dynamic ﬁlter networks","venue":null,"work_id":"d0a14ac5-9c43-45a6-aeb5-06e7dfa65b30","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.716730Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:659bf6fdf79d418ddfa4ea92ab3838f83d295118748dd3755191bb600f150f55","observation_id":"758b5521-dacc-4802-a0c5-7567287a095c","resolution":{"observed_at":"2026-08-14T11:41:09.350340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.329372Z","title":"3d reasoning from blocks to stability","venue":null,"work_id":"7e9631d4-2bff-47b5-a3d9-7b0de9f67eda","year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.721273Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:425b080a96e584f4420910f7772537cca4a652bf0ed93e984cbdc3fa04eb0b6e","observation_id":"a033b557-33c6-4330-9d2e-50cc0f4d6235","resolution":{"observed_at":"2026-08-14T11:41:09.335303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.313190Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":"8b073ffb-d2bc-48d0-9860-15eb9c1424a7","year":2014},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.727069Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a0d79365cee367c4063dc3f2bc86b2e49bcd920f4afc5a340a95a35c1158d717","observation_id":"cbbc6370-7f00-440d-ae10-7b84884e2ec1","resolution":{"observed_at":"2026-08-14T11:41:09.319062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.298192Z","title":"Neural relational inference for interacting systems","venue":null,"work_id":"8fe60e94-d8bd-4444-adfa-270b7ffe0eb1","year":2019},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.731522Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:2a797278747b4ec235e4031d76d740994cbfd28160114c4c7e9f15e2d2d961e0","observation_id":"f04a5fe2-7f37-4101-9fc8-36772c5e2b7a","resolution":{"observed_at":"2026-08-14T11:41:09.302937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.282841Z","title":"Activity forecasting","venue":null,"work_id":"876bead7-ba24-4256-99e1-7120aeb88d4b","year":2012},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.736040Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:84e02767f790de0def5eb8bf889748c1ae0e04f3a7796909412d94c704f595f5","observation_id":"dc58c271-4f94-4ddd-b6d9-c3ed36211ee3","resolution":{"observed_at":"2026-08-14T11:41:09.287578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.267150Z","title":"Learning physical intuition of block towers by example","venue":null,"work_id":"0e8d11cb-cc69-4d90-b19c-1f2f8a550906","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.740289Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:cbfb545b78d83be7eb792338a55f190fe9f24888aefde7bb390f25a9b904aa0e","observation_id":"e668ca30-43eb-41e5-8cb8-5f3794f31bbc","resolution":{"observed_at":"2026-08-14T11:41:09.272318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.00066","last_updated":"2016-03-31T21:53:32Z","snapshot_observed_at":"2026-08-14T22:03:34.145521Z","submitted_at":"2016-03-31T21:53:32Z","title":"To Fall Or Not To Fall: A Visual Approach to Physical Stability Prediction","version":1},"cited_work":{"arxiv_id":"1604.00066","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.00066","snapshot_observed_at":"2026-08-14T11:41:08.898354Z","title":"To Fall Or Not To Fall: A Visual Approach to Physical Stability Prediction","venue":"cs.CV","work_id":"ed638ef9-a1a2-46ea-bbad-2b66c1c290d7","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.744919Z"},"links":{"cited_paper":"/paper/1604.00066","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:71aaea97a1a3c5b98ef2982a43bcd161ddb19b2d93c819040c46c6657dfce7f2","observation_id":"0e66b05f-b071-42c0-bd02-acb35733d55c","resolution":{"observed_at":"2026-08-14T11:41:08.905542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.251916Z","title":"Visual stability prediction and its application to manipulation","venue":null,"work_id":"8f084f07-f192-4f37-9b36-2ea449f6ada2","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.750065Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:5135c36adf02e2f59fc298510cb6260235760d5f3dda64ad3bfaa28b6dc5ae7b","observation_id":"0a3da397-a6c6-4301-9128-1cb7ff58d83a","resolution":{"observed_at":"2026-08-14T11:41:09.256866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.235489Z","title":"Video frame synthesis using deep voxel ﬂow","venue":null,"work_id":"b71dfd79-5ead-41e5-ab13-531601821bf7","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.754836Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:95b66b4cf06a26087f20150a974bba0a4838d7a050833c2868eb85d3c39250ff","observation_id":"7b27ff61-ccc1-41ee-9cbb-20f16a6a935f","resolution":{"observed_at":"2026-08-14T11:41:09.241463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.218983Z","title":"Deep multi-scale video prediction beyond mean square error","venue":null,"work_id":"3821217d-850e-4458-b834-fb95e15763bf","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.759261Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:ab1965ca36149a4097986100c3b74e97e29f0789b27f845f03768e11b66c39f0","observation_id":"4e5e4ee9-7139-4df5-ac14-6b6295e28ecd","resolution":{"observed_at":"2026-08-14T11:41:09.224483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.202543Z","title":"A simple neural network module for relational reason- ing","venue":null,"work_id":"dbfc4979-6a11-4c55-8bb9-f1826e096cf8","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.764135Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:928bbea30ea1968300e299a6fa326c0f9c4dda7df11200e563fd586bac38c6d6","observation_id":"9fe37d43-3d71-4ed7-8721-de0f68503dbe","resolution":{"observed_at":"2026-08-14T11:41:09.208037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.185373Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"0969174a-69bb-43cb-856b-e0817eaf4921","year":2012},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.768557Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:90748114583e39b44c37e035569e7935511061a4c9fe7cfc2971d6e1b749492b","observation_id":"d47e6f3f-6532-4f81-9fe4-6951d61361c3","resolution":{"observed_at":"2026-08-14T11:41:09.190867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.169487Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"b01bce65-445d-4d34-ba3a-6b0296817d47","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.773062Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:ec5eb220c77d3141cd9c26a571de26d18452a8315d93663e3b3f2e2360bfd352","observation_id":"19824461-2296-49c4-b92b-d46cf141a3c4","resolution":{"observed_at":"2026-08-14T11:41:09.174675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.153462Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"6c5f36d5-d566-4dfa-99f9-f1c20d9e54b1","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.777342Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:e98ffa60e5dc695d1658cb8a010289447e6a22bf81bad02f1f3eccdfaa4e623c","observation_id":"a8ff2012-e278-40d3-8e3d-8895fa586c8f","resolution":{"observed_at":"2026-08-14T11:41:09.158670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.136822Z","title":"Decomposing motion and content for nat- ural video sequence prediction","venue":null,"work_id":"f383a53c-698e-4c88-ac5d-6e39a89766a3","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.781908Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:fc40347ac0f4aaaa97f08834e75ed209785040e7eb279ebe80a4f6756cad6f1f","observation_id":"ebcd98dc-acfd-4562-8f11-178fd5643a59","resolution":{"observed_at":"2026-08-14T11:41:09.141903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.119717Z","title":"Learning to generate long- term future via hierarchical prediction","venue":null,"work_id":"b1b42082-d810-40b1-8ded-d4ed9e59b78e","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.786345Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:468d62e13e84b82d5b850c93faf309f3ab8ebb91518953bcde635ce743aac928","observation_id":"c5fa7ed0-b874-4612-9b71-0333537e53df","resolution":{"observed_at":"2026-08-14T11:41:09.125733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.790690Z","title":"Generating videos with scene dynamics","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.790690Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:5e770f2704eec2fad1ea56201b3f6e97d680265950c0dc377aa3b11254895809","observation_id":"ea4523cd-00d5-416e-913a-fcf578678bfc","resolution":{"observed_at":"2026-08-14T11:41:08.790690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.092688Z","title":"An uncertain future: Forecasting from static images using variational autoencoders","venue":null,"work_id":"1a85e4ec-1e28-4691-9c50-8cd70831efd6","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.795008Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:fb15efae6f4158841bbc266c3737cebbdd9e0d7242d309877a2b8b67384f5b79","observation_id":"b2080860-02cb-4561-816e-b4fe1e9900d9","resolution":{"observed_at":"2026-08-14T11:41:09.097825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.076743Z","title":"The pose knows: Video forecasting by generating pose futures","venue":null,"work_id":"c8b0ff57-1dd3-4f53-bca2-d5930401a77c","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.799506Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:0ab8e9a973e778627f320b43ab2d729c49d98dfe01fda7bb49bf7b3e7b38ba93","observation_id":"aa36062a-383b-4683-8d94-2097e11cb177","resolution":{"observed_at":"2026-08-14T11:41:09.082157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.059257Z","title":"High-resolution image syn- thesis and semantic manipulation with conditional gans","venue":null,"work_id":"ecad9498-eaf5-4d34-95a5-b6e89fafee54","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.803836Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:8231f0c9cc677357e19a8a6b0185606e2a38cbd92382286cae3f512d7b036894","observation_id":"c0207b7e-21b8-41c7-b5f4-53dd2a5fa802","resolution":{"observed_at":"2026-08-14T11:41:09.064848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01433","last_updated":"2017-06-05T17:38:52Z","snapshot_observed_at":"2026-08-14T20:56:00.692346Z","submitted_at":"2017-06-05T17:38:52Z","title":"Visual Interaction Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01433","snapshot_observed_at":"2026-08-14T11:41:08.808585Z","title":"Visual in- teraction networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.808585Z"},"links":{"cited_paper":"/paper/1706.01433","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:ee68d65a3915cc499c891ef26365a09218a937184a95de0ed7024b113f3924bb","observation_id":"de339c0d-33b9-4749-a53b-7e920bcc151d","resolution":{"observed_at":"2026-08-14T11:41:08.808585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.042974Z","title":"Physics 101: Learning physi- cal object properties from unlabeled videos","venue":null,"work_id":"a9122d20-c492-4f9e-b7a7-7a178a8ad8ec","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.813364Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:80cef18998b7cb0e10fb5730c47e4fd4311458ff752656b23e408df2faa165a9","observation_id":"696f3eaf-a010-4875-93e8-22856adba5a5","resolution":{"observed_at":"2026-08-14T11:41:09.048313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.027104Z","title":"Visual dynamics: Probabilistic future frame synthesis via cross convolutional networks","venue":null,"work_id":"ab473256-e8a3-4f7a-b2ad-f54a84c0c69e","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.817886Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:7a32b8541ea1decee06f1dbbf755104ae0592a5d5117754488d6bfb2bb19ad72","observation_id":"0b947c7e-1dba-4cac-82fe-85895d3af029","resolution":{"observed_at":"2026-08-14T11:41:09.032123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.011308Z","title":"MT-V AE: learning motion transformations to generate multimodal human dynamics","venue":null,"work_id":"ec5dd6c3-74cb-4eca-9342-be1e98092661","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.822251Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:e21a2fc3995b00e5f544cd5015e4bea44adccf9764b24d1978b21e5b15aecdb0","observation_id":"fbbee481-d605-4a5c-ab8b-b956ee18fda4","resolution":{"observed_at":"2026-08-14T11:41:09.016278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.995739Z","title":"Interpretable intuitive physics model","venue":null,"work_id":"3f3189e0-c680-4b44-8d14-a34a2928f1ab","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.826856Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a510765dfdb85946c23dbf8ab5049c91077978ec98c25e4a50bb554da7d9613b","observation_id":"17a26547-7c12-4b64-a6ee-f011f954208b","resolution":{"observed_at":"2026-08-14T11:41:09.000729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.831383Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.831383Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:4c577d7bdde15ac1d517597c0fd951a263ed377f58de5b8438e3f8dd5c655697","observation_id":"c84bd91b-8f56-4e5a-9397-d666b5d06edb","resolution":{"observed_at":"2026-08-14T11:41:08.831383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.970299Z","title":"From actemes to action: A strongly-supervised repre- sentation for detailed action understanding","venue":null,"work_id":"0bd8f089-0b8b-4dae-801b-2ce48dc5a9ad","year":2013},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.836708Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:90191768d7f43e577fc4fa49a191268e7143bf3d2589df24a96e6d16de0cc91f","observation_id":"56374c15-fb9c-4800-92b6-110b6ee29019","resolution":{"observed_at":"2026-08-14T11:41:08.975245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.955166Z","title":"|u| =|zt| = 8","venue":null,"work_id":"364811a3-5f02-41e8-846a-ae7cf6c874f9","year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.841867Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:d0e51096337539d60841dc1d06ca95e5161ceecad241bd7e26707786c8746310","observation_id":"7c626f06-dcfd-4d0b-ad65-4088b0613cc3","resolution":{"observed_at":"2026-08-14T11:41:08.959750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:43:41.551128Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:1908.08522."}