{"as_of":"2026-08-08T02:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5f5701f4a9be84d6d165567e9be4c2b6a34c1d3d604d0438d08a540211aa298","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:31:08.798977Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:14:01.979367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21780","snapshot_observed_at":"2026-08-02T17:14:01.979367Z","title":"Yanbo Wang, Justin Dauwels, and Yilun Du","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.27958","last_updated":"2026-07-18T22:10:24Z","snapshot_observed_at":"2026-08-06T11:10:21.985621Z","submitted_at":"2026-03-30T02:22:30Z","title":"CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs","version":2},"reference_index":280,"source":"pdf_text","source_observed_at":"2026-08-02T17:14:01.979367Z"},"links":{"cited_paper":"/paper/2505.21780","citing_paper":"/paper/2603.27958"},"observation_digest":"sha256:a22954cd84b522bbe5f01e212f2cb20c013759901c1446a654aed7f8118d072a","observation_id":"4a7ecbc1-5942-4824-b80a-9e3f101176a4","resolution":{"observed_at":"2026-08-02T17:14:01.979367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21780/citation-record","integrity":"/paper/2505.21780/integrity","json":"/paper/2505.21780/citation-record.json","paper":"/paper/2505.21780"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:03.233292Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.233292Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e68b51d9d2051f9e51460960c92a5b7dd5b477b3b4524270b2789baa8050aa83","observation_id":"3b31ca26-b0ed-4157-a0a2-6884242e4bf6","resolution":{"observed_at":"2026-08-07T13:31:03.233292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:03.271306Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.271306Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:5766680ec5569bf86fb7f26cd72ef86e971734619a4fe9c260635185932aa3fe","observation_id":"72888ae0-6451-4d57-a5d6-9b2e39af1e6a","resolution":{"observed_at":"2026-08-07T13:31:03.271306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:03.341825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.341825Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:ac1594a433c439d53b12f9891e4bd313f329574308c388029bae4b1fd718261a","observation_id":"db58fc39-6a82-49be-aa34-9451dc3d7862","resolution":{"observed_at":"2026-08-07T13:31:03.341825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:15.589224Z","title":null,"venue":null,"work_id":"c611c29b-432e-49c1-95b5-258dc0b19be7","year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.496031Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:1c6536da476fd7607dfd0a62554953b0fd062f498e78c3ae06a4200e34588e9c","observation_id":"bed0d9c1-e908-4e70-8fd0-1091925d713e","resolution":{"observed_at":"2026-08-07T13:31:15.669055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:15.443117Z","title":"Backpropagation and stochastic gradient descent method","venue":null,"work_id":"830414e9-1b98-405f-8743-d5a8d4d199f9","year":1993},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.537550Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:09fb4eb301e629b40681865564d5fed52f657ff302a4b0520202ee6adab27d5f","observation_id":"44e67614-41f9-41d0-99ca-206e22cd53c8","resolution":{"observed_at":"2026-08-07T13:31:15.518102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00390","last_updated":"2022-09-07T04:14:48Z","snapshot_observed_at":"2026-08-07T15:26:15.477145Z","submitted_at":"2021-12-01T10:17:25Z","title":"SegDiff: Image Segmentation with Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00390","snapshot_observed_at":"2026-08-07T13:31:03.611392Z","title":"Segdiff: Image segmentation with diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.611392Z"},"links":{"cited_paper":"/paper/2112.00390","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:cf569d773c20506f64fd4866af7e4f719e26b5612a2a170be76d376568b11aad","observation_id":"5c614754-a8ea-46f4-9e99-7873952088df","resolution":{"observed_at":"2026-08-07T13:31:03.611392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:15.229012Z","title":"Break-a-scene: Extracting multiple concepts from a single image","venue":null,"work_id":"f1a8c825-0d2b-4140-9f89-0977ae4e2a2b","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.688261Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:bf19223b2e0346f5e0b8e1ce9f9bd51181c7caf9f2ae44da2eab7fb25beb84bc","observation_id":"4df89546-87ce-4569-bbb1-c212e565da7b","resolution":{"observed_at":"2026-08-07T13:31:15.335852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.997247Z","title":"Towards compositional understanding of the world by agent-based deep learning","venue":null,"work_id":"96d8fc16-d362-4fcf-9fec-45168245de53","year":2019},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.781980Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:a514c936cf8a9cc3830cd21008ab240514a183bb54df7cae036654d33620d752","observation_id":"235b3296-d247-4fc6-be10-f2b01069f787","resolution":{"observed_at":"2026-08-07T13:31:15.099294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.830002Z","title":"Recognition-by-components: a theory of human image understanding","venue":null,"work_id":"c0bb87af-e658-4e8a-a510-beedaebf9246","year":1987},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.851968Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:20e3c4b1765a54f7fb74255762db5245ab1ef5f2d6441ef941e08b503c9d05c1","observation_id":"d444a0d3-fb85-40c2-b20b-cee3d8ecdffc","resolution":{"observed_at":"2026-08-07T13:31:14.910518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.660624Z","title":"A., Kornblith, S., Chen, T., Parmar, N., Minderer, M., and Norouzi, M","venue":null,"work_id":"42234110-04a6-4a07-886f-1fba1cca3325","year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.930887Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:399b6aaa62fc3795fa653ecb42df00b063495352bc5b8d56c659ae593524d309","observation_id":"b01a33cc-c4ff-43b5-b85a-a704329e58c5","resolution":{"observed_at":"2026-08-07T13:31:14.749090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02316","last_updated":"2025-02-22T13:23:28Z","snapshot_observed_at":"2026-07-06T17:24:57.402088Z","submitted_at":"2024-02-04T02:09:18Z","title":"Your Diffusion Model is Secretly a Certifiably Robust Classifier","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02316","snapshot_observed_at":"2026-08-07T13:31:04.057874Z","title":"Your diffusion model is secretly a certifiably robust classifier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.057874Z"},"links":{"cited_paper":"/paper/2402.02316","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:4fbaedd0171ec837f040100b9025154525ff61f9a8dd13c92bae905587f2fd8d","observation_id":"5ab40c78-8d67-44dc-8205-47d9268e16e6","resolution":{"observed_at":"2026-08-07T13:31:04.057874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14368","last_updated":"2025-06-30T19:44:40Z","snapshot_observed_at":"2026-08-05T04:28:31.259985Z","submitted_at":"2023-02-28T07:43:00Z","title":"Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14368","snapshot_observed_at":"2026-08-07T13:31:04.154771Z","title":"K., Lu, J., Inouye, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.154771Z"},"links":{"cited_paper":"/paper/2302.14368","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:bd033d89630720e6f1c3d1aea0a112f1128e577cdee27bb1b1a6f9c6921ea39a","observation_id":"f14f2db2-43ef-419a-a265-24a8110ab24e","resolution":{"observed_at":"2026-08-07T13:31:04.154771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.445435Z","title":"Aspects of the Theory of Syntax","venue":null,"work_id":"2fb507af-604c-443e-9bdb-82220cc66397","year":1965},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.266444Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:366a119ea8aa5c6615ec20649651841818122f5b5005bdb67ce4b6c1578954c3","observation_id":"2abf83de-89c8-45bb-ba41-68219f1837a6","resolution":{"observed_at":"2026-08-07T13:31:14.535965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.284976Z","title":"and Jaini, P","venue":null,"work_id":"a73a84ae-3c81-401c-970a-e4917bf2d92d","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.336704Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:39b21fb346066b2556c995e7310d8991189c9061bcdf4e927bd85331506c62f5","observation_id":"95f45988-d245-44cf-9d13-f686c5ca4ef5","resolution":{"observed_at":"2026-08-07T13:31:14.351217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01413","last_updated":"2023-01-04T03:03:08Z","snapshot_observed_at":"2026-08-02T13:33:33.076817Z","submitted_at":"2023-01-04T03:03:08Z","title":"Attribute-Centric Compositional Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2301.01413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.01413","snapshot_observed_at":"2026-08-07T13:31:09.415742Z","title":"Attribute-Centric Compositional Text-to-Image Generation","venue":"cs.CV","work_id":"a4a5fea6-b510-4c99-8f71-694225da3aa1","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.454124Z"},"links":{"cited_paper":"/paper/2301.01413","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:a17282f3d5e1704fec13ab08f5a14d18a398d9d025b68693baf02768ddbdce38","observation_id":"b8596139-f898-4c9a-8c8b-645f962fc9cc","resolution":{"observed_at":"2026-08-07T13:31:09.499395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01103","last_updated":"2024-06-03T23:30:33Z","snapshot_observed_at":"2026-08-06T10:04:48.366454Z","submitted_at":"2024-02-02T02:40:51Z","title":"Compositional Generative Modeling: A Single Model is Not All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01103","snapshot_observed_at":"2026-08-07T13:31:04.574358Z","title":"and Kaelbling, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.574358Z"},"links":{"cited_paper":"/paper/2402.01103","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d197296051f3605fa3d60e69d77f8c1fb361c297365f1e528334f84b15845ee7","observation_id":"a0492db3-2538-4a8d-a29b-6ef3ed2e221d","resolution":{"observed_at":"2026-08-07T13:31:04.574358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08689","last_updated":"2020-06-30T03:25:59Z","snapshot_observed_at":"2026-07-06T07:40:37.448174Z","submitted_at":"2019-03-20T18:34:29Z","title":"Implicit Generation and Generalization in Energy-Based Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08689","snapshot_observed_at":"2026-08-07T13:31:04.679037Z","title":"and Mordatch, I","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.679037Z"},"links":{"cited_paper":"/paper/1903.08689","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6048ae02e715982592dc6020b7fb4e920b34fa3a5407290b09f9f5d6a9044659","observation_id":"3e2cff6b-91bc-40fc-9105-dd73f7582392","resolution":{"observed_at":"2026-08-07T13:31:04.679037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.082244Z","title":"Compositional visual generation with energy based models","venue":null,"work_id":"3c2f2829-8167-4796-9bbe-6f0303961ea5","year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.782175Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e9301579ee459bb78596ae3c08cb10cc01e43367f6fb2a1ba81cf6d6fcd5bac8","observation_id":"a7d0bc0e-0f44-4333-a5a2-00c842ba1b0c","resolution":{"observed_at":"2026-08-07T13:31:14.169795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.919467Z","title":"J., and Mordatch, I","venue":null,"work_id":"578bdede-2ab5-42f4-b42f-a826f2975277","year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.849905Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:c3b3b4e7c2c25cb3c559bd102ede8a86333d820ac0a57160fa7608733ed0db91","observation_id":"c1e164b3-df9f-4ea9-a0a0-8f27b8a75df3","resolution":{"observed_at":"2026-08-07T13:31:13.992568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11552","last_updated":"2024-09-14T18:55:50Z","snapshot_observed_at":"2026-07-06T14:54:44.947783Z","submitted_at":"2023-02-22T18:48:46Z","title":"Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11552","snapshot_observed_at":"2026-08-07T13:31:04.988457Z","title":"B., Dieleman, S., Fergus, R., Sohl-Dickstein, J., Doucet, A., and Grathwohl, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.988457Z"},"links":{"cited_paper":"/paper/2302.11552","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:9d1ada5641bfb99672e9dccb0c79903195f2d0ab0a626d879c2c3a5a7a7cd6cf","observation_id":"1060ef90-6c81-49be-a3bf-26be9a2933f7","resolution":{"observed_at":"2026-08-07T13:31:04.988457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-07T13:31:05.077080Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.077080Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:9151d928b574b05eded09448b33701832787f55f1b29e663e8dbac5a67c9bcc7","observation_id":"79a09370-420d-4963-980c-b96913185d79","resolution":{"observed_at":"2026-08-07T13:31:05.077080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.747000Z","title":null,"venue":null,"work_id":"d1f1d7c7-5665-4079-881b-92d437a8c893","year":2002},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.152660Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6cbdffe88b4aa2a221bb839f1580c39ab41d45fe0ec845113d62b8abfed268b5","observation_id":"13f6d604-d44a-456d-8598-fbf083b40b88","resolution":{"observed_at":"2026-08-07T13:31:13.825818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.544850Z","title":null,"venue":null,"work_id":"d1d67986-5e7e-4e35-b318-8886b98d3d06","year":1988},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.234718Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3cf25bccca7c7a08539bc4c3a52939928f6ed7b380d221c9dedef9849eb6cebd","observation_id":"6e098382-277a-4290-83e8-f19105d4c1b3","resolution":{"observed_at":"2026-08-07T13:31:13.654837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T13:31:05.308165Z","title":"H., Chechik, G., and Cohen-Or, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.308165Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:44629d9c2123ef2854273f0902d4d3d0543a9e6d4530c5ee2c02013c3f9397b3","observation_id":"367dfec8-b03e-42e2-bf68-514de2876fdc","resolution":{"observed_at":"2026-08-07T13:31:05.308165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.354147Z","title":"H., Chechik, G., and Cohen-Or, D","venue":null,"work_id":"0356fc8b-cd17-4e5f-a2d0-e93f4801796e","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.415209Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:ae322b9457f67c2a5d816b239a5097be6244fd772dc1233a398ca63636b77917","observation_id":"f51eac6b-6f16-444a-be13-94261d4ea826","resolution":{"observed_at":"2026-08-07T13:31:13.446518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12231","last_updated":"2022-11-09T23:15:15Z","snapshot_observed_at":"2026-08-02T03:51:09.933624Z","submitted_at":"2018-11-29T15:04:05Z","title":"ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12231","snapshot_observed_at":"2026-08-07T13:31:05.524154Z","title":"A., and Brendel, W","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.524154Z"},"links":{"cited_paper":"/paper/1811.12231","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:1fab4ce6bf921b3a1a403a8490ca87c2d3fe9e8ad768cab39e146138012b6325","observation_id":"49222bc2-0a8b-4740-ba6c-45e320bacec9","resolution":{"observed_at":"2026-08-07T13:31:05.524154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:05.648001Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.648001Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:b362d23c1842173887f0612b208581b3d20033271ece5d67687004ae063d9552","observation_id":"ca265ea4-382a-42ae-9ce1-6ba0fcd88e01","resolution":{"observed_at":"2026-08-07T13:31:05.648001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05208","last_updated":"2020-12-09T18:02:49Z","snapshot_observed_at":"2026-08-07T12:34:15.648511Z","submitted_at":"2020-12-09T18:02:49Z","title":"On the Binding Problem in Artificial Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05208","snapshot_observed_at":"2026-08-07T13:31:05.704461Z","title":"On the binding problem in artificial neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.704461Z"},"links":{"cited_paper":"/paper/2012.05208","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6f4b95e4fdd6f68a83c648ef61ab0e4d1ac80b9acca4736e3f82e42f1e21d961","observation_id":"e3776150-f756-4d3b-a373-1d873a4e8f5f","resolution":{"observed_at":"2026-08-07T13:31:05.704461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:05.788019Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.788019Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:0327542736960021b34e69bddc5bf087fa220dd48b855846bd441b3fec920481","observation_id":"8bebc477-734b-4cb9-a431-d2f09b4f17ac","resolution":{"observed_at":"2026-08-07T13:31:05.788019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02136","last_updated":"2018-10-03T07:32:57Z","snapshot_observed_at":"2026-08-02T06:41:33.803920Z","submitted_at":"2016-10-07T04:06:01Z","title":"A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02136","snapshot_observed_at":"2026-08-07T13:31:05.828657Z","title":"and Gimpel, K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.828657Z"},"links":{"cited_paper":"/paper/1610.02136","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:828b6f5da7f1aea6d646dc9a11cca100a0a37764d6cd3288334400f9ad60e179","observation_id":"a8610c5c-b5c5-40fa-9ba8-e34bba963126","resolution":{"observed_at":"2026-08-07T13:31:05.828657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.187583Z","title":null,"venue":null,"work_id":"ec89c3ee-3564-431f-8a9d-c44aa4bef010","year":2007},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.925807Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:aa2ad8ade9ed445c2e8fe0afb294ce2f5c58b93785c589254cef13bbc3180ebe","observation_id":"59580d12-5bee-45ea-8c52-a6b9ca4e046d","resolution":{"observed_at":"2026-08-07T13:31:13.238886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:05.984068Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.984068Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:48350b796b492029c2521b74871f5a6ceed97bd393c87aa2a73f08522507e12a","observation_id":"df23d9b9-add0-4112-976f-80a22570e8fd","resolution":{"observed_at":"2026-08-07T13:31:05.984068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-07T13:31:06.090945Z","title":"Composer: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.090945Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:40ed2a8737a3a942eb1c5f212a858b60e05a09b08b2bfdece5fd64d28fb84032","observation_id":"45be940d-46e5-496a-8cc3-9109a7fed01a","resolution":{"observed_at":"2026-08-07T13:31:06.090945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16779","last_updated":"2024-02-14T17:54:04Z","snapshot_observed_at":"2026-07-06T16:25:09.382064Z","submitted_at":"2023-09-28T18:19:40Z","title":"Intriguing properties of generative classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16779","snapshot_observed_at":"2026-08-07T13:31:06.162857Z","title":"Intriguing properties of generative classifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.162857Z"},"links":{"cited_paper":"/paper/2309.16779","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6aa3006f2ebf69ac9340431b3386d299625cd94960858638be32abb211632733","observation_id":"554cc24b-a1fb-4947-91b1-b5519e8651d0","resolution":{"observed_at":"2026-08-07T13:31:06.162857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:06.240587Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.240587Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:34ea0f8be76f9824c46d4cc6d3f04044e47aeffb511f5e6094500fd5a26cd4c4","observation_id":"273b6cba-1c48-4de2-9f81-c78146dda2cf","resolution":{"observed_at":"2026-08-07T13:31:06.240587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10265","last_updated":"2021-11-19T15:11:25Z","snapshot_observed_at":"2026-07-06T12:10:13.301883Z","submitted_at":"2021-11-19T15:11:25Z","title":"ClevrTex: A Texture-Rich Benchmark for Unsupervised Multi-Object Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10265","snapshot_observed_at":"2026-08-07T13:31:06.382571Z","title":"Clevrtex: A texture-rich benchmark for unsupervised multi-object segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.382571Z"},"links":{"cited_paper":"/paper/2111.10265","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:60bc6e5ef6d102607a13fff97e78cdc3eed0a5392473cdeb71cb9dea3e0aa0a8","observation_id":"8851ddb0-7794-4e88-be4e-17a33d7171e9","resolution":{"observed_at":"2026-08-07T13:31:06.382571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:06.491365Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.491365Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:bed1e89f0d0a9d3235e90e7248ef3b3c595603580d2f2c91184e9203d9c348bd","observation_id":"c9ffdb28-261d-4adf-8e23-0c4b3bd4e298","resolution":{"observed_at":"2026-08-07T13:31:06.491365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:06.555315Z","title":null,"venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.555315Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:ff38e24d496b2b2d523a6c106cad48e218172d4f82be7f8dd4c0a211ed0cb1f3","observation_id":"2817ab60-5403-4eb8-9dfb-73e2a688453d","resolution":{"observed_at":"2026-08-07T13:31:06.555315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.020427Z","title":"C., Prabhudesai, M., Duggal, S., Brown, E., and Pathak, D","venue":null,"work_id":"0b574f6b-63ce-41c1-a743-af8437f6ba82","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.719154Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:820439569dcf430a68ad36b36a89514ed3e702411f692714768a975c300669f2","observation_id":"58e1c2e4-f2fe-4fd3-9074-5a8e2d75a84c","resolution":{"observed_at":"2026-08-07T13:31:13.060318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.792285Z","title":"C., Kumar, A., and Pathak, D","venue":null,"work_id":"63377bfa-9fb4-43bd-9ba2-3e8e211f0839","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.870277Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:80c5ce4a20728184e41e0d09ee768b1dcbab02f26174430cb30054a32c0c1b8a","observation_id":"5ec24706-9ccd-4cfe-84ed-8939a7a7ecad","resolution":{"observed_at":"2026-08-07T13:31:12.884452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.562417Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"6cf16e3b-6d74-4c90-b99a-8421fe0ec038","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.970144Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:dfc26c6215a9213a12ce81c8e741486b9c08db7dac474fbf93f558eb655f2c7b","observation_id":"7f4bea38-a0d3-4066-bd3b-ec790830628d","resolution":{"observed_at":"2026-08-07T13:31:12.683474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11522","last_updated":"2022-10-20T18:46:31Z","snapshot_observed_at":"2026-07-06T14:08:26.493996Z","submitted_at":"2022-10-20T18:46:31Z","title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11522","snapshot_observed_at":"2026-08-07T13:31:07.083418Z","title":"B., Torralba, A., and Mordatch, I","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.083418Z"},"links":{"cited_paper":"/paper/2210.11522","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:944e6a9c75e72952da68135259434cdb2f13a5549b833e5db65309a0bf9b3bbf","observation_id":"72cccb25-29bc-499c-b59b-04a1bc484905","resolution":{"observed_at":"2026-08-07T13:31:07.083418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.232798Z","title":"Learning to compose visual relations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.232798Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6cea5a5abe38b50c2babd79fa016616349e821dea8881c0e8c52aeaf23daab8e","observation_id":"69fbf829-3e1a-4605-9303-4368ced9d9c5","resolution":{"observed_at":"2026-08-07T13:31:07.232798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-02T04:13:10.260957Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-07T13:31:07.277041Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.277041Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:dd9559f4fefd71327f6e59f6ec242f44d6dc0d2b14ad71f29d1fb3b4d198e076","observation_id":"3b9d7ced-726c-4517-a0eb-5e95ce7da35f","resolution":{"observed_at":"2026-08-07T13:31:07.277041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.370114Z","title":"B., and Torralba, A","venue":null,"work_id":"f377d1a8-3cab-4ef1-a5ef-57f927e74f91","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.308486Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:90bcb4a4fd0b47482be0429237ea8d71dc84a37a1c04262cba56971dffeb954c","observation_id":"0fcc8820-a7d2-446d-aa89-fd5f48eb31fd","resolution":{"observed_at":"2026-08-07T13:31:12.461689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.162558Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"ecc50e10-c9b7-4a8f-8c9a-4f4f2ce38b7d","year":2015},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.357725Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:67be0cb91de635e1ada405f64ea35cdccdb57ba935ec33f0ed9db7bc742b62ac","observation_id":"24c7118d-6ac1-4175-9763-57546c0daedf","resolution":{"observed_at":"2026-08-07T13:31:12.234536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.403281Z","title":"Object-centric learning with slot attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.403281Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e273e47bac32573c36733ffea6d08c8c126cfe676b2ac16dde8e2fd3cf6f71b3","observation_id":"7282a1cd-5216-43e9-bce9-21f4e556e220","resolution":{"observed_at":"2026-08-07T13:31:07.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06303","last_updated":"2025-07-10T22:00:10Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T19:25:07Z","title":"Compositional Risk Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06303","snapshot_observed_at":"2026-08-07T13:31:07.462880Z","title":"Compositional risk minimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.462880Z"},"links":{"cited_paper":"/paper/2410.06303","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:457a236906fa9fa72159b9c79a35dff8f0b2666d87689b2810b2b5d3b8db38cf","observation_id":"779232eb-934c-4d22-96cd-ef114a936929","resolution":{"observed_at":"2026-08-07T13:31:07.462880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04987","last_updated":"2025-01-13T18:24:22Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:55:10Z","title":"Few-Shot Task Learning through Inverse Generative Modeling","version":2},"cited_work":{"arxiv_id":"2411.04987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04987","snapshot_observed_at":"2026-08-07T13:31:09.039158Z","title":"Few-Shot Task Learning through Inverse Generative Modeling","venue":"cs.AI","work_id":"e29c0cac-c471-4895-981f-afb7e556db53","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.512923Z"},"links":{"cited_paper":"/paper/2411.04987","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3643bae6fdb5a5bc8182f218b5c7cb629f7fd75800fdf146fa08df8eb56496bf","observation_id":"48dee2ca-6eb2-4cb1-891f-2316976a350f","resolution":{"observed_at":"2026-08-07T13:31:09.126319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.873280Z","title":"and Jordan, M","venue":null,"work_id":"89146fd0-e8af-45a1-b32a-54e0fff12ef3","year":2001},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.574967Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:cc3f7df812bcdccbc4b3a6ab6a7dded93e03b857d0367a236a9dc66c8d89cc92","observation_id":"a165054a-c4b5-4304-8d85-034dc36c7266","resolution":{"observed_at":"2026-08-07T13:31:12.007109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.626448Z","title":"Controllable and compositional generation with latent-space energy-based models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.626448Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:8a1a880e1e5695325c0dc004a3fa3d9ace1e0e26260811eac926b7f288b4565c","observation_id":"71b669ca-faed-4d25-9359-d1031692547a","resolution":{"observed_at":"2026-08-07T13:31:07.626448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.689922Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning, pp.\\ 5389--5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.689922Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:b3fb83ddcd5bdb4acf79da0e678b5481a30948ace2f4b5da3722079fad5fda72","observation_id":"112f5f8a-5b3e-498d-b04b-1ab3e2b00769","resolution":{"observed_at":"2026-08-07T13:31:07.689922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.741988Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.741988Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:610b18b661903a0798fac33b9b80aec4d1db53fab5ec4c6e120ceffec088c69f","observation_id":"d2b67b9c-9c00-43ba-8eec-937a791dee05","resolution":{"observed_at":"2026-08-07T13:31:07.741988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.615801Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"a8a6b7a7-1afb-49ff-9e8b-d2a4c0d82a4f","year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.803399Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:92bfefcaa57a52f220e59af8839a7430fcbbc39818b2a3fee8feca0ea0602a5f","observation_id":"ebbba95e-0e42-440a-a5f6-06980e5067cd","resolution":{"observed_at":"2026-08-07T13:31:11.710864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.888081Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.888081Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:19ddeb4f7d82e7159e2fb9f096565249b6337b44a5fe68453fb09a509f4638c7","observation_id":"78d6de68-f992-42a7-ab05-54765b74ffaf","resolution":{"observed_at":"2026-08-07T13:31:07.888081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08221","last_updated":"2022-02-12T16:37:54Z","snapshot_observed_at":"2026-07-06T11:29:56.695924Z","submitted_at":"2021-07-17T11:24:18Z","title":"Visual Representation Learning Does Not Generalize Strongly Within the Same Domain","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08221","snapshot_observed_at":"2026-08-07T13:31:07.991560Z","title":"u gelgen, J., Tr \\","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.991560Z"},"links":{"cited_paper":"/paper/2107.08221","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:4225793d6a5e2380c61022225639f0b414293121a212661f3971e259d1491122","observation_id":"b2ab825e-b8b8-41fb-af29-fe4dc072ed5f","resolution":{"observed_at":"2026-08-07T13:31:07.991560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14860","last_updated":"2023-03-06T23:19:17Z","snapshot_observed_at":"2026-08-06T15:09:47.073411Z","submitted_at":"2022-09-29T15:24:47Z","title":"Bridging the Gap to Real-World Object-Centric Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14860","snapshot_observed_at":"2026-08-07T13:31:08.053196Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.053196Z"},"links":{"cited_paper":"/paper/2209.14860","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:c612b8546e0824ac7578f579297d6932cd232a570d26df339aa1d549395ba1f7","observation_id":"570ebb4a-348e-4219-86d3-5af63f0b9598","resolution":{"observed_at":"2026-08-07T13:31:08.053196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.388958Z","title":"Detecting and recovering sequential deepfake manipulation","venue":null,"work_id":"2e14fb54-06d6-4ce1-8c17-5770003f1a9b","year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.110922Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:5221dbfa127b41a208aedf96ad58a78a46aa7468f576e9bfa01347449b72f78b","observation_id":"cdd15997-d0ab-4205-aae2-454131f39351","resolution":{"observed_at":"2026-08-07T13:31:11.489486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.177029Z","title":null,"venue":null,"work_id":"821af218-b19f-4393-8883-e683035e622e","year":1971},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.167762Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:f980b0c0d42f8a48ad7ea25085dede812ceceb21793254223bd72610db3da095","observation_id":"a225580e-41e7-48e3-a005-c74272519bff","resolution":{"observed_at":"2026-08-07T13:31:11.281116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.869728Z","title":null,"venue":null,"work_id":"65103fc4-6679-42e6-bdc9-42764c0c5f5e","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.223743Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e71faed4f842b98f20a864586fa8a913b56e77da7c02c20c74dacf525009c47f","observation_id":"1d09a0f6-7c6c-4159-a831-744b375b6a5f","resolution":{"observed_at":"2026-08-07T13:31:11.015827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:08.303473Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.303473Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:5f51a113835fb726bf8cd78b5a5ac1ccad06e9801981bb0d4be067c470e63195","observation_id":"02f62b48-551d-4b34-a2b3-e31fcd5395f3","resolution":{"observed_at":"2026-08-07T13:31:08.303473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00763","last_updated":"2023-06-01T14:56:37Z","snapshot_observed_at":"2026-07-06T15:36:37.380930Z","submitted_at":"2023-06-01T14:56:37Z","title":"Learning Disentangled Prompts for Compositional Image Synthesis","version":1},"cited_work":{"arxiv_id":"2306.00763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00763","snapshot_observed_at":"2026-08-07T13:31:08.922246Z","title":"Learning Disentangled Prompts for Compositional Image Synthesis","venue":"cs.CV","work_id":"29129cff-50e4-45df-ac78-e3d733ef6858","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.349745Z"},"links":{"cited_paper":"/paper/2306.00763","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d01ec782d9fcd738f0ff934471177764210afd03fdf32ba37f3b614e444130f5","observation_id":"537cf5d5-9664-4d9f-89bf-06ff40278537","resolution":{"observed_at":"2026-08-07T13:31:08.952881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19298","last_updated":"2024-06-27T16:13:34Z","snapshot_observed_at":"2026-07-06T18:38:00.379225Z","submitted_at":"2024-06-27T16:13:34Z","title":"Compositional Image Decomposition with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19298","snapshot_observed_at":"2026-08-07T13:31:08.420211Z","title":"B., and Du, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.420211Z"},"links":{"cited_paper":"/paper/2406.19298","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:2014bed9e325b6e0120d9340743a7e6037fe6a772d226ee01287f3af400477c5","observation_id":"cc3b05f2-9e88-4570-8c8e-d40d0a6339d2","resolution":{"observed_at":"2026-08-07T13:31:08.420211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.630019Z","title":"Measuring robustness to natural distribution shifts in image classification","venue":null,"work_id":"0bf37baf-c7c8-45d7-a3fc-68179dfe2257","year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.476938Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:195d86cf9c0b226877c49b993e8ad27546e518f88fc8137f80b5a8e55b89a725","observation_id":"1902976f-d1ee-439a-8839-1bccf6dbac17","resolution":{"observed_at":"2026-08-07T13:31:10.744729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.403682Z","title":"N., Vapnik, V., et al","venue":null,"work_id":"594f43ca-bc88-4d4c-bb4c-17fb6d2ba5e2","year":1998},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.550767Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:b27465ed2c7db3bc28e82350cf75b34aa626b38dfa111e1e76cdb5271b43cc1a","observation_id":"5b0adc74-8031-4328-9138-d84c4b067ded","resolution":{"observed_at":"2026-08-07T13:31:10.502890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.113346Z","title":"Hierarchical open-vocabulary universal image segmentation","venue":null,"work_id":"6dbf6f38-3b68-4964-b322-d1c99f49d6a0","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.596349Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:69ccc33b061cde9921550c48287bf0a52c5c0ebd9a537c6573759a4f4ef54afd","observation_id":"6e5b7ea1-67bb-466a-a552-fb0605d9379a","resolution":{"observed_at":"2026-08-07T13:31:10.241513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:09.882885Z","title":"Slot-vae: Object-centric scene generation with slot attention","venue":null,"work_id":"a8fd2729-cdd7-4b8e-bd0f-ad176304bb55","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.634826Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:152b9f6c61890b95b453f19878e2b0fd8e14c6272bd420b36199adad506f9f59","observation_id":"1094d440-04a0-432f-b7b6-e5cde3c627fa","resolution":{"observed_at":"2026-08-07T13:31:10.002017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:09.687598Z","title":"Compositional generalization from first principles","venue":null,"work_id":"8a3ed7d1-00c1-44e5-b3e4-03a1ac16adbc","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.661464Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:7c006526369cf09856e51245d0a33b5105f59f98845c6c1c152b653527648706","observation_id":"22082d0b-8a0d-49ee-833d-6ad0656f06ee","resolution":{"observed_at":"2026-08-07T13:31:09.788292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:08.719140Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.719140Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:cf753cdb496fe6e6194912f6b0ada52d72e35f561861c1895740679b53668052","observation_id":"27473254-f210-4ec6-b326-c8a00f310769","resolution":{"observed_at":"2026-08-07T13:31:08.719140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-02T11:29:41.147175Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-07T13:31:08.798977Z","title":"Robodreamer: Learning compositional world models for robot imagination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.798977Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:34b2eacb217f86663210ffab5a0ebd7876d6b6e4a76e2c2c7fe23f3cc5390cd4","observation_id":"4df0415b-4810-4649-bf9e-c8f931a56890","resolution":{"observed_at":"2026-08-07T13:31:08.798977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:20:48.170443Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2505.21780."}