{"as_of":"2026-08-10T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c1f497ddbb2f5904b8391d56cab4d459da3ff6c328ea96d2f3eb0dac8c0c71f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:32:52.782365Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.798982Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-07T05:32:52.782365Z","title":"F., Mahendran, A., Stone, A., Sabour, S., Heigold, G., Jonschkowski, R., Dosovitskiy, A., and Greff, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07806","last_updated":"2025-06-09T14:35:23Z","snapshot_observed_at":"2026-08-09T17:20:53.961480Z","submitted_at":"2025-06-09T14:35:23Z","title":"Identifiable Object Representations under Spatial Ambiguities","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:32:52.782365Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2506.07806"},"observation_digest":"sha256:cbb51ae78f4cc2e3b1b2971f81c6f7fb3cfc15a90351a90c08fe416bd11dbde8","observation_id":"46add00e-7cdc-40bd-842a-6116bb1c4f8e","resolution":{"observed_at":"2026-08-07T05:32:52.782365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-06T23:11:50.019492Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19408","last_updated":"2025-06-24T08:23:55Z","snapshot_observed_at":"2026-08-09T16:41:33.837978Z","submitted_at":"2025-06-24T08:23:55Z","title":"Is an object-centric representation beneficial for robotic manipulation ?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:50.019492Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2506.19408"},"observation_digest":"sha256:cbf4da55f690eca2631772f185868a31b74693570efd779dfab20488817aaea1","observation_id":"0bd2304f-8036-4784-816e-704ec86f90c1","resolution":{"observed_at":"2026-08-06T23:11:50.019492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-06T20:19:04.792172Z","title":"F., Mahendran, A., Stone, A., Sabour, S., Heigold, G., Jonschkowski, R., Dosovitskiy, A., and Greff, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03298","last_updated":"2025-07-04T05:06:15Z","snapshot_observed_at":"2026-08-07T09:19:12.071996Z","submitted_at":"2025-07-04T05:06:15Z","title":"Dyn-O: Building Structured World Models with Object-Centric Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:04.792172Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2507.03298"},"observation_digest":"sha256:3694cc28db814ba0c31bced656ed6ebdab5e65dd323ac20738d304b8d80c1368","observation_id":"1d1ea8cd-8ae3-4943-9981-d4c88f14cd1a","resolution":{"observed_at":"2026-08-06T20:19:04.792172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-06T15:25:15.139021Z","title":"Conditional object-centric learning from video.arXiv preprint arXiv:2111.12594, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16038","last_updated":"2025-07-21T20:11:57Z","snapshot_observed_at":"2026-08-09T11:29:48.423637Z","submitted_at":"2025-07-21T20:11:57Z","title":"Discovering and using Spelke segments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:15.139021Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2507.16038"},"observation_digest":"sha256:7611d123f41977e7b33321bd1786b89f70c12287864d404267fa8ad1cf13edd6","observation_id":"59372b0a-d681-41f7-b3ac-678cd33d9cb2","resolution":{"observed_at":"2026-08-06T15:25:15.139021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-04T19:24:39.845000Z","title":"Conditional object-centric learning from video.arXiv preprint arXiv:2111.12594, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09298","last_updated":"2025-09-11T09:42:32Z","snapshot_observed_at":"2026-08-04T19:24:37.804487Z","submitted_at":"2025-09-11T09:42:32Z","title":"Learning Object-Centric Representations in SAR Images with Multi-Level Feature Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:39.845000Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2509.09298"},"observation_digest":"sha256:27d863a08376794c4796dca336e26ad1805c1ef6b341257d26cfd51d3f2a247c","observation_id":"0adbfa82-dc8f-4b0a-aedd-5845e68ba72d","resolution":{"observed_at":"2026-08-04T19:24:39.845000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-03T07:04:44.994732Z","title":"Conditional object-centric learning from video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21416","last_updated":"2026-06-24T09:10:01Z","snapshot_observed_at":"2026-08-07T14:43:05.513047Z","submitted_at":"2026-01-29T08:55:53Z","title":"Spotlighting Task-Relevant Features: Object-Centric Representations for Better Generalization in Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T07:04:44.994732Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2601.21416"},"observation_digest":"sha256:a9c33923ffed9aa486189a2e10362c4de11b46c90e3fcad198e2912be0ef85c3","observation_id":"fa4af0f3-2d81-462b-9cf8-cd2d42f8805c","resolution":{"observed_at":"2026-08-03T07:04:44.994732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-08-02T22:41:09.572161Z","title":"F., Mahendran, A., Stone, A., Sabour, S., Heigold, G., Jonschkowski, R., Dosovitskiy, A., and Greff, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16229","last_updated":"2026-05-25T05:51:24Z","snapshot_observed_at":"2026-08-09T05:14:54.152823Z","submitted_at":"2026-02-18T07:08:14Z","title":"Factored Latent Action World Models","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-02T22:41:09.572161Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2602.16229"},"observation_digest":"sha256:3052153ed7e0497565f15cf1b7ba420c050cbd89017d2b7858f01f81e197ac7f","observation_id":"8d096808-926b-48ce-aaa3-caf2790043bc","resolution":{"observed_at":"2026-08-02T22:41:09.572161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-14T21:18:21.658797Z","title":"Conditional object- centric learning from video,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.14405","last_updated":"2026-05-31T17:15:12Z","snapshot_observed_at":"2026-08-03T05:56:17.489814Z","submitted_at":"2026-03-15T14:38:32Z","title":"ES-Merging: Biological MLLM Merging via Embedding Space Signals","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T21:18:21.658797Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2603.14405"},"observation_digest":"sha256:abf8d9263eb0c4914606c87e945b4f644cd65173192d52377e1a35f2e8106673","observation_id":"9a2cd549-db14-4483-b8b2-93cc3839be98","resolution":{"observed_at":"2026-07-14T21:18:21.658797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":"2111.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-03T10:48:02.798982Z","title":"Elsayed, Aravindh Mahendran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jonschkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"6598a2e4-f493-4bd9-8ec3-9044cee3db50","year":2022},"citing_paper":{"arxiv_id":"2604.09045","last_updated":"2026-04-10T07:07:10Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T07:07:10Z","title":"Scene-Agnostic Object-Centric Representation Learning for 3D Gaussian Splatting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:29:54.777890Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2604.09045"},"observation_digest":"sha256:73ef9bbcf93f7f8e234a009d1cdbe798801d514330dcb3f57d7ea4b8d28775c9","observation_id":"d721afb8-31a2-4ad6-a46c-bff25ae7ab7c","resolution":{"observed_at":"2026-05-11T06:41:33.148395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":"2111.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-03T10:48:02.798982Z","title":"Elsayed, Aravindh Mahendran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jonschkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"6598a2e4-f493-4bd9-8ec3-9044cee3db50","year":2022},"citing_paper":{"arxiv_id":"2604.17876","last_updated":"2026-04-20T06:38:01Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T06:38:01Z","title":"OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:33.134927Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2604.17876"},"observation_digest":"sha256:d6aafe50b11498469267ce9dd91748ae71c8f6dc2b139c5fd5d694d12df26aea","observation_id":"e040cfac-6f47-4570-bdee-0cfd7d33dcb7","resolution":{"observed_at":"2026-05-10T11:30:20.154986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":"2111.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-03T10:48:02.798982Z","title":"Elsayed, Aravindh Mahendran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jonschkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"6598a2e4-f493-4bd9-8ec3-9044cee3db50","year":2022},"citing_paper":{"arxiv_id":"2604.20925","last_updated":"2026-04-22T07:17:00Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T07:17:00Z","title":"Unsupervised Learning of Inter-Object Relationships via Group Homomorphism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T00:55:21.788068Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2604.20925"},"observation_digest":"sha256:754bd60152270c8a0ba16b44c24cd523488b87920b8bcc6330a12f39ab2d3263","observation_id":"66ec7806-7122-4851-86b2-3b3d5f12f504","resolution":{"observed_at":"2026-05-10T00:59:49.777721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":"2111.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-03T10:48:02.798982Z","title":"Elsayed, Aravindh Mahendran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jonschkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"6598a2e4-f493-4bd9-8ec3-9044cee3db50","year":2022},"citing_paper":{"arxiv_id":"2605.06481","last_updated":"2026-05-07T16:06:08Z","snapshot_observed_at":"2026-08-03T04:45:05.402667Z","submitted_at":"2026-05-07T16:06:08Z","title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T08:52:07.545191Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2605.06481"},"observation_digest":"sha256:8e372f2165a73286b3274e9cbdacacde7062a04a3d01791bc759771beba5879b","observation_id":"69441e14-2995-4cb1-a443-b0448de741b7","resolution":{"observed_at":"2026-05-11T20:31:11.286707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":"2111.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-03T10:48:02.798982Z","title":"Elsayed, Aravindh Mahendran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jonschkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"6598a2e4-f493-4bd9-8ec3-9044cee3db50","year":2022},"citing_paper":{"arxiv_id":"2605.07099","last_updated":"2026-05-28T05:55:06Z","snapshot_observed_at":"2026-08-01T10:10:03.290656Z","submitted_at":"2026-05-08T01:28:49Z","title":"InfoGeo: Information-Theoretic Object-Centric Learning for Cross-View Generalizable UAV Geo-Localization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-11T01:27:43.340357Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2605.07099"},"observation_digest":"sha256:492d8dcdaa00da218292445839fea88b08f947126262daa1043725f92a366537","observation_id":"b4a56c2b-066a-4367-a1fa-017e1e2b793d","resolution":{"observed_at":"2026-05-11T04:25:55.694262Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video","version":2},"cited_work":{"arxiv_id":"2111.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12594","snapshot_observed_at":"2026-07-03T10:48:02.798982Z","title":"Elsayed, Aravindh Mahendran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jonschkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"6598a2e4-f493-4bd9-8ec3-9044cee3db50","year":2022},"citing_paper":{"arxiv_id":"2606.12601","last_updated":"2026-06-10T19:00:47Z","snapshot_observed_at":"2026-08-06T04:22:12.456126Z","submitted_at":"2026-06-10T19:00:47Z","title":"Dual-State Slot Attention: Decoupling Appearance and Identity for Video Object-Centric Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T09:49:52.527042Z"},"links":{"cited_paper":"/paper/2111.12594","citing_paper":"/paper/2606.12601"},"observation_digest":"sha256:e765df0d4d428d4a62282bc26ca2d8d48584446f008eb560819a821a6cf78a1f","observation_id":"b8085708-8806-4ae1-a1e9-c0a623cd1b25","resolution":{"observed_at":"2026-07-03T10:48:02.800565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2111.12594/citation-record","integrity":"/paper/2111.12594/integrity","json":"/paper/2111.12594/citation-record.json","paper":"/paper/2111.12594"},"outbound":[],"paper":{"arxiv_id":"2111.12594","last_updated":"2022-03-15T09:26:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T21:44:10.341982Z","submitted_at":"2021-11-24T16:10:46Z","title":"Conditional Object-Centric Learning from Video"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2111.12594."}