{"as_of":"2026-08-10T05:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9972c780bcdb92eb81a7da6b325261451858214cc69f0a759bf7858437a4dfff","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:49:06.433344Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20601/citation-record","integrity":"/paper/2506.20601/integrity","json":"/paper/2506.20601/citation-record.json","paper":"/paper/2506.20601"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:48:56.034466Z","title":"Augmented reality meets computer vision: Efficient data generation for urban driving scenes.International Journal on Computer Vision (IJCV), 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.034466Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:7a72c429242505145a90b794e832ab39bb7691315582a0a9786b448f2627cf13","observation_id":"bdc588d8-eba1-4acb-90c8-5ead96a99bf7","resolution":{"observed_at":"2026-08-06T22:48:56.034466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:48:56.109342Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.109342Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:c9ba49ae4e3cf66481b9ccecad4c3703070758fdbf289862a604f4d1b3e853a1","observation_id":"6c0ce686-1fc4-4440-9273-079e55b61f08","resolution":{"observed_at":"2026-08-06T22:48:56.109342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09675","last_updated":"2024-02-05T01:59:31Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-02-05T01:59:31Z","title":"Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09675","snapshot_observed_at":"2026-08-06T22:48:56.325321Z","title":"Open-universe indoor scene generation using llm program synthesis and uncurated object databases.arXiv preprint arXiv:2403.09675, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.325321Z"},"links":{"cited_paper":"/paper/2403.09675","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2297947354a68307e3d36a107a98b8058cfde8d1cce09b8dc9a030364c2e65e9","observation_id":"a23ec9aa-a0d6-4663-a18f-89a11bf97dd5","resolution":{"observed_at":"2026-08-06T22:48:56.325321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:48:56.433828Z","title":"I-design: Personalized llm interior designer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.433828Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:d0f661deb636f80876bda8732f0a26538b9f6de0c4a027b7bf66554bc5a34f3d","observation_id":"1bb3a597-23de-44b0-a891-8dbf4f86a499","resolution":{"observed_at":"2026-08-06T22:48:56.433828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:48:56.569470Z","title":"Meshgen: Generating pbr textured mesh with render-enhanced auto-encoder and generative data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.569470Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:c4f3c53513346f6d1f50c8c03a4f3306fec85f7a9c7b1a5121c546f192b5c9c7","observation_id":"5d4dd171-2eb3-477c-8894-f23e63e2c3fe","resolution":{"observed_at":"2026-08-06T22:48:56.569470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:48:56.682731Z","title":"Procthor: Large-scale embodied ai using procedural generation.International Conference on Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.682731Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:d23b1ab1fdacb56b1de9203a81cb87f6772f308bcd767049bea3d4efe790840a","observation_id":"ef4f1bb2-8ffd-4076-80df-4e906229a473","resolution":{"observed_at":"2026-08-06T22:48:56.682731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:22.576543Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"cf7a3cf2-1b0a-4d4c-be8f-e0bd5e1f399a","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.851170Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:5d9f64ce6f92603a3188e2f55bc2558a34acc6d61a821099b103f44a9d77f24b","observation_id":"9c05f9c5-5028-4ebd-b67d-a6e6611bee77","resolution":{"observed_at":"2026-08-06T22:49:22.679269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18476","last_updated":"2025-03-25T02:21:09Z","snapshot_observed_at":"2026-08-07T16:41:53.929475Z","submitted_at":"2025-03-24T09:21:13Z","title":"Global-Local Tree Search in VLMs for 3D Indoor Scene Generation","version":2},"cited_work":{"arxiv_id":"2503.18476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.18476","snapshot_observed_at":"2026-08-06T22:49:07.308107Z","title":"Global-Local Tree Search in VLMs for 3D Indoor Scene Generation","venue":"cs.CV","work_id":"bbddcc58-5495-4bf2-b9ec-a9819bd40023","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:56.973998Z"},"links":{"cited_paper":"/paper/2503.18476","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:9d281c852c3469d615aff83acc64997a1cf354871e393b1fe0a100fe77467324","observation_id":"b4a49ec1-16c5-49d5-84bb-4ea6060af26a","resolution":{"observed_at":"2026-08-06T22:49:07.416388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:22.282419Z","title":"Layoutgpt: Compositional visual planning and generation with large language models.International Conference on Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"46b81805-b32d-42d8-9a7f-06a423a590b2","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.096462Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:504cd2e4282e97af3a568d1ad00ae4273f781b6d633fc2b2bac0976df9979d9e","observation_id":"feef66ba-7c26-419a-bac0-599015288700","resolution":{"observed_at":"2026-08-06T22:49:22.403723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:22.007700Z","title":"Anyhome: Open-vocabulary generation of structured and textured 3d homes","venue":null,"work_id":"b65d2000-a1a5-460a-b8ca-502fc4c40eef","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.253288Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4fb4a8015f9492087d84baa390ea0721c4f5e5921762d19311498018855f3de4","observation_id":"ecdce60d-aa25-493c-8423-8ce2e8341c8a","resolution":{"observed_at":"2026-08-06T22:49:22.109966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:48:57.384307Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.384307Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4783210cd51725b4c14258e0671c0394c80efbfa74a1c6507074dccefdf2997b","observation_id":"7cb0f7e7-7b8c-4138-bfc3-f472b9537ac9","resolution":{"observed_at":"2026-08-06T22:48:57.384307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10289","last_updated":"2025-07-30T03:50:07Z","snapshot_observed_at":"2026-08-07T17:07:21.152948Z","submitted_at":"2025-03-13T11:57:30Z","title":"MaterialMVP: Illumination-Invariant Material Generation via Multi-view PBR Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10289","snapshot_observed_at":"2026-08-06T22:48:57.574455Z","title":"Materialmvp: Illumination-invariant material generation via multi-view pbr diffusion.arXiv preprint arXiv:2503.10289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.574455Z"},"links":{"cited_paper":"/paper/2503.10289","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:25b4daa8f46df133bc078f0897b74bc5ed1e34bacc86cc748de9969a9a00ddea","observation_id":"4b4cf6d6-f117-4f1d-ba02-2685b950ea19","resolution":{"observed_at":"2026-08-06T22:48:57.574455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T22:48:57.707381Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.707381Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:a6cc02d6dc41dddd0009f217e60b24b2bc409028b3e12eb14de2e719a22f7740","observation_id":"78f124c1-e2d9-43e5-9c03-bcadbc90086f","resolution":{"observed_at":"2026-08-06T22:48:57.707381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:21.691280Z","title":"Video diffusion models.International Conference on Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":"c8e5f217-0c3d-44df-932d-57bb91490253","year":2022},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.877525Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:a3808750929fbbbfdeec3f77ac0308a24198fb7d9823f520c37506b6387d9c90","observation_id":"3cff6095-1fba-404a-a0ac-36b51fb79992","resolution":{"observed_at":"2026-08-06T22:49:21.819721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:21.455252Z","title":"Text2room: Extracting textured 3d meshes from 2d text-to-image models","venue":null,"work_id":"883cfc11-e948-46ca-b9de-ecd0acba911a","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:57.986754Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:428418e3a8c8c684dddd06bb6c0a61f829d81257b4c83352f9fcc0292a29b3e4","observation_id":"00a7e75a-6f1c-4fd5-9c50-c03864799e7c","resolution":{"observed_at":"2026-08-06T22:49:21.568856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:21.223049Z","title":"Material anything: Generating materials for any 3d object via diffusion","venue":null,"work_id":"30532953-32ca-4720-b0f3-d01990d70865","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.118324Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:e75f9ba1d2c4ab1b51895a4eabf8bebc86eea2042c6579a6fa9e2a7a856c45f9","observation_id":"a9680f05-bb78-44e7-a071-7ef28d9cf7f8","resolution":{"observed_at":"2026-08-06T22:49:21.334865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:20.972835Z","title":"Midi: Multi-instance diffusion for single image to 3d scene generation","venue":null,"work_id":"2b668e8b-43f9-4b5c-9fa3-40dc55f141e1","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.214384Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:9394fa2939de540962532afb4ce66bc06ab95142865369edd7d5875249805a99","observation_id":"ee439aa8-fae9-441a-8fc9-ccdef25e4653","resolution":{"observed_at":"2026-08-06T22:49:21.045100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:48:58.317839Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.317839Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:1f95d8e2d2aa697736343b23b4974bde2f6f261733957bf0b8adf9c0c50706c5","observation_id":"d16667b1-3237-4af7-8c36-64a367edbc0e","resolution":{"observed_at":"2026-08-06T22:48:58.317839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-06T22:48:58.420289Z","title":"How far is video generation from world model: A physical law perspective.arXiv preprint arXiv:2411.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.420289Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:3f2d51d2671e2a95acea91104dbe5a611efc47b4a7861f810475aeaf40e0ecf6","observation_id":"078e3dd9-fa81-4640-97a6-aaab2b6a09c3","resolution":{"observed_at":"2026-08-06T22:48:58.420289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:20.713021Z","title":"Repurposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"ffff3b1a-0e96-4d06-90e3-ab442cea1970","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.524678Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4f0a1bf674b820a123f84b6f80af49ec7e5d0e65f20ace8a28efe0ba5345de5b","observation_id":"67ec5481-40f2-4565-8a04-b6c8369ae152","resolution":{"observed_at":"2026-08-06T22:49:20.852164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:20.411821Z","title":"A new measure of rank correlation.Biometrika, 1938","venue":null,"work_id":"3caadc6c-510b-46fd-87e5-5c4eb361b15e","year":1938},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.635530Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:bec7ee17a173432e6b4dbe83ef671c622bfa1fdd89918a253d9baa4e3f70ea11","observation_id":"2c8933bd-b7ee-41cc-9dd6-e47e2ff07113","resolution":{"observed_at":"2026-08-06T22:49:20.531539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:20.099672Z","title":"Kling, 2025.https://klingai.com/global/","venue":null,"work_id":"4d8ecc26-0f4c-4143-9c46-a72094856a62","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.758859Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:fe8e4ff805c7d177dfe9fd08cd199ac995c7d15ba64345b060ed1a6a3924b6f5","observation_id":"4d293d99-2b30-4bc8-b891-6b735ca9077c","resolution":{"observed_at":"2026-08-06T22:49:20.240539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:19.818046Z","title":"Scenecraft: automating interactive narrative scene generation in digital games with large language models","venue":null,"work_id":"15ba0b3a-04dc-49c0-beba-fec6ed0ca2cb","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:58.912878Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2b4bff5577c8c70b1e25ab67f3ea023b48a35f481debea97f5c26d8d3dd51c98","observation_id":"6d14f9a5-8818-4ef0-87fe-b72cc2882aa8","resolution":{"observed_at":"2026-08-06T22:49:19.971505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:19.522681Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":"1cb93511-6211-4773-aa9f-60b820987ea5","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.036279Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:eeaa4aaf05647c568a8e0f2161840bffba8072793e4e1197643abb1848dd30bd","observation_id":"7141c404-6bc3-48c1-b05a-402fdbe6a5c0","resolution":{"observed_at":"2026-08-06T22:49:19.675974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:19.233189Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"a5bee664-f31a-4b2c-af46-954d722b3861","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.156100Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:8551ad33d125d84e46bcfefe29a2e299401e5e53997a76489e00aa98892587ea","observation_id":"4ba632b1-4fbf-47e6-9a0f-c3944096c9cd","resolution":{"observed_at":"2026-08-06T22:49:19.356793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-09T23:28:59.299375Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T22:48:59.227544Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.227544Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:c1bf341d014b930e7bb0c7f900708337bcd94ba9cb0247716d6fc3e105564ced","observation_id":"d1072fe8-b9aa-4365-839f-d2aebb0c6b62","resolution":{"observed_at":"2026-08-06T22:48:59.227544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:18.956314Z","title":"Instructscene: Instruction-driven 3d indoor scene synthesis with semantic graph prior","venue":null,"work_id":"f693b8db-8d6b-4b0f-8387-d77d1d6a6e01","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.327193Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:214ef66f43a9d4df1ca9e6d0fe027de99c7e7abc1283271bd2fc2b8782130e36","observation_id":"59efb5a2-0ad3-44cb-ab18-770ff980b27c","resolution":{"observed_at":"2026-08-06T22:49:19.115134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15808","last_updated":"2023-05-25T07:43:39Z","snapshot_observed_at":"2026-08-09T03:58:34.874310Z","submitted_at":"2023-05-25T07:43:39Z","title":"Towards Language-guided Interactive 3D Generation: LLMs as Layout Interpreter with Generative Feedback","version":1},"cited_work":{"arxiv_id":"2305.15808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15808","snapshot_observed_at":"2026-08-06T22:49:06.940238Z","title":"Towards Language-guided Interactive 3D Generation: LLMs as Layout Interpreter with Generative Feedback","venue":"cs.CV","work_id":"11316287-a0cc-457a-9e57-916382cca270","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.441221Z"},"links":{"cited_paper":"/paper/2305.15808","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:fa1d658077873ca79108e2a6ecc293f674ab91bbb759a35bcbec4310cea2f640","observation_id":"4d58fdb4-733c-43ba-ad29-8219903d0c94","resolution":{"observed_at":"2026-08-06T22:49:07.082148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:18.628358Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":"87a4a874-8b0c-494a-a28e-84515e0dd32f","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.588234Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:e8db08ae152b221e7659cba35d32d8c533b3fa9fccdc75f717534e2495927c8d","observation_id":"9cd6a9d2-61cd-4bec-b331-04d945f596ba","resolution":{"observed_at":"2026-08-06T22:49:18.780712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-07T15:56:18.164743Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-06T22:48:59.729438Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation.arXiv preprint arXiv:2505.02836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.729438Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:e41f4cfe3353a7c4e8508604a974a2838a2be21a41e9828fd550fe8897d0b045","observation_id":"f97302bc-978c-48e6-a955-c770b23c387b","resolution":{"observed_at":"2026-08-06T22:48:59.729438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:18.262708Z","title":"Visual instruction tuning.International Conference on Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"44bf98b7-55e0-43cc-a2ed-a68784b8d73e","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.883976Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:0afecc88f43034adf8b567509c16ebc75a5c0816acc239c7d08c807921113670","observation_id":"096379e4-aa1a-445b-b605-635ee1f33d39","resolution":{"observed_at":"2026-08-06T22:49:18.438665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:18.043399Z","title":"Dream machine, 2024.https://lumalabs.ai/dream-machine","venue":null,"work_id":"4279399f-08d0-4b8c-979f-0ad2971db0bc","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.996398Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:914a8a29eebf52bc10401327bd58affb8e9d8eb236e5003a2ad6ddf8534456f5","observation_id":"6774bcdf-5cbf-4eac-9975-b2bfe16c0319","resolution":{"observed_at":"2026-08-06T22:49:18.149801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:00.135090Z","title":"Mimicgen: A data generation system for scalable robot learning using human demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.135090Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:fd253730739125063c5d8ccff1b84aa4c50ee18a26a369649ea18cb39dbd394e","observation_id":"e592531a-c502-4c4c-9d8b-7e7fee694cc7","resolution":{"observed_at":"2026-08-06T22:49:00.135090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:17.729617Z","title":"Cosmos, 2024.https://www.nvidia.com/en-us/ai/cosmos/","venue":null,"work_id":"6b9c0d0c-866a-4d9d-8373-d844b8304b66","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.295561Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:1b871586eaf877d2c53b347eb686828b8a95ebd30672156616eec171019cbefa","observation_id":"295ddaec-02f9-4422-97f0-a26d71cc39a1","resolution":{"observed_at":"2026-08-06T22:49:17.856800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:17.447720Z","title":"Global structure-from-motion revisited","venue":null,"work_id":"0a423fc8-c17f-4fb1-a1f9-9a4f131061d0","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.419618Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:153b2de6c3cc4367306c101c83946e5f95567266e17335366e9726b499266235","observation_id":"3e1c6d8c-b28b-42b5-9554-3b4058f97021","resolution":{"observed_at":"2026-08-06T22:49:17.552287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:00.559290Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.559290Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:589f74823d8a658ee007026ef90715d74392ab5ba9da943259ce43ce27b52960","observation_id":"b00247bf-c869-472b-ab9c-02a3701d902d","resolution":{"observed_at":"2026-08-06T22:49:00.559290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:17.129481Z","title":"Unidepth: Universal monocular metric depth estimation","venue":null,"work_id":"63158f88-d4d1-4137-a723-1f20a4a6206f","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.674905Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2366727e78af705cd99a25b59bba441a08fda9685186001b9dc71caa9300dd7c","observation_id":"ca4999cb-614a-40ac-b9f8-3c69bffd5235","resolution":{"observed_at":"2026-08-06T22:49:17.262660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T22:49:00.817729Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.817729Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:e0b82472a0ccf392dc93cf11d5dffec09127b4aa85f671e695bf67d186bffa11","observation_id":"69d131c1-9a2f-4024-931c-00a31e58f5e8","resolution":{"observed_at":"2026-08-06T22:49:00.817729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:00.962603Z","title":"Hsm: Hierarchical scene motifs for multi-scale indoor scene generation.arXiv preprint arXiv:2503.16848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:00.962603Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:34ec8e551e7be2806abe5b15e5188303adbf8dce8775510c7e0f03858710ec25","observation_id":"42dae668-ca86-4684-8a33-165a554bc651","resolution":{"observed_at":"2026-08-06T22:49:00.962603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:01.094481Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.094481Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:72659e84537d4f2afa19809873c4a9d190ae305e885db1056d6fcea8da5d1490","observation_id":"2b40e8a6-715c-4530-8ba2-fb2be1579047","resolution":{"observed_at":"2026-08-06T22:49:01.094481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T22:49:01.255095Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.255095Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:7e0406ded783dc466b305373ffd578a906e8d2f1e802cac13c76900741fc8bf4","observation_id":"c5265f9a-dae3-45be-8446-8f307fc5da0b","resolution":{"observed_at":"2026-08-06T22:49:01.255095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.839167Z","title":"Gen 3, 2024.https://runwayml.com/research/introducing-gen-3-alpha","venue":null,"work_id":"424b10c4-a8dd-4873-83d8-e513f5018b6a","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.452576Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:dac60ca0639233b2e650e45f01749596adefdd547e5400e0764dcefeb8dfedc0","observation_id":"7e69a5c9-7c99-463c-a1ea-ead24b717ccc","resolution":{"observed_at":"2026-08-06T22:49:16.976271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.565288Z","title":"Temporal generative adversarial nets with singular value clipping","venue":null,"work_id":"f9d1d117-0ba8-45e1-822f-8c306a1e0436","year":2017},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.582860Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2d64985e1ff218b5b92c7c5853c272064f06651f0c1f5c029e58b6a11eb6f497","observation_id":"81d745df-128b-4d59-a902-398fba294688","resolution":{"observed_at":"2026-08-06T22:49:16.774408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.273381Z","title":"Structure-from-motion revisited","venue":null,"work_id":"6d644d70-b3d2-448e-b87d-3ba387ac5f65","year":2016},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.723523Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:0cdecbb6bf4d2a798192dc3a20a014422468a83c862e221c2180799782f92692","observation_id":"89e92793-3925-4390-b103-ad26a0591667","resolution":{"observed_at":"2026-08-06T22:49:16.410380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:01.844001Z","title":"Pixelwise view selection for unstructured multi-view stereo","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.844001Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:c475f5a3b493f0fbc4d43d97f18b18caedad351f0eccb8b67cdce0e785d560b0","observation_id":"8d5c0edc-ea20-4a5a-a728-4abda4406df2","resolution":{"observed_at":"2026-08-06T22:49:01.844001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.950197Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":"c628a82f-80e5-4fba-b768-0d41ae1cbc29","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:01.963818Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:c2eee80ab680657f8474f50b1f5a21622d2a0b323bebe75337eafdb0039bd888","observation_id":"789763b4-cbdb-47ad-a6b8-4e1174f40558","resolution":{"observed_at":"2026-08-06T22:49:16.118056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.587665Z","title":"Controlroom3d: Room generation using semantic proxy rooms","venue":null,"work_id":"94649955-8e65-4cce-a375-32377cf879cb","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.073504Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2f22bd114586fd4399fd95d943beb1028b1f847de1862b13b53de30350b01882","observation_id":"7fc4bf38-d6d7-4613-ab77-9aa48e64cb9c","resolution":{"observed_at":"2026-08-06T22:49:15.738656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-10T01:07:11.269697Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T22:49:02.194039Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models.arXiv preprint arXiv:2412.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.194039Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:65c022c3cb2f33573288f0114c1f8b6b5d08d57d646fe06b7d32bbe1ea76d5e4","observation_id":"ffaa7004-b558-46a1-8dd9-ec650a2b8439","resolution":{"observed_at":"2026-08-06T22:49:02.194039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.243516Z","title":"Neuralrecon: Real-time coherent 3d reconstruction from monocular video","venue":null,"work_id":"a2ef588a-175f-4705-8e19-f12664c026d4","year":2021},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.368698Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:ebf4a4c526b0d6fc3e9f3b7df54ab6ae9b14396a2dce2e295a65fe4b919f19e7","observation_id":"b84f749e-fb70-46cb-8c54-c7f92a46caf8","resolution":{"observed_at":"2026-08-06T22:49:15.360158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.891041Z","title":"Retargetable ar: Context-aware aug- mented reality in indoor scenes based on 3d scene graph","venue":null,"work_id":"3b83b0fa-7c8f-4e7d-8bf5-bb935be2258c","year":2020},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.516076Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4451750328fe3b12d6d226af03888e4968bdc369f618766df4763d06d4702863","observation_id":"086cb0cb-ae5a-41e2-a28a-a526b7fd10ed","resolution":{"observed_at":"2026-08-06T22:49:15.023686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.515419Z","title":"Diffuscene: Denoising diffusion models for generative indoor scene synthesis","venue":null,"work_id":"9526c7ff-0a20-4cba-871d-697e1360a444","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.639098Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:40ab1f139f6175a74ddf471287a845cbbe6e75ad9c1e188cc8f29bc765d233b7","observation_id":"15581ad0-f09c-490a-8f83-0bf3bc29b6dc","resolution":{"observed_at":"2026-08-06T22:49:14.671189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.149904Z","title":"Mv-dust3r+: Single-stage scene reconstruction from sparse views in 2 seconds","venue":null,"work_id":"bb835c3c-a206-42bd-a5af-97ae614c01c5","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.747210Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:b79384eb9ed4c28b32e4737c9c1990832217edaf48c24c0e58d15cc2ea5d4a94","observation_id":"412170fa-a4a6-4c48-a97f-e1af8e75ce5e","resolution":{"observed_at":"2026-08-06T22:49:14.292896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:49:02.887877Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.887877Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:66859a3dda91f93741fd3130e0f74f151634ceeecd0f974d914f57dbb924e970","observation_id":"b2ac455d-8a75-4cde-92bf-4e366d6ead53","resolution":{"observed_at":"2026-08-06T22:49:02.887877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:49:03.027631Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.027631Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:43b59e682279f6c50e6128abc20d36fa1fc2c2b6a3cf44e099f883315668ed42","observation_id":"5d41ce81-9ff0-4809-94c6-83bb2827a7e0","resolution":{"observed_at":"2026-08-06T22:49:03.027631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:49:03.173489Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.173489Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:31fee948ac255a59cecb6f5bdee420c303d2c50deebb60abbfebbb7c7009e412","observation_id":"79c1c8c8-a465-43f7-9129-6a2ecadb1a76","resolution":{"observed_at":"2026-08-06T22:49:03.173489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.847435Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"e503040e-2861-4fe7-b7d3-572398b3500e","year":2018},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.287796Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:eb0adc080bd79e4f325a22ccc578e944a88f161dd7f3deafe431bf7cd7482471","observation_id":"c2ab6f0c-d7d5-41e9-92c9-f6993f74b811","resolution":{"observed_at":"2026-08-06T22:49:13.997067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16061","last_updated":"2024-08-28T18:01:00Z","snapshot_observed_at":"2026-08-06T09:17:41.634492Z","submitted_at":"2024-08-28T18:01:00Z","title":"3D Reconstruction with Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16061","snapshot_observed_at":"2026-08-06T22:49:03.416261Z","title":"3d reconstruction with spatial memory.arXiv preprint arXiv:2408.16061, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.416261Z"},"links":{"cited_paper":"/paper/2408.16061","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:a9c61b04e88131c1d1510d539b6293371bd83002fd57c8da03e9c82058e1ae7b","observation_id":"25e8da4d-53fb-41ee-8ed8-14c1cb5d1f42","resolution":{"observed_at":"2026-08-06T22:49:03.416261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.482042Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":"94083418-d2db-4f85-a1c4-2025e7b4ab9f","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.528516Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:cb60113d745be9983bc0c7278c5ede0874215ae0971297fdf52539e956771406","observation_id":"0c142265-b44a-45e5-b3ae-9a325d739254","resolution":{"observed_at":"2026-08-06T22:49:13.689544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.057528Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"4429b649-dfd8-4b65-bed0-31cede3d21e3","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.673884Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:a6b2d6d790b52c8468e66ccb2abe394ed374b389f357a422eef765983dbe7062","observation_id":"1f456c54-5401-43d5-8b1f-f57ab4488a20","resolution":{"observed_at":"2026-08-06T22:49:13.250785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.761870Z","title":"Architect: Generating vivid and interactive 3d scenes with hierarchical 2d inpainting.International Conference on Neural Information Processing Systems (NeurIPS), 2025","venue":null,"work_id":"56f2d758-edf2-47b2-ba0e-d2f16cd3e1a3","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.792935Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4e7cfa577b6b8d6f8045943f6730aa5a734e6addc0ca0abe564d09591546775f","observation_id":"96a772b7-3716-4c54-84a7-64f6d6cb3b80","resolution":{"observed_at":"2026-08-06T22:49:12.902837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.469052Z","title":"Gpt-4v (ision) is a human-aligned evaluator for text-to-3d generation","venue":null,"work_id":"a2358622-1f56-4458-a82e-b14245762118","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:03.921117Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:bda33dcb573e2ee9c3ab26edc616209570806d91b5cc5906dc5666407e98d14e","observation_id":"3cc91a60-96f1-4f1b-a8a4-62860ef561d0","resolution":{"observed_at":"2026-08-06T22:49:12.607199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13439","last_updated":"2025-03-17T17:59:01Z","snapshot_observed_at":"2026-08-08T18:12:15.069203Z","submitted_at":"2025-03-17T17:59:01Z","title":"Amodal3R: Amodal 3D Reconstruction from Occluded 2D Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13439","snapshot_observed_at":"2026-08-06T22:49:04.080421Z","title":"Amodal3r: Amodal 3d reconstruction from occluded 2d images.arXiv preprint arXiv:2503.13439, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.080421Z"},"links":{"cited_paper":"/paper/2503.13439","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:461b17bfa613565b4154b849170fdf4b0ba35b6eb885c1d58f81a8fc863b9665","observation_id":"267e7927-cf2e-4a8b-8803-652185a80bdb","resolution":{"observed_at":"2026-08-06T22:49:04.080421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01506","last_updated":"2025-05-30T11:13:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-02T13:58:38Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01506","snapshot_observed_at":"2026-08-06T22:49:04.242789Z","title":"Structured 3d latents for scalable and versatile 3d generation.arXiv preprint arXiv:2412.01506, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.242789Z"},"links":{"cited_paper":"/paper/2412.01506","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:ba42e5ad7c79abb533e1ac9a20ead6784e09ebdf4c261ec838e7e4c54afc1e82","observation_id":"953f9aa6-e44b-4d39-ad75-7e537b631fd2","resolution":{"observed_at":"2026-08-06T22:49:04.242789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.163436Z","title":"Fast3r: Towards 3d reconstruction of 1000+ images in one forward pass","venue":null,"work_id":"b70346ed-bea9-43d1-913a-4fb3cf94b27e","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.360714Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:f71992c0afb80dd426de5551a340ff038151bb444c6234b9d4ba727735e040b0","observation_id":"b88f15fa-60cc-4598-b9b8-4c66dd999aa3","resolution":{"observed_at":"2026-08-06T22:49:12.305027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.849061Z","title":"Diffusion probabilistic modeling for video genera- tion.Entropy, 2023","venue":null,"work_id":"18d86e2e-6ba7-4701-95c1-8654cedac980","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.474716Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:f36acf992bd443db4ed0500a10b3d49416c0be1cf2e30941f00337e840500eb7","observation_id":"daeac370-867f-483e-a321-6a35fedc94de","resolution":{"observed_at":"2026-08-06T22:49:12.034297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02293","last_updated":"2025-01-23T09:51:37Z","snapshot_observed_at":"2026-08-06T14:12:36.594618Z","submitted_at":"2024-11-04T17:21:42Z","title":"Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02293","snapshot_observed_at":"2026-08-06T22:49:04.592991Z","title":"Hunyuan3d 1.0: A unified framework for text-to-3d and image-to-3d generation.arXiv preprint arXiv:2411.02293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.592991Z"},"links":{"cited_paper":"/paper/2411.02293","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:7c87a049996762a84054381ba8dcf238f563974afcf90289b4d3e88abe0c70ff","observation_id":"ac31c551-4d32-44eb-90ae-00ab253b091e","resolution":{"observed_at":"2026-08-06T22:49:04.592991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.540428Z","title":"Physcene: Physically interactable 3d scene synthesis for embodied ai","venue":null,"work_id":"dc5dc61c-ce04-4f1f-be8e-c94ffa68786b","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.724919Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2c5d6d53eeb782767378f77b5fc11d90822dc0997eb47d2c60ccb2a799c3da3f","observation_id":"3db59cb8-b271-4f4c-ba32-e6c7e1eba7d2","resolution":{"observed_at":"2026-08-06T22:49:11.719868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03866","last_updated":"2024-06-06T08:53:01Z","snapshot_observed_at":"2026-07-06T18:26:19.664486Z","submitted_at":"2024-06-06T08:53:01Z","title":"LLplace: The 3D Indoor Scene Layout Generation and Editing via Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03866","snapshot_observed_at":"2026-08-06T22:49:04.838427Z","title":"Llplace: The 3d indoor scene layout generation and editing via large language model.arXiv preprint arXiv:2406.03866, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.838427Z"},"links":{"cited_paper":"/paper/2406.03866","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:0431ddaae0460a01b63da8cd0ece14d0d5f1186ff90bf58d034e9dcf0fd7eb17","observation_id":"dc169188-0774-49f1-8a28-75310eaaa968","resolution":{"observed_at":"2026-08-06T22:49:04.838427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.269335Z","title":"Holodeck: Language guided generation of 3d embodied ai environments","venue":null,"work_id":"4c6ee990-a620-4c0c-afa9-0d9957e33ef2","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:04.950955Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:294d015607590f618e0f90d14992be9758452f3745699b06fe2e9d15954bf912","observation_id":"6c00a28b-971f-4fc7-8231-84e460b7805b","resolution":{"observed_at":"2026-08-06T22:49:11.385857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:10.969399Z","title":"Mmgdreamer: Mixed-modality graph for geometry-controllable 3d indoor scene generation","venue":null,"work_id":"5816dc11-4432-406e-8cec-c349a0c9189c","year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.048179Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:2a7435e9730a65feea151d70242cb1e00a9d04e6cf21304b5c1e3cfb5b2777e5","observation_id":"268c505b-4a19-4435-86ff-a130797b150f","resolution":{"observed_at":"2026-08-06T22:49:11.143907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:10.704126Z","title":"Commonscenes: Generating commonsense 3d indoor scenes with scene graphs","venue":null,"work_id":"9e49ceb3-ab3d-4091-afef-146343964947","year":2023},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.114934Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:38e54e26f00982bf34f57b7f93eca601a96b0711bd133e7cccd6926a9d0d1432","observation_id":"160a7dba-0b69-4ef1-b15d-f6f88ed94274","resolution":{"observed_at":"2026-08-06T22:49:10.828072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:10.416554Z","title":"Sg-bot: Object rearrangement via coarse-to-fine robotic imagination on scene graphs","venue":null,"work_id":"636d374a-023c-4036-bdd4-afcae352299d","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.197964Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:1611cb484d051114ecc5b290cc759e061c2bbc124d39316ae52b4bff24fa0dfc","observation_id":"16f1fc80-347d-499c-b0c5-30549f0ee919","resolution":{"observed_at":"2026-08-06T22:49:10.523588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:10.117585Z","title":"Echoscene: Indoor scene generation via information echo over scene graph diffusion","venue":null,"work_id":"70b7e3ea-4692-4370-a2b1-0e9c2dbfa7fd","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.283459Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:c436a73eab62d7eb1253ce2ff5bee87ca98abc8638151fcbc2f71d1f13ec97a0","observation_id":"62ce0091-5e36-4a11-b0cb-8ecf6ee4d1dc","resolution":{"observed_at":"2026-08-06T22:49:10.260467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:09.776025Z","title":"Fast and robust iterative closest point.Transactions on Pattern Analysis and Machine Intelligence (PAMI), 2021","venue":null,"work_id":"bccc2dbf-4dfd-410f-824e-23b0dd29d904","year":2021},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.360049Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:8f4a988023404227c9cc807d31a6b6477c3cf28bd69bd6d9506640e7df7a5a0f","observation_id":"0922fa1d-eaa2-4702-a525-287dbaba9062","resolution":{"observed_at":"2026-08-06T22:49:09.952923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:09.406822Z","title":"Dreammat: High-quality pbr material generation with geometry-and light-aware diffusion models.ACM Transactions on Graphics (TOG), 2024","venue":null,"work_id":"2b329620-ad0f-4336-be33-a8b049a9eedb","year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.427830Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:14fa896706e579d38cd3d0abd1bf0741052a8cd6edfb707b6dca5bbd8f432590","observation_id":"6f03eb44-d4e8-4f61-adb6-16029f73e40c","resolution":{"observed_at":"2026-08-06T22:49:09.580841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12202","last_updated":"2026-05-14T15:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-21T15:16:54Z","title":"Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12202","snapshot_observed_at":"2026-08-06T22:49:05.537270Z","title":"ground” for outdoor scenes or “floor","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.537270Z"},"links":{"cited_paper":"/paper/2501.12202","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:51372d4af9e4fd2b8230ec73869acc62199b517b749d544830e6d65a3d3029bf","observation_id":"f7278319-137d-4168-a834-36f490f26e3b","resolution":{"observed_at":"2026-08-06T22:49:05.537270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:09.141498Z","title":"A bedroom with a large bed, two nightstands, a floor lamp, a wardrobe, and a big window","venue":null,"work_id":"ef268b27-e6af-476c-885b-beaa2627068b","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.600034Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:b47f9cf4049c25af5f03d6f2720eca0a4b2c1666379118c4f92c6adf42985651","observation_id":"664c9b8d-1ed5-4aa3-827f-5f4adb60627b","resolution":{"observed_at":"2026-08-06T22:49:09.281404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:08.531332Z","title":"realistic","venue":null,"work_id":"bae0a629-9271-431e-8380-941144dc1791","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.855801Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4d7a9c1f15ff859691697e69a90c09f4ea6075ac1cfe4adae250542e5e90d246","observation_id":"08229b1f-c9b6-4f00-b24b-2313b132b9bf","resolution":{"observed_at":"2026-08-06T22:49:08.607372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:08.308042Z","title":null,"venue":null,"work_id":"5b59caf2-c3d6-49c0-8d78-45ad9d3fcea8","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.931372Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:82303c8c7b575cf4cedd3d1ec8747d49ee85794c5d766585c254679207d4b132","observation_id":"6334d86f-3f18-4d4f-b935-3219c1f75f4d","resolution":{"observed_at":"2026-08-06T22:49:08.417324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:07.987895Z","title":null,"venue":null,"work_id":"d6a0cae0-42e2-4c70-b7c4-c33b2b59c3f1","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:05.991925Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:696d5c6a42325b00245d5b3340994c19de8f128f4146bdc57368e2d700a0ddc4","observation_id":"5b21a4d5-b83e-47ec-be48-517a76730fd3","resolution":{"observed_at":"2026-08-06T22:49:08.143616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:07.762434Z","title":"Final answer: The first one: x x x The second one: x x x The third one: x x x (where x denotes ranks 1–3) (Please strictly follow the format above","venue":null,"work_id":"f02fb3b7-bd73-41ae-9d92-3d2660b4a5a5","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:06.094151Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:ee2c028c4b9c57ef88b29e604328fac08eaaf88bb2c7c3044508efc8d6056fda","observation_id":"ff73c05a-d407-4b98-8a60-9cb47410ace4","resolution":{"observed_at":"2026-08-06T22:49:07.871415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:08.944729Z","title":null,"venue":null,"work_id":"6ea4f752-d23e-4226-8fb1-31385ac671f7","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:06.231711Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:9e9742e8ca9b0596081639d816115aabe93cbd5e88cb5addf2433dfcb86af555","observation_id":"2e09f92e-d940-4554-8091-04fb0df7f51c","resolution":{"observed_at":"2026-08-06T22:49:09.032891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:08.690007Z","title":"Consider object positions, orientations, and user convenience","venue":null,"work_id":"7fcae784-280d-4a38-a9c5-4cf577588934","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:06.317452Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:4f389bf41019e26d01ccbf391c22ed0c75c0a8e3a0f5eef21bfb36e1d19730b5","observation_id":"ab8ab2b6-81c9-421b-9e28-9815bbcd9c88","resolution":{"observed_at":"2026-08-06T22:49:08.822295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:07.573972Z","title":null,"venue":null,"work_id":"36947d4d-7fbf-44bf-a398-b325a48ca315","year":null},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:06.433344Z"},"links":{"citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:f98bb4bae97cbc9f3e88d52a9ed4ef1892a3b5dad02aff178553210b6a6ad7de","observation_id":"84953c7e-408a-4611-9eff-c406841802cc","resolution":{"observed_at":"2026-08-06T22:49:07.649512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2506.20601."}