{"as_of":"2026-08-21T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce688ec04c6c53384447b2bc85910ba20a0b75800c0036cba7cae66272d8fd42","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:09:30.946930Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:11:00.840340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:56:34.752902Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"cited_work":{"arxiv_id":"2507.06484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06484","snapshot_observed_at":"2026-07-02T03:56:34.752902Z","title":"3d-generalist: Self-improving vision-language-action models for crafting 3d worlds","venue":null,"work_id":"6158aec4-fec5-421f-af05-4eed17f71d07","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-19T06:50:20.229655Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2507.06484","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:4df6cf0f0da59e07a07f8beaef4b1f3d88ec1d7cfa9f2873a31eeabc8a490d01","observation_id":"f4882744-93ec-4c58-b0f6-95ce98fe92b5","resolution":{"observed_at":"2026-05-16T13:51:00.591108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"cited_work":{"arxiv_id":"2507.06484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06484","snapshot_observed_at":"2026-07-02T03:56:34.752902Z","title":"3d-generalist: Self-improving vision-language-action models for crafting 3d worlds","venue":null,"work_id":"6158aec4-fec5-421f-af05-4eed17f71d07","year":2025},"citing_paper":{"arxiv_id":"2604.03315","last_updated":"2026-04-01T07:24:31Z","snapshot_observed_at":"2026-08-18T03:35:37.219460Z","submitted_at":"2026-04-01T07:24:31Z","title":"StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T23:24:26.557732Z"},"links":{"cited_paper":"/paper/2507.06484","citing_paper":"/paper/2604.03315"},"observation_digest":"sha256:523e89d8e216b3089f1adfd2d45178a54f639cffea5652c42001d36b49ba598a","observation_id":"7b8f4dcd-56b7-4aaa-859a-2ba50a53d977","resolution":{"observed_at":"2026-05-13T23:28:26.411745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"cited_work":{"arxiv_id":"2507.06484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06484","snapshot_observed_at":"2026-07-02T03:56:34.752902Z","title":"3d-generalist: Self-improving vision-language-action models for crafting 3d worlds","venue":null,"work_id":"6158aec4-fec5-421f-af05-4eed17f71d07","year":2025},"citing_paper":{"arxiv_id":"2605.18451","last_updated":"2026-05-18T14:18:36Z","snapshot_observed_at":"2026-08-15T02:08:02.817439Z","submitted_at":"2026-05-18T14:18:36Z","title":"Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T11:49:53.113415Z"},"links":{"cited_paper":"/paper/2507.06484","citing_paper":"/paper/2605.18451"},"observation_digest":"sha256:7ad82fe779d1c9f046d999c94c0db75e351675cd7ae095c483c50b234ca3b711","observation_id":"ce742356-f2b1-44fe-a795-630313bf90dc","resolution":{"observed_at":"2026-05-20T11:53:14.996405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"cited_work":{"arxiv_id":"2507.06484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06484","snapshot_observed_at":"2026-07-02T03:56:34.752902Z","title":"3d-generalist: Self-improving vision-language-action models for crafting 3d worlds","venue":null,"work_id":"6158aec4-fec5-421f-af05-4eed17f71d07","year":2025},"citing_paper":{"arxiv_id":"2605.30819","last_updated":"2026-05-29T04:10:15Z","snapshot_observed_at":"2026-08-17T16:36:15.441105Z","submitted_at":"2026-05-29T04:10:15Z","title":"Function2Scene: 3D Indoor Scene Layout from Functional Specifications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:00.840340Z"},"links":{"cited_paper":"/paper/2507.06484","citing_paper":"/paper/2605.30819"},"observation_digest":"sha256:36abae78c25b21533224de034b91f8b8da15dd32c7fbc53daa7e20b3363fd3bc","observation_id":"adb0c979-3899-46e7-aaa7-e10b964af779","resolution":{"observed_at":"2026-06-28T23:12:46.730083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"cited_work":{"arxiv_id":"2507.06484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06484","snapshot_observed_at":"2026-07-02T03:56:34.752902Z","title":"3d-generalist: Self-improving vision-language-action models for crafting 3d worlds","venue":null,"work_id":"6158aec4-fec5-421f-af05-4eed17f71d07","year":2025},"citing_paper":{"arxiv_id":"2606.04226","last_updated":"2026-06-02T21:25:49Z","snapshot_observed_at":"2026-08-09T03:56:31.844306Z","submitted_at":"2026-06-02T21:25:49Z","title":"PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T09:34:34.220944Z"},"links":{"cited_paper":"/paper/2507.06484","citing_paper":"/paper/2606.04226"},"observation_digest":"sha256:99e9e817c3527cd563c92e9d9c30de32ffa50ec18ce42bce2a89ec2f2f8020d4","observation_id":"667ff8d3-a95f-4923-85bc-f27ea0d09903","resolution":{"observed_at":"2026-07-02T03:56:34.754685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06484/citation-record","integrity":"/paper/2507.06484/integrity","json":"/paper/2507.06484/citation-record.json","paper":"/paper/2507.06484"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:09:25.060519Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.060519Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:c3ebcb471206ea13c2ec8ac2b243f246e942852f6a5e836c41ff091647fb2d75","observation_id":"757fdf72-0fd8-42f4-8226-9a5f310f6c49","resolution":{"observed_at":"2026-08-06T19:09:25.060519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09675","last_updated":"2024-02-05T01:59:31Z","snapshot_observed_at":"2026-08-20T13:43:28.698074Z","submitted_at":"2024-02-05T01:59:31Z","title":"Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09675","snapshot_observed_at":"2026-08-06T19:09:25.147440Z","title":"Open-universe indoor scene generation using llm program synthesis and uncurated object databases.arXiv preprint arXiv:2403.09675, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.147440Z"},"links":{"cited_paper":"/paper/2403.09675","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:472ef102b6c16db28ca667e63b0e04fd2b4c585d5105eebff711378f14c836f9","observation_id":"56ab8fd7-a601-4246-b55f-bec25da8fa23","resolution":{"observed_at":"2026-08-06T19:09:25.147440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:25.251909Z","title":"I-design: Personal- ized llm interior designer.arXiv preprint arXiv:2404.02838,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.251909Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:f73765d9a134f27fc4a39a7f287d965e57096bca4c4a762f4d689eb468620de4","observation_id":"3e3f0ed2-7c48-42d1-a7a2-3999f5c443ca","resolution":{"observed_at":"2026-08-06T19:09:25.251909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:36.276605Z","title":"Learning spatial knowledge for text to 3d scene generation","venue":null,"work_id":"5901c09a-fa7f-408f-97ab-3ad3b7153c0a","year":2014},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.319361Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:fdfce7af0a85484d6fce92207dde07e1cf87f42b3d50df6dcdea8a9ed63915df","observation_id":"22b496ac-4bef-4dfc-a5d2-e0b4a47a2a15","resolution":{"observed_at":"2026-08-06T19:09:36.332637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00050","last_updated":"2017-02-28T20:47:47Z","snapshot_observed_at":"2026-08-15T09:21:18.125723Z","submitted_at":"2017-02-28T20:47:47Z","title":"SceneSeer: 3D Scene Design with Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00050","snapshot_observed_at":"2026-08-06T19:09:25.395511Z","title":"Sceneseer: 3d scene design with natural language.arXiv preprint arXiv:1703.00050, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.395511Z"},"links":{"cited_paper":"/paper/1703.00050","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:583febdfc43d8959a1446c7227fe1f332698c8c92281e17f168ac1ef9ec73731","observation_id":"40790c0b-4ea2-4831-8d58-c1c6cbee8dec","resolution":{"observed_at":"2026-08-06T19:09:25.395511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:36.168203Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":"5d64aeda-ad3d-4a0c-bd82-9cd87c676c0e","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.490051Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:8070567eff9bd542e1eb1477320bedcf48a91dd96c1457d3b5a46dea205d1b7b","observation_id":"82379160-45a2-46f9-b488-2652080775ae","resolution":{"observed_at":"2026-08-06T19:09:36.194302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11656","last_updated":"2024-05-31T16:44:06Z","snapshot_observed_at":"2026-08-16T13:51:30.172431Z","submitted_at":"2024-05-19T20:01:29Z","title":"URDFormer: A Pipeline for Constructing Articulated Simulation Environments from Real-World Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11656","snapshot_observed_at":"2026-08-06T19:09:25.571972Z","title":"Urdformer: A pipeline for constructing articulated simulation environments from real-world images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.571972Z"},"links":{"cited_paper":"/paper/2405.11656","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:6d951dd8cdfc2a4299630cdca05a96ab17406f5f0ce2ae57d80bb5c693881e45","observation_id":"b60dd022-5bcc-4f0e-bfd5-3d99bb6bc0da","resolution":{"observed_at":"2026-08-06T19:09:25.571972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T19:09:25.638480Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.638480Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:457cef577bca74788de72502a993272e651d29fb9482d66547f70a0bb6354827","observation_id":"aa4cd893-691c-4236-96ff-78c5eb4d968e","resolution":{"observed_at":"2026-08-06T19:09:25.638480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:36.113391Z","title":"Wordseye: An automatic text-to-scene conversion system","venue":null,"work_id":"dea9c1b4-5a59-4069-b55d-03f94bf5d697","year":2001},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.731961Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:f38c57c30d1c044da9e9a647a3d6c61dcf07bf2dc525e251bbd3249df1250d7d","observation_id":"5e35302d-176e-4e4c-af07-ec4ccdfc46a8","resolution":{"observed_at":"2026-08-06T19:09:36.160901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.951422Z","title":"Procthor: Large-scale embodied ai using procedural generation.Ad- vances in Neural Information Processing Systems, 35:5982– 5994, 2022","venue":null,"work_id":"175ceee5-0403-4ca9-8ee2-c5c6fc3f706a","year":2022},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.878293Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:2940207c77a7e895de6ba01e176e3ff2fb5135880c7b4be96f069397586e3d6d","observation_id":"0bb1a632-f669-463d-8509-c1b34df47882","resolution":{"observed_at":"2026-08-06T19:09:36.048234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.784680Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"68847d93-0ad3-4934-beb1-e3cc79332ad5","year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.968577Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:d8885eecf36ab99b77701cd46f8ab3550a9337f61c833ff6d74330f5d51fa1b8","observation_id":"06aed207-0e9d-41d1-96a6-bb47042fd37c","resolution":{"observed_at":"2026-08-06T19:09:35.866121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T19:09:26.052398Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.052398Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:4375fd5b2f643f7c85704f1da46d6087399cfa91ececcd0f34ae1ce920ab1e24","observation_id":"4f681eb1-6109-42ce-b1ff-eddb7344277b","resolution":{"observed_at":"2026-08-06T19:09:26.052398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.650843Z","title":"ImageNet: A large-scale hierarchical im- age database","venue":null,"work_id":"2c588881-fd9d-48f4-b178-96e75dc6e8dd","year":2009},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.151933Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:f928a49a4989368fc6a85a2e1b205130d2c2d352e3345a1b5c3c7f33afb6d99a","observation_id":"b692d7ec-d7ff-4038-bd19-782c9f7bbc46","resolution":{"observed_at":"2026-08-06T19:09:35.702757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16936","last_updated":"2024-02-26T18:54:15Z","snapshot_observed_at":"2026-08-16T14:15:11.923214Z","submitted_at":"2024-02-26T18:54:15Z","title":"Disentangled 3D Scene Generation with Layout Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16936","snapshot_observed_at":"2026-08-06T19:09:26.240368Z","title":"Disentangled 3D scene genera- tion with layout learning.arXiv preprint arXiv:2402.16936,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.240368Z"},"links":{"cited_paper":"/paper/2402.16936","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:5c90beab5685f28028f7c1f696d0100bb146cf93e6c7891759f04625a77895b6","observation_id":"d4d23b0e-ff5c-4ecd-8eba-2997edfc0767","resolution":{"observed_at":"2026-08-06T19:09:26.240368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13141","last_updated":"2023-11-22T04:06:39Z","snapshot_observed_at":"2026-08-16T14:41:18.076591Z","submitted_at":"2023-11-22T04:06:39Z","title":"Diffusion360: Seamless 360 Degree Panoramic Image Generation based on Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13141","snapshot_observed_at":"2026-08-06T19:09:26.363654Z","title":"Diffusion360: Seamless 360 degree panoramic im- age generation based on diffusion models.arXiv preprint arXiv:2311.13141, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.363654Z"},"links":{"cited_paper":"/paper/2311.13141","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:77c4bf58be3768ffcbfabd45ff69e5327f73772d5d6931ced8106b35f91561e0","observation_id":"f04a234c-3512-43dd-a05c-32384fc3740b","resolution":{"observed_at":"2026-08-06T19:09:26.363654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.640303Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"9fecc04a-1bff-4865-86c8-335c650b2d79","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.459243Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:bb4dce3c6c5e77811c01dc9ee3e9cc0aef97a20f792dfd691d4df7d623b85b6c","observation_id":"94d2422b-0527-4e9a-acfc-f877a188431a","resolution":{"observed_at":"2026-08-06T19:09:35.644267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.465968Z","title":"Example-based synthesis of 3d object arrangements.ACM Transactions on Graphics (TOG), 31(6):1–11, 2012","venue":null,"work_id":"498139fb-d6c1-46eb-96a5-75bde03f41bf","year":2012},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.586131Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:d5212ddc54686fbd6f86c24645cb797de5e1cc6dee40728b0dc42b234b797b1d","observation_id":"9c076fbb-9d0b-460a-aea4-3cf6dbdf70b7","resolution":{"observed_at":"2026-08-06T19:09:35.565521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.328965Z","title":"Any- home: Open-vocabulary generation of structured and tex- tured 3d homes","venue":null,"work_id":"0c3fbd94-7f69-498a-954c-9d83323da90e","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.694531Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ab304779b4bb033f8360ea7c3e34a91be5a27af6e47027bff5a81e9e0469ad02","observation_id":"dda20418-a8e1-4c05-b2de-3dbee326ae00","resolution":{"observed_at":"2026-08-06T19:09:35.391203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:35.077410Z","title":"Rel3D: A minimally contrastive benchmark for grounding spatial relations in 3d.Advances in Neural Information Pro- cessing Systems, 33:10514–10525, 2020","venue":null,"work_id":"a38c3c06-6027-4c1e-924b-8b6f35db7925","year":2020},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.771115Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:0404933ba61755019f3de63f04696dcea1ffee3c5bf2910a2a1af81b4edd973f","observation_id":"12864e82-d745-4f54-8ff6-76f09672ce55","resolution":{"observed_at":"2026-08-06T19:09:35.207373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.777775Z","title":"Text2Room: Extracting textured 3D meshes from 2D text-to-image models","venue":null,"work_id":"90492b35-9b00-4dd9-b54a-78678ecee233","year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.844439Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:52282a3d3b1d0b402fa6168f27d4971e699e2de865a7b18fd728e16d9a638b32","observation_id":"8fc49ff0-f424-47f4-8370-fbfdad7a956c","resolution":{"observed_at":"2026-08-06T19:09:34.922274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.659099Z","title":"3D-LLM: In- jecting the 3D world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494,","venue":null,"work_id":"b1a7df7b-454c-48bb-8ab5-3699dd521a75","year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:26.935072Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:581a45e58ba1fef8cc49934ecbf9d4bcc8ea2f69d148ebbba6af67b0719eb381","observation_id":"73641011-fd9f-4384-8daa-bb76568dc2b9","resolution":{"observed_at":"2026-08-06T19:09:34.695667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.482166Z","title":"Scenecraft: An llm agent for synthesizing 3d scenes as blender code","venue":null,"work_id":"4eb34b16-f8b2-4e9c-a788-1f53292f52d7","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.045961Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ce9e376a6972ecef9ac33abc687f630b39296750d7c65f7c7a3d188dce279c88","observation_id":"628e9190-c971-4d58-a671-8761e57772cd","resolution":{"observed_at":"2026-08-06T19:09:34.559575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-06T19:09:27.114885Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.114885Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:f8f54fc6c043873a0cb3289b19f47397442a0fc4928fcfca2e9f81a7402b64bb","observation_id":"6e0d37c2-cbfe-42a5-8923-7c1e5662c247","resolution":{"observed_at":"2026-08-06T19:09:27.114885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-06T19:09:27.212385Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.212385Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:400a22be2758607b08cdc3ec9b34d5088faa3b5ac5b51ecd86b9fd0c699c6295","observation_id":"400aedfb-5b36-4ce2-be5b-4d624cbe5ae6","resolution":{"observed_at":"2026-08-06T19:09:27.212385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04717","last_updated":"2024-02-07T10:09:00Z","snapshot_observed_at":"2026-08-16T14:20:41.046988Z","submitted_at":"2024-02-07T10:09:00Z","title":"InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04717","snapshot_observed_at":"2026-08-06T19:09:27.266519Z","title":"InstructScene: Instruction- driven 3D indoor scene synthesis with semantic graph prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.266519Z"},"links":{"cited_paper":"/paper/2402.04717","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:6f799031c14d5b817ee8f437893228a0bb59da3a9be4df34ae8e03e6a72f9f5b","observation_id":"97f7ff7f-42c6-4291-b3e2-842bfb087700","resolution":{"observed_at":"2026-08-06T19:09:27.266519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:27.354684Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.354684Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:f8f29691bb32539157ad0cc6491f0c1c09ea58ac0f30ecaa031e332794e09a93","observation_id":"8c6b66b2-27c5-46ea-9dd3-d96b532ec92b","resolution":{"observed_at":"2026-08-06T19:09:27.354684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.400830Z","title":"Material palette: Extraction of materials from a single image","venue":null,"work_id":"71e5ac46-e8b0-4a11-9269-c5fb04f86d07","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.417306Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:a9e0d165f5cca2fcee8282982863b8752d304f1373fcd2ad396777ff3cc44966","observation_id":"649621b1-eddf-4348-9ed5-86f25b3237cf","resolution":{"observed_at":"2026-08-06T19:09:34.404330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.276510Z","title":"Language-driven synthe- sis of 3d scenes from scene databases.ACM Transactions on Graphics (TOG), 37(6):1–16, 2018","venue":null,"work_id":"6b47f391-a21f-42fb-aaed-7ed4c076dc8c","year":2018},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.482068Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:a3dda7797a14b977286e69d05b2b87399b9dd284e1415b7f74edf8c5d25a8aff","observation_id":"c6654d33-4ca3-4af9-8118-56fa931bdbab","resolution":{"observed_at":"2026-08-06T19:09:34.331089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-16T06:47:25.140028Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-06T19:09:27.557334Z","title":"RoboCasa: Large-scale simula- tion of everyday tasks for generalist robots.arXiv preprint arXiv:2406.02523, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.557334Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:696fe199b178d580dfe02b0f1753b608c6be7cc424eb2797faab234e0fe6f80e","observation_id":"ecdc951c-3b1f-4264-8d72-89b6ac9ace65","resolution":{"observed_at":"2026-08-06T19:09:27.557334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07135","last_updated":"2024-11-11T17:07:43Z","snapshot_observed_at":"2026-08-19T21:57:02.632627Z","submitted_at":"2024-11-11T17:07:43Z","title":"Edify 3D: Scalable High-Quality 3D Asset Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07135","snapshot_observed_at":"2026-08-06T19:09:27.659339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.659339Z"},"links":{"cited_paper":"/paper/2411.07135","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:4dadf208b64842a7fbc394c64644df335e97ec5ecce7ae7c3905674ad080e213","observation_id":"f0a61184-4834-46a2-80c6-f0dc2d834564","resolution":{"observed_at":"2026-08-06T19:09:27.659339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:27.762897Z","title":"Atiss: Autoregres- sive transformers for indoor scene synthesis.Advances in Neural Information Processing Systems, 34:12013–12026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.762897Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:89385eb186c4110df4d544f86e893996512c2aa0fe088437463c40193bd84d72","observation_id":"d5d1dbc3-e9e4-4b1a-a653-ef2e27248c83","resolution":{"observed_at":"2026-08-06T19:09:27.762897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.155433Z","title":"Advances in data- driven analysis and synthesis of 3d indoor scenes","venue":null,"work_id":"e6a87e1b-5577-4fdd-aa50-7260db31bf7d","year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.847004Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:a46825b5dcd24c474d1754f06c73fa0bee669bcc7bff6fece7ebb4f85d68b8cb","observation_id":"4166ae79-89be-490f-a2ca-63425b49735e","resolution":{"observed_at":"2026-08-06T19:09:34.204046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:34.029312Z","title":"Compositional 3d scene generation using locally conditioned diffusion","venue":null,"work_id":"1d56bc47-f1b9-4f86-a08f-617a13c1b53f","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.896624Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:5b68191fb4a67b15e131b969328d9eeda99a969d37b970b22a3bb4062472fd27","observation_id":"ac336ab7-8668-4344-ac3f-b09e09c91a16","resolution":{"observed_at":"2026-08-06T19:09:34.091543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:27.959566Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:27.959566Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:a89eb6e528ed233a92bbc4442b204e801afb1f2f301aa52901fcc0dfc2d345f8","observation_id":"6ed5852a-8429-4350-bd96-029b7ddbe82e","resolution":{"observed_at":"2026-08-06T19:09:27.959566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00687","last_updated":"2024-06-04T16:19:47Z","snapshot_observed_at":"2026-08-19T00:11:46.338372Z","submitted_at":"2024-06-02T09:48:19Z","title":"Lay-A-Scene: Personalized 3D Object Arrangement Using Text-to-Image Priors","version":2},"cited_work":{"arxiv_id":"2406.00687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00687","snapshot_observed_at":"2026-08-06T19:09:31.160372Z","title":"Lay-A-Scene: Personalized 3D Object Arrangement Using Text-to-Image Priors","venue":"cs.CV","work_id":"e8063e2e-aa42-4459-bdcc-2b9d466a19a2","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.043773Z"},"links":{"cited_paper":"/paper/2406.00687","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:71c94e82b79ac05855851583a32d3efbeca2bcdbce46aa889ff6ee997ef39eaf","observation_id":"45cd910c-6ffe-4d68-8f44-932d3a284a16","resolution":{"observed_at":"2026-08-06T19:09:31.267876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:28.095933Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.095933Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:8d296887c39964ebf56c0ec0d3176f1057afb5c0ac9ba3bdc9a77247b83dd9f9","observation_id":"9924f5f2-4431-475e-af85-12b9231f8995","resolution":{"observed_at":"2026-08-06T19:09:28.095933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:28.195189Z","title":"Susskind","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.195189Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ba39b00439600a60b533575de98c5159521fdc4029760f52dedaed520f4143c3","observation_id":"22cfc7e8-f557-498f-ac5c-98c37baee8f6","resolution":{"observed_at":"2026-08-06T19:09:28.195189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-16T11:34:00.114590Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-06T19:09:28.253128Z","title":"Object hallucination in image cap- tioning.arXiv preprint arXiv:1809.02156, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.253128Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:a615452519bed5b4e8b02e9863991aa755ee2ec9d15b3ebfaedb61e57cea569d","observation_id":"68c8327f-2d4c-433f-85f0-231279d08c57","resolution":{"observed_at":"2026-08-06T19:09:28.253128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:28.335751Z","title":"Controlroom3d: Room gen- eration using semantic proxy rooms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.335751Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:35923da22c053d4dc831a006ad5700c187fadb603414969dd245bdcbf533f3ce","observation_id":"df90daee-1c8d-4296-a659-20304ca21b12","resolution":{"observed_at":"2026-08-06T19:09:28.335751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.847175Z","title":"Real-time automatic 3d scene generation from natural language voice and text de- scriptions","venue":null,"work_id":"10887518-8920-4947-b355-8595de962568","year":2006},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.456742Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:d4597e3c13831a17c0ecabe820e3db76b6002b3f4e41f05497da982533e6675c","observation_id":"378a64ea-5841-49a3-ad39-8a4a146a5199","resolution":{"observed_at":"2026-08-06T19:09:33.928249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.735371Z","title":"Horizonnet: Learning room layout with 1d represen- tation and pano stretch data augmentation","venue":null,"work_id":"31a74e61-e807-471f-9dbc-18d4bcb2c8f4","year":2019},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.580659Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:0a2702f84eb2d9b55d8f1c67c4df4ebc6b8717c4e96dcae0ad2ac9165b8a4c22","observation_id":"5941c165-779d-4786-9f71-77114fbce186","resolution":{"observed_at":"2026-08-06T19:09:33.777795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-19T23:45:08.372528Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T19:09:28.680768Z","title":"LayoutVLM: Differentiable optimization of 3D layout via vision-language models.arXiv preprint arXiv:2412.02193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.680768Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:e412f445bc58bd34cf9ec3ee40515a6070ef5f17bd5cfe7a1a3d0633e9361e56","observation_id":"189c25ce-7354-44c2-8df8-900b39caf607","resolution":{"observed_at":"2026-08-06T19:09:28.680768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.625355Z","title":"Factorsim: Generative simulation via factorized rep- resentation.Advances in Neural Information Processing Sys- tems, 37:87438–87472, 2024","venue":null,"work_id":"847b3bde-eeb5-4963-8cd5-725e60a2b310","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.768156Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:a1d9c90cc8e69f34702c8e53332fe49da299963be5647ac35c62e2e9a1c680b5","observation_id":"31197d64-302c-4235-afef-3475e3b4b745","resolution":{"observed_at":"2026-08-06T19:09:33.665930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.533793Z","title":"Partial-view object view synthesis via filtering inversion","venue":null,"work_id":"c339c4e2-915a-455c-97ba-597ec641b714","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.869353Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:76e15a510cc3b0f0c019931437fc6cdb7712915d0acdc67c80e45cb47e4f7b2f","observation_id":"f236d975-a3cd-4f93-b853-7c59bce4e246","resolution":{"observed_at":"2026-08-06T19:09:33.571398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.398210Z","title":"Lgm: Large multi-view gaussian model for high-resolution 3d content creation","venue":null,"work_id":"558c5fca-d551-44d9-b449-5746203b6463","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.965667Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:5433937a5e1776f356eb2b7fb2d00c7bf11edad8546629cdf34dacd3153096ad","observation_id":"61e176e0-4271-4ed5-ac51-1d454af5b741","resolution":{"observed_at":"2026-08-06T19:09:33.460132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.266134Z","title":"DiffuScene: Denoising diffu- sion models for generative indoor scene synthesis","venue":null,"work_id":"16a1d25b-ca70-4145-bd2f-a7cb6a3143aa","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.068290Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:e0b10ceb0edc05c7c70e31fbaccba09e48a9f809b7d002f2153cb94fc93079f7","observation_id":"0a787edc-b8d6-4976-adc7-9cb6b0b6db5f","resolution":{"observed_at":"2026-08-06T19:09:33.329825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-08-14T15:48:28.214119Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-06T19:09:29.197304Z","title":"An LLM-free multi-dimensional benchmark for MLLMs hallucination evaluation.arXiv preprint arXiv:2311.07397,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.197304Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:b17dedaf629ee3ad7b5d0e2d8263301b4d0e4cdba9507323488509e0f4faf602","observation_id":"5fb754f0-75b4-4bf3-bd21-ee0657327702","resolution":{"observed_at":"2026-08-06T19:09:29.197304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14852","last_updated":"2024-11-04T21:51:07Z","snapshot_observed_at":"2026-08-16T13:40:52.689637Z","submitted_at":"2024-06-21T03:53:37Z","title":"Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14852","snapshot_observed_at":"2026-08-06T19:09:29.291799Z","title":"Is a picture worth a thou- sand words? delving into spatial reasoning for vision lan- guage models.arXiv preprint arXiv:2406.14852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.291799Z"},"links":{"cited_paper":"/paper/2406.14852","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:71863d60f864836473677494c06550f29d34c684fcc8eea6ed03686dbccfb633","observation_id":"3c692faa-d191-487c-b32e-a6db1f62d42f","resolution":{"observed_at":"2026-08-06T19:09:29.291799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01455","last_updated":"2024-06-14T21:09:49Z","snapshot_observed_at":"2026-08-19T19:50:01.104627Z","submitted_at":"2023-11-02T17:59:21Z","title":"RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01455","snapshot_observed_at":"2026-08-06T19:09:29.396038Z","title":"Robogen: Towards unleashing infi- nite data for automated robot learning via generative simula- tion.arXiv preprint arXiv:2311.01455, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.396038Z"},"links":{"cited_paper":"/paper/2311.01455","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:148bcff9740fc77ccacb572776578b5e3c4810163a3f6ecd0670bd84831927e6","observation_id":"36be4184-03cd-4347-a035-b2a495046f64","resolution":{"observed_at":"2026-08-06T19:09:29.396038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.158533Z","title":"Architect: Generating vivid and interactive 3d scenes with hierarchical 2d inpainting, 2024","venue":null,"work_id":"4805b9d4-9335-4079-821c-433b7c4c509d","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.490104Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:6b943f2242d001a644d0366aee2a07d38f0cb83a44b33dc6a42ad15d23a9bfa5","observation_id":"faed3a08-26c4-42f0-bddc-03853aa784b0","resolution":{"observed_at":"2026-08-06T19:09:33.206158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:33.002777Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"c7d22b74-294b-4321-b873-1d36fb4fa08c","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.607181Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:222c0c656b8bf7accdce38e00f7c6ea90bb72a60a35667acc9a99c40a6b9e69e","observation_id":"d4598024-9fcb-44ce-b65b-52ff61dc3d11","resolution":{"observed_at":"2026-08-06T19:09:33.093312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-08-13T18:57:44.379289Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-06T19:09:29.717119Z","title":"InstantMesh: Efficient 3D mesh generation from a single image with sparse-view large reconstruction models.arXiv preprint arXiv:2404.07191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.717119Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:fc19e0b4eccfffb253b0034a6f5fd95c279a280a212e34d9fbfda1f08e52bdf3","observation_id":"685240fa-fe05-4b7f-be0e-61bef0ae514d","resolution":{"observed_at":"2026-08-06T19:09:29.717119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T19:09:29.817253Z","title":"Set-of-mark prompting unleashes 11 extraordinary visual grounding in GPT-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.817253Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:31497efe004736bc1d829227a60e55c3403a3db9d9b0e5ef1559a120041d049e","observation_id":"c76dbc7a-d1d5-4e2d-ba4e-b6f1566e51e7","resolution":{"observed_at":"2026-08-06T19:09:29.817253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:32.794788Z","title":"Physcene: Physically interactable 3d scene synthe- sis for embodied ai","venue":null,"work_id":"eb4ed5ab-c6b7-4b12-99ff-4ee9eaa7a171","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:29.929380Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ae873b71715aa3d105cc86cfbda52d945b4344de8bd5276cd3cecb9b05b48754","observation_id":"ff5bf40f-6a21-4fa3-8ea0-bf0eaa3b2871","resolution":{"observed_at":"2026-08-06T19:09:32.914444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:32.625940Z","title":"Holodeck: Language guided gen- eration of 3d embodied ai environments","venue":null,"work_id":"87cd2489-b7e7-407e-9a40-bbb1684ca667","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.026747Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:290065cc24febc6a190b483ae825a6ba351ca6625368d721c58f1f4607a88e89","observation_id":"32381829-480e-4e4d-b2bf-515812bb4628","resolution":{"observed_at":"2026-08-06T19:09:32.707862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:32.417320Z","title":"The clutterpalette: An interactive tool for detailing indoor scenes","venue":null,"work_id":"367bbde3-a878-45b5-a0eb-319b327394d8","year":2015},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.106167Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:9b13e6292d2fdafc45e2401ac104df14c20d556cc4f33097b90c3a529a514f12","observation_id":"d65d69dd-45a4-4cc0-889a-bf0928bf6c8f","resolution":{"observed_at":"2026-08-06T19:09:32.521254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:32.258431Z","title":"RLF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional hu- man feedback","venue":null,"work_id":"cc296350-9adc-4316-b713-5a265978f00a","year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.186377Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:7c782951a1571d0f6ebc159008355edc0614d2df1d797750e5c173163dd386ab","observation_id":"e7f87d50-a65e-4b5d-aeff-8e8484634865","resolution":{"observed_at":"2026-08-06T19:09:32.329272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:30.324696Z","title":"Clay: A controllable large-scale generative model for creat- ing high-quality 3d assets.ACM Transactions on Graphics (TOG), 43(4):1–20, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.324696Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ec072bd36aff1af5c9df03e0b9d95d113904aec35744e8441b405f1e3fdc9f02","observation_id":"e4dc9c68-d7aa-4626-8768-134154e5c463","resolution":{"observed_at":"2026-08-06T19:09:30.324696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08885","last_updated":"2023-12-13T18:59:30Z","snapshot_observed_at":"2026-08-17T09:47:14.576800Z","submitted_at":"2023-12-13T18:59:30Z","title":"SceneWiz3D: Towards Text-guided 3D Scene Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08885","snapshot_observed_at":"2026-08-06T19:09:30.414347Z","title":"SceneWiz3D: To- wards text-guided 3d scene composition.arXiv preprint arXiv:2312.08885, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.414347Z"},"links":{"cited_paper":"/paper/2312.08885","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ab87e10d9b90b4a23f5884be2cdcbf1a5bb6a5d18e68cd1a941f39c2154442ac","observation_id":"7f84a514-1eeb-472b-84de-235ba23992e0","resolution":{"observed_at":"2026-08-06T19:09:30.414347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:32.044662Z","title":"DreamScene360: Uncon- strained text-to-3D scene generation with panoramic gaus- sian splatting","venue":null,"work_id":"b075d20a-a150-496e-a078-cc98ec5499ae","year":2025},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.558770Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:4542fa4769f1cba90a8b6645527d81ae5a2077a3f269bdf95654a5fdd1a7f21b","observation_id":"a2e42970-38ae-4611-a5ed-21dbd4680c14","resolution":{"observed_at":"2026-08-06T19:09:32.122004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07207","last_updated":"2024-06-11T15:16:37Z","snapshot_observed_at":"2026-08-18T06:36:25.876751Z","submitted_at":"2024-02-11T13:40:08Z","title":"GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07207","snapshot_observed_at":"2026-08-06T19:09:30.649221Z","title":"GALA3D: Towards text-to-3d complex scene generation via layout-guided generative gaussian splatting.arXiv preprint arXiv:2402.07207, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.649221Z"},"links":{"cited_paper":"/paper/2402.07207","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:b8f72e6b4a999c682d5166721d11d993366dd38dbf082a9e6ccb52c5f97fea20","observation_id":"c99a6018-6cf9-4342-94d3-ed9242d464bf","resolution":{"observed_at":"2026-08-06T19:09:30.649221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:31.856051Z","title":"placements","venue":null,"work_id":"12fe6f57-2d43-4dd2-a954-6a3943a8c595","year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.753677Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:8b40ecf47c00e9d75a089f50c673ee60c760d12b6ca6ad3c80ae5f65c80820ba","observation_id":"4c5e14bb-7747-43ea-9a01-5b16d95a5721","resolution":{"observed_at":"2026-08-06T19:09:31.918596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:31.698685Z","title":null,"venue":null,"work_id":"1a3ff446-b34c-4780-8e51-fc2375e7d544","year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.834018Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:ae865f09b28aabc27172ee3206fdd46c07c684a4be075b9ada65eeb5c58ce650","observation_id":"68d92fdb-d18e-4240-bd51-c81cf5b9e13a","resolution":{"observed_at":"2026-08-06T19:09:31.791694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:09:31.514701Z","title":"receptacle objects","venue":null,"work_id":"ec20b469-eb94-4bb4-82d0-a60a1811e9b0","year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:30.946930Z"},"links":{"citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:902d54fe90b4c2f9fb1d7571c2a852c065b90cfe851e2de5cbee1d6b928b8a30","observation_id":"e54cadc9-f2ba-4df3-a054-1a519a52ea5c","resolution":{"observed_at":"2026-08-06T19:09:31.585806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","latest_version":2,"primary_category":"cs.GR","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 5 inbound Pith citation observations for arXiv:2507.06484."}