{"as_of":"2026-08-13T02:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea2d95aa02c4e874eb22adf4f1f639f2fb8fa13ca4d148ece28cde4d42dd5dc3","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:51:36.776949Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18644/citation-record","integrity":"/paper/2411.18644/integrity","json":"/paper/2411.18644/citation-record.json","paper":"/paper/2411.18644"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.875743Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":"45623647-24b6-4175-9004-116d9e286095","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.452044Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:1cac70858ce9a9cc48412037aa3af4e4dee38e6a5d451f9b4b800c952718dfc8","observation_id":"4e0b955b-a324-4a2b-924d-dfa366547f99","resolution":{"observed_at":"2026-08-12T11:51:37.879598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:51:36.457544Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.457544Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:fd3aeecc3b81e495cd67df0b6aa685b24fff511ba62e51310f4928c8e6909b38","observation_id":"429afd48-6d0a-4214-af27-db9bc1c5e853","resolution":{"observed_at":"2026-08-12T11:51:36.457544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.864418Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"294f8efd-48de-45dc-8896-f9bb0357f71e","year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.463592Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:3297fdaf7d65938939538b66840cac149f3ce88ef6b8f785e72194dbfcc460ac","observation_id":"1c3f1333-78b1-4aa8-81a4-80bbbc9eabb9","resolution":{"observed_at":"2026-08-12T11:51:37.868378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.853535Z","title":"Nodetopython","venue":null,"work_id":"4a18113f-b016-4380-8611-57c558ef8ee2","year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.469296Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:0eba0b6bc17bb9844cd9f0507259cb19c7ff4df0c46002bcd194204828953784","observation_id":"ee774c63-aa5f-44e6-8ec3-90fbe6c1e087","resolution":{"observed_at":"2026-08-12T11:51:37.857017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.474021Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.474021Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:2e2db74e77d5832d420ede7785695a7a47c1a02f8c8500419e7f0eacf305e799","observation_id":"6ab1b396-7d61-499c-a551-bdb0131cc0d9","resolution":{"observed_at":"2026-08-12T11:51:36.474021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T11:51:36.480041Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.480041Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:35005871889294c5c519bfe57718a6f8c71bf5eaf7bf35c947aa4010479ec449","observation_id":"474f2729-1ef6-4db4-a0b8-9f0d44144c85","resolution":{"observed_at":"2026-08-12T11:51:36.480041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.484784Z","title":"A naturalistic open source movie for opti- cal flow evaluation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.484784Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:9a6ed7b53a2f5f3611f5c6821c8ab9c1f3e403eb2ad6b76225eb6db3fc7b9441","observation_id":"85853686-2bfe-4406-b7f0-3300a032fbf8","resolution":{"observed_at":"2026-08-12T11:51:36.484784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.829621Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"146f4666-406d-4c55-a1c5-fa735d41439e","year":2020},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.489095Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:cdd9e674e2e6e75806b76a4d9c98acb0da61f748bfe3d8188787c901c49c57a3","observation_id":"19820af9-1344-4633-924f-5a1d8d405ad5","resolution":{"observed_at":"2026-08-12T11:51:37.833755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.817861Z","title":"Coda: Col- laborative novel box discovery and cross-modal alignment for open-vocabulary 3d object detection","venue":null,"work_id":"55624655-ded5-4632-91be-ac5487793faa","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.493407Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:762ce3ded86a0881504b7ddb008a3545b30e467f2a17e5511db3ca25fded28ab","observation_id":"52af7bf5-039c-430e-a52b-39b18d5b0b79","resolution":{"observed_at":"2026-08-12T11:51:37.822062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-12T11:51:36.498337Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.498337Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:96266eb399d7020c49a803306776cfc5ca36bf24310d8873d27c4c8a013ed9b3","observation_id":"3992fc34-af5d-4058-a1cf-e50db22e042a","resolution":{"observed_at":"2026-08-12T11:51:36.498337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-12T11:51:36.502981Z","title":"Evalu- ating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.502981Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:3686d8a0f8019eece5f30cbf6f3ba334e70b25ee30db401db8991825f2f8d914","observation_id":"9b95e5eb-8399-4ade-87fa-b44835da3b5e","resolution":{"observed_at":"2026-08-12T11:51:36.502981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.507384Z","title":"Blender - a 3D modelling and rendering package","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.507384Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:e3464cfc14480d5192ef82620ce4ee875677ccae8704d006386583cd3ef8866c","observation_id":"c3f4ce76-579a-4426-a9d2-09fa05287af8","resolution":{"observed_at":"2026-08-12T11:51:36.507384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.796904Z","title":"Procthor: Large-scale embodied ai using procedural generation","venue":null,"work_id":"95b0beea-ade4-40c5-961c-140fcd3a207e","year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.511392Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:5359662c4e7113afb6355c0fc62549045d642d30c9a9c530b36615de823325b4","observation_id":"e3b0837e-6f57-459b-b6fc-c3d3d8420913","resolution":{"observed_at":"2026-08-12T11:51:37.802395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.515234Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.515234Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:f0ce05e1d460af87823ff80ae80694ee63921719cd9c7c4c8f4cac50d56fc8ac","observation_id":"60138d53-0fda-4576-b76d-dbb02aef2c3c","resolution":{"observed_at":"2026-08-12T11:51:36.515234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.519104Z","title":"The faiss library,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.519104Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:584f4ef7759fc64533869ea897ac25d238db4c4ce2f6619adedde159a51b17e8","observation_id":"c404d304-0ce0-41c2-85c5-50f6aea6b5e4","resolution":{"observed_at":"2026-08-12T11:51:36.519104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.772002Z","title":"Motsynth: How can synthetic data help pedestrian detection and tracking? In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 10849–10859, 2021","venue":null,"work_id":"3c0b36e0-bab1-4a75-a86b-3a186e89b10d","year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.523130Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:44ed64fdc6a3ac02f3849b8cbbe0645c26ba77a79e2cc77c749fe13d722ade5b","observation_id":"6c30c661-20a2-4fe8-8936-2c7b4589da87","resolution":{"observed_at":"2026-08-12T11:51:37.776358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.759846Z","title":"Large language models for code analysis: Do LLMs really do their job? In 33rd USENIX Security Symposium (USENIX Security 24) , pages 829–846, Philadelphia, PA, 2024","venue":null,"work_id":"09331427-361e-48f5-975b-9665cf52af97","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.527289Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:d114f9300af7a28fb3f15a50c6c3d313eab31b8ea4f5ad3265be9bdc7e7cb23b","observation_id":"33a67150-33f3-45c2-86e1-e6b51a6460b1","resolution":{"observed_at":"2026-08-12T11:51:37.764120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.747129Z","title":"Chat- edit-3d: Interactive 3d scene editing via text prompts","venue":null,"work_id":"316d5c4c-f8db-4e32-9e01-034050524364","year":2025},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.531858Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:f993217b52b8bc0f472548bdc5e7b756e481cc1d3a2e9990c57091fb541bf2ea","observation_id":"499c43f1-42fb-4228-9b4f-b453e3840134","resolution":{"observed_at":"2026-08-12T11:51:37.751617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.535783Z","title":"Scenescape: Text-driven consistent scene generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.535783Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:32cd73c30a908a43de6b3c70b20dc089a39b35e7d364e73f9bd6378b0e3cb5c9","observation_id":"969ee485-bb9c-485c-9bdb-fb25acbae0fa","resolution":{"observed_at":"2026-08-12T11:51:36.535783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-12T11:51:36.540142Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.540142Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:18adc8da9126f574ffaa2db27cb88b1ad782889c0265206b2e22bb35cce7b8a6","observation_id":"0932d4c8-4758-4f77-bff2-fc077a2d6cfa","resolution":{"observed_at":"2026-08-12T11:51:36.540142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.726595Z","title":"Retrieval-augmented generation for large language models: A survey, 2024","venue":null,"work_id":"6ee5ca24-944d-49fa-9271-a118c8ea4c05","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.544846Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:241c7980bd9f59d3f517662e7abaff3787e33cff48bc9782149caa68381a993b","observation_id":"2de56a9e-145c-48db-8c90-d185a31cb9b6","resolution":{"observed_at":"2026-08-12T11:51:37.730456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.714994Z","title":"Procedural model- ing of plant ecosystems maximizing vegetation cover","venue":null,"work_id":"fcaea308-8807-4f53-b910-b652816b73a6","year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.548471Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:c71334d1587a68d205cc0ac0d3c0b5d366f0cdd230bb0fe929dd1f406c99dd83","observation_id":"177f69b9-b3ee-4ac8-8141-9010bf2c68e3","resolution":{"observed_at":"2026-08-12T11:51:37.719110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-13T00:48:23.284957Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-12T11:51:36.552264Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.552264Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:512eb66afbb87e92833d9f64b09c15b3f6f6183a1dbdf3164a9989650bee51d9","observation_id":"e2bf620b-c78f-45dd-959a-8f03d97ca2db","resolution":{"observed_at":"2026-08-12T11:51:36.552264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.556855Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.556855Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:964439d618467e7157e86d3e203ff28e8cca6928dc93b2ccb4e2fb1216985b4c","observation_id":"1e2642f4-5c35-4242-976c-683888ef329a","resolution":{"observed_at":"2026-08-12T11:51:36.556855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-12T11:51:36.561339Z","title":"CogVideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.561339Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:da3e07481843edc2c924b96b8aa3513e22319cab731abda6c50101cac14fa8be","observation_id":"2ec31712-300e-4a8f-8e97-ff60bd22cb14","resolution":{"observed_at":"2026-08-12T11:51:36.561339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.695680Z","title":"An inverse procedural modeling pipeline for svbrdf maps","venue":null,"work_id":"17f46537-4620-4d3d-b29c-24e8b55ffd16","year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.566074Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:9e2403100fbe23113c2a7aa6773084337f741f0aa1118f9970542a8bf1707703","observation_id":"62e5d7c8-f027-4687-bced-0a175f48b241","resolution":{"observed_at":"2026-08-12T11:51:37.699615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.684948Z","title":"Generating procedural materials from text or image prompts","venue":null,"work_id":"d59f80ab-dc5c-4a14-923f-f48fe6b465b7","year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.570053Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:180a55de65446a895d511a4df2487d795e9f258753ff3d78510774f7778da160","observation_id":"a7a9e8fe-9296-4dad-aa8e-930b9b1f609d","resolution":{"observed_at":"2026-08-12T11:51:37.688750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.574262Z","title":"Scenecraft: An llm agent for synthesizing 3d scenes as blender code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.574262Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:7a68af329f686d3cf90f1ddeb97b9e03894b877bcef87a1fd430617ba186b578","observation_id":"6eefcbae-b7af-463b-a0dc-464d95f16f38","resolution":{"observed_at":"2026-08-12T11:51:36.574262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.666897Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"22fbcac5-98e6-4368-b805-16c47c4d40eb","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.578243Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:d3ec8051e9d2c19a71c8c9ec9169ddea800cfe2fcc867d2973e33abcd08eff49","observation_id":"c805efab-2120-4447-9ea3-76328c9cc8ec","resolution":{"observed_at":"2026-08-12T11:51:37.671058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.582804Z","title":"Putting nerf on a diet: Semantically consistent few-shot view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.582804Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:576b358456ab88ef4a490789230c9b5b28a49c8fc8fe0edd7ed0399aa4fdce18","observation_id":"241183cb-7a56-40d0-854b-071a1d6aa9b1","resolution":{"observed_at":"2026-08-12T11:51:36.582804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.586670Z","title":"Zero-shot text-guided object genera- tion with dream fields","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.586670Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:e8bd40490575d9e5677bb3110bb5d3bc33fd78b354f1616e353ff72be5745e21","observation_id":"79c212f0-9173-4eac-a29f-a315a72617bb","resolution":{"observed_at":"2026-08-12T11:51:36.586670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.590714Z","title":"Shap-e: Generating condi- tional 3d implicit functions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.590714Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:a1e8d7e87e22c24cfaad62b00038b5c7027922d23499a966dcc8df9f35b9203e","observation_id":"e9c50abc-5531-4aa5-8a30-5ac82721b9a8","resolution":{"observed_at":"2026-08-12T11:51:36.590714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.634476Z","title":"Clip-mesh: Gen- erating textured meshes from text using pretrained image- text models","venue":null,"work_id":"f8d6a10f-2c01-42c6-b8fe-4fd083329294","year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.594508Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:0f54371c29bca8c60e8bc9d7e176e629fb57f96998342baab13aa9e5de9b9fe1","observation_id":"c4f428c0-9c6e-469e-8f86-eb9074169167","resolution":{"observed_at":"2026-08-12T11:51:37.638834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.622475Z","title":"Kling AI","venue":null,"work_id":"032ae568-c0ff-4ca4-acb4-3f7ffb11e3bb","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.598956Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:f7e6e6437f98bab704eb89ff4c3165bc10c36dd717e4f4691c944616a36b842b","observation_id":"7fbb4aaa-f38c-462d-af19-d1fc95f9443d","resolution":{"observed_at":"2026-08-12T11:51:37.626467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15172","last_updated":"2022-09-30T01:47:47Z","snapshot_observed_at":"2026-07-06T13:58:02.046343Z","submitted_at":"2022-09-30T01:47:47Z","title":"Understanding Pure CLIP Guidance for Voxel Grid NeRF Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15172","snapshot_observed_at":"2026-08-12T11:51:36.603097Z","title":"Understanding pure clip guidance for voxel grid nerf models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.603097Z"},"links":{"cited_paper":"/paper/2209.15172","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:a5fb0c2286f61284a7deb575a64b1c2b5b40d99d08cf40fa97951270fa677654","observation_id":"2e196612-1c84-4548-968f-a164b465bb5b","resolution":{"observed_at":"2026-08-12T11:51:36.603097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.609882Z","title":"Retrieval-augmented genera- tion for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":"889e115e-5119-4c8b-a1e3-9600d26c4d38","year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.607465Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:27e9392274f2ba3251bea3114ead9ca72dcf809a3e1586048602de9f4af93b01","observation_id":"b7887cc3-e62d-4809-8dbc-a2e1b1bf1940","resolution":{"observed_at":"2026-08-12T11:51:37.614324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.597443Z","title":"Loogle: Can long-context language models under- stand long contexts?, 2024","venue":null,"work_id":"04372306-f67c-4e50-b491-93d698aa36a2","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.611702Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:0573165ccf55044848570cba3163cb3f039fa3c775c8d91a07fa6cb7f3b8ec74","observation_id":"3ef01c26-eec3-486a-b580-f74189161408","resolution":{"observed_at":"2026-08-12T11:51:37.601526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03327","last_updated":"2024-01-09T06:20:23Z","snapshot_observed_at":"2026-08-09T22:22:32.126759Z","submitted_at":"2024-01-09T06:20:23Z","title":"Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03327","snapshot_observed_at":"2026-08-12T11:51:36.615649Z","title":"Uni3d-llm: Unifying point cloud perception, generation and editing with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.615649Z"},"links":{"cited_paper":"/paper/2402.03327","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:4c137d8635ca3dc6b4b9e018ef8a6feaba60ed3f8187ec566cd621209aeb9a7e","observation_id":"d13f6431-dac3-473a-9bcf-85d068ed7a5e","resolution":{"observed_at":"2026-08-12T11:51:36.615649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06804","last_updated":"2021-01-17T23:38:40Z","snapshot_observed_at":"2026-08-12T17:43:05.787465Z","submitted_at":"2021-01-17T23:38:40Z","title":"What Makes Good In-Context Examples for GPT-$3$?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06804","snapshot_observed_at":"2026-08-12T11:51:36.619382Z","title":"What makes good in-context examples for gpt- 3? arXiv preprint arXiv:2101.06804, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.619382Z"},"links":{"cited_paper":"/paper/2101.06804","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:b17681b0135b25bb010ac3c563bbaad4d7d5a279cdc45dacd11375c57b3e7b02","observation_id":"d9a338da-ec81-475a-b035-6a7600001be8","resolution":{"observed_at":"2026-08-12T11:51:36.619382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.584966Z","title":"Deep learning for procedural content generation","venue":null,"work_id":"d607214c-b669-4b1d-a312-878248f20ef2","year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.623316Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:e550061d9e8a8505bee2f3cd8dcd02fcf6fc8b2f05a313d3a0f3d72a0aa63d7c","observation_id":"0629a79d-4538-42af-8938-49c8bcc5d158","resolution":{"observed_at":"2026-08-12T11:51:37.589019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.626895Z","title":"A multimodal gen- erative ai copilot for human pathology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.626895Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:c52e7228c3477e4f5ef27f442b9bad194bf4122f0559de4a0785061f623ec6b9","observation_id":"c530e454-bd4e-434c-a98d-820095b0946b","resolution":{"observed_at":"2026-08-12T11:51:36.626895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.631696Z","title":"Ovir-3d: Open-vocabulary 3d in- stance retrieval without training on 3d data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.631696Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:c176224e52817b93e233b1fecd2964a0b44274d9a006e223d9f09fb7f70c6daa","observation_id":"20f3fb42-7f38-4b79-9d41-3437e8bbda50","resolution":{"observed_at":"2026-08-12T11:51:36.631696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.635726Z","title":"When llms step into the 3d world: A survey and meta-analysis of 3d tasks via multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.635726Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:2d2d5f47ad74072956f1067396ac36b15184365fdbb523f278cfaf2fe71e05c9","observation_id":"0c6bd81b-e898-42e8-b459-840983d909dc","resolution":{"observed_at":"2026-08-12T11:51:36.635726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11037","last_updated":"2021-10-25T08:08:25Z","snapshot_observed_at":"2026-08-12T22:32:14.288125Z","submitted_at":"2021-06-21T12:28:08Z","title":"One Million Scenes for Autonomous Driving: ONCE Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11037","snapshot_observed_at":"2026-08-12T11:51:36.639392Z","title":"One million scenes for autonomous driving: Once dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.639392Z"},"links":{"cited_paper":"/paper/2106.11037","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:bcd7192a929c6847e1648bccb6f0d3bcd085be0d81eab9ffb9edd218786197f5","observation_id":"aa6ff910-867c-498e-a1d2-7e617f4523ef","resolution":{"observed_at":"2026-08-12T11:51:36.639392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12837","snapshot_observed_at":"2026-08-12T11:51:36.643103Z","title":"Re- thinking the role of demonstrations: What makes in-context learning work? arXiv preprint arXiv:2202.12837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.643103Z"},"links":{"cited_paper":"/paper/2202.12837","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:9fbae416e792986e0e02ba7d7997708ce30e0ebb91962558c37e79111d4374d2","observation_id":"75c98f74-21a1-4d88-866d-d8c7bbe263bd","resolution":{"observed_at":"2026-08-12T11:51:36.643103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.558841Z","title":"Hello gpt-4o","venue":null,"work_id":"690f2f11-1f52-4452-883e-c6165e759b97","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.647144Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:d1174427b11964a67eb7df64ed4fce51581915119144ee2e0a7aca1de3b5fa39","observation_id":"51a79e46-658e-4238-a5df-47473e2a79b3","resolution":{"observed_at":"2026-08-12T11:51:37.562773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.547040Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"5f34f954-1ec6-407d-97fb-f277d80848a3","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.650684Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:149ab37a631818eaa021e45a4294c915bc1cc310794ba769919aaa0b185d16bf","observation_id":"0d77cc97-9221-4cee-963b-4102636e98d2","resolution":{"observed_at":"2026-08-12T11:51:37.551335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.534149Z","title":"Infinite photore- alistic worlds using procedural generation","venue":null,"work_id":"6d6e8af4-bc75-4431-ac25-131c25a77f55","year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.654455Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:bba535dabecd00a079fece2db882e0413f2128f4e98409ee9958f955aa344850","observation_id":"cc83f082-d0bf-4aa2-9d8d-d9b60a586869","resolution":{"observed_at":"2026-08-12T11:51:37.539053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.521472Z","title":"Infinigen indoors: Photorealistic in- door scenes using procedural generation","venue":null,"work_id":"4596da65-12ca-428d-b8f9-d1b239340abe","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.657991Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:845375e23db636ccd2f21adf2b7fe095c359e9c454828301b1dd2f8c76669cb6","observation_id":"173c7417-6187-4002-ad2a-59641741db67","resolution":{"observed_at":"2026-08-12T11:51:37.525888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.508606Z","title":"Increasing generality in machine learning through procedural content generation","venue":null,"work_id":"d69fbe92-f9c4-4158-a6c0-6b6f3ac41cda","year":2020},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.662518Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:4430d6e99307e1eeb93f339d47690f6f29e4a24daa9dd2ac8e7c5041abb357f8","observation_id":"3d1acb60-6376-47bc-b999-8832970406ce","resolution":{"observed_at":"2026-08-12T11:51:37.513086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.666193Z","title":"Hypersim: A photorealistic syn- thetic dataset for holistic indoor scene understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.666193Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:09db09fb797fa715dc9c0518d7364ee11c9af6a4ab3978a795fe216e00cb72a4","observation_id":"478941de-aef2-4533-9a53-0bd99da99620","resolution":{"observed_at":"2026-08-12T11:51:36.666193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.489455Z","title":"Code llama: Open foundation models for code, 2024","venue":null,"work_id":"f3f96f58-4467-4ef1-9ddc-5f4f91433d46","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.669863Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:e62bd9416fbb8ebc0cb874920e4c5c09ad5cf34abf3bab216f5bbccb2a4cef77","observation_id":"4b5cdec3-c15e-43a5-83f0-b1251dc6c522","resolution":{"observed_at":"2026-08-12T11:51:37.493917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.477022Z","title":"Procedu- ral content generation in games","venue":null,"work_id":"2bd01409-e676-4a80-bd60-74c0a9c9f412","year":2016},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.674266Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:3457efc897a760fab502361519619c77aed9a2309376b51ec83c46533dd5e3bc","observation_id":"7b823bd7-4367-4f03-aa06-53a2e83e4188","resolution":{"observed_at":"2026-08-12T11:51:37.481046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.678247Z","title":"Match: Differentiable material graphs for procedural mate- rial capture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.678247Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:b96980a7e93bd1d8ee317a2e19056a840be62456106db0efb62703ec2f7db4e7","observation_id":"de1524a9-dd7a-4148-b71f-998cfd52479a","resolution":{"observed_at":"2026-08-12T11:51:36.678247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.457243Z","title":"3d-gpt: Procedural 3d model- ing with large language models, 2024","venue":null,"work_id":"d369ec8c-52df-4788-a564-ad1cc64cf3e9","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.681665Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:644dd0054d7a8342cb7c3921b15a2f9c32474795f53259405edadd998e40cb64","observation_id":"2616dbfe-f1e9-4bc6-8bc3-98aba7f8bdfc","resolution":{"observed_at":"2026-08-12T11:51:37.461519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10674","last_updated":"2024-05-17T10:09:09Z","snapshot_observed_at":"2026-08-13T00:05:13.831530Z","submitted_at":"2024-05-17T10:09:09Z","title":"From Sora What We Can See: A Survey of Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10674","snapshot_observed_at":"2026-08-12T11:51:36.686065Z","title":"From sora what we can see: A survey of text-to-video gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.686065Z"},"links":{"cited_paper":"/paper/2405.10674","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:6894df56a9dfcf7f716dfdbc360d79adc5aa935dd873b64a9dae281186793834","observation_id":"de78d63d-ec34-4b9e-9083-1ced24b15702","resolution":{"observed_at":"2026-08-12T11:51:36.686065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.445247Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":"c0602d3c-e82a-4784-9a1d-3f0ee26af9d5","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.689929Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:909ec93ba1d865dc683fa2e6fe53a1ba74dbb1c8b46e21d6e570ad953449d0a3","observation_id":"35c42830-7f81-4b6b-b2ab-a945fc0c9899","resolution":{"observed_at":"2026-08-12T11:51:37.449486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.433270Z","title":"Plan2scene: Convert- ing floorplans to 3d scenes","venue":null,"work_id":"57c11234-527d-48f9-838a-010c7d9f71df","year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.693914Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:d5116e7feb53478b9d8eda138285923998c1b0107d6f7f3178f160f8d96bc8b3","observation_id":"5e8ae297-a759-411a-9770-bb3739d1602d","resolution":{"observed_at":"2026-08-12T11:51:37.437649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-12T11:51:36.697452Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.697452Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:77584c6085f911c06a4df34a270bb2e3a7596a9ddd50adf4a76b5b065ec1fd6e","observation_id":"f5f5979b-2eb6-4602-b937-88dd4982242a","resolution":{"observed_at":"2026-08-12T11:51:36.697452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.419853Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"26b7d21c-6f65-4222-9c02-d37af38e8727","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.701460Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:83df14022f846bbd19b06613557fe4bd7fa6ef800ed2de991b2d0dafc7a37d69","observation_id":"9c7437bd-1edc-4ed2-a203-322ea7c6161b","resolution":{"observed_at":"2026-08-12T11:51:37.424665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-12T11:51:36.705105Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.705105Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:6eac4d94b4a8aa6c9baee30da62aa119bae5ca937e07b464f1976764c82ce851","observation_id":"53c526c2-ba5b-4e16-a0a2-fce03a11a694","resolution":{"observed_at":"2026-08-12T11:51:36.705105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.407205Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":"671d67d9-8f47-47ec-b60f-e3b445a9bf52","year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.709147Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:889f0584a5121f3dbfd749603aa6f749cd95b7c100cbaeb656c8975569e1aa58","observation_id":"13c5745f-5957-4fdf-9a45-66a25d844e47","resolution":{"observed_at":"2026-08-12T11:51:37.411351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.394810Z","title":"Using github copilot to solve simple programming problems","venue":null,"work_id":"e653ae1c-858b-4fac-84c8-5f025ed16aeb","year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.713080Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:4e5eb48f0b3a600a3fc1cd5381078c2e9c53a4fe386c95dacea0bd2fd10a7296","observation_id":"695716ce-a244-46b1-961b-36b4d7dd316d","resolution":{"observed_at":"2026-08-12T11:51:37.398697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.383290Z","title":"Gos: A large-scale annotated outdoor scene synthetic dataset","venue":null,"work_id":"74c4dc05-5813-465b-9a9c-47c4724007be","year":2022},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.717230Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:85a01bb9d497a7cd73a08672456726459968945c333270f0c29089b7035c5769","observation_id":"dc20be2e-b9ae-47a5-896a-0dddb2693112","resolution":{"observed_at":"2026-08-12T11:51:37.387241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.371779Z","title":"Sinnerf: Training neural radiance fields on complex scenes from a single image","venue":null,"work_id":"5f332a64-3673-4e60-af3f-a8df2f2fea1c","year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.720995Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:b2ebb697d98e57e596746ed970154d63a3cc5a0e3fe39c9d4e3801fb4e7e275f","observation_id":"125f1ea9-6c4e-4db1-873d-a3e5249dfef2","resolution":{"observed_at":"2026-08-12T11:51:37.375992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.725637Z","title":"Sketch2scene: Au- tomatic generation of interactive 3d game scenes from user’s casual sketches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.725637Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:faa8cafefe48c6872b08be953411ca339cc0e11cb87111185e96ca3f999a2c25","observation_id":"768e3953-6da1-4251-a53a-d873a9ce1c8b","resolution":{"observed_at":"2026-08-12T11:51:36.725637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.359112Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":"c032af5f-3c9a-4fd2-bbbb-2baf7fe76bd0","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.729531Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:c5fe8d395697d37c15cfbd592f6df05b092c62c314eb28f942fde488b62e0ef5","observation_id":"ff47d7b2-d3f4-4b38-9571-27fc760b2ef3","resolution":{"observed_at":"2026-08-12T11:51:37.363986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.346311Z","title":"Physcene: Physically interactable 3d scene synthesis for embodied ai","venue":null,"work_id":"09f8e1e0-1104-4547-8cd0-0946e6871bf8","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.733259Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:ebd3170bcd40c2d49b82a1235d35c8fdbcb51f6a0397be664c20fe68b0b91997","observation_id":"93ea9d9f-29fc-4392-b60f-281b28568756","resolution":{"observed_at":"2026-08-12T11:51:37.351547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.737082Z","title":"pixelnerf: Neural radiance fields from one or few images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.737082Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:77ed21f7009280a05f08a9defa30c2825546a38aed2d157fb883eb5e1b21ede7","observation_id":"cf5818cf-29ff-4351-bad2-42eae1ddae56","resolution":{"observed_at":"2026-08-12T11:51:36.737082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.326640Z","title":"Procedural modeling of rivers from single image to- ward natural scene production","venue":null,"work_id":"d156e825-d812-4773-92bd-35d1f7096e3e","year":2019},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.740980Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:efa3b2660153401a9eb0662c9d2f69496bae262c588b51c3cf473880075ccd78","observation_id":"742c0fce-3b61-41b4-92e6-a49e092886c0","resolution":{"observed_at":"2026-08-12T11:51:37.330862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:36.744776Z","title":"Text2nerf: Text-driven 3d scene generation with neu- ral radiance fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.744776Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:da52465e09f29c976a102da6eb14445737d3c5bf9206358c92786ff47598ca47","observation_id":"73389964-6bf4-4433-9121-0a6f28194f2d","resolution":{"observed_at":"2026-08-12T11:51:36.744776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15698","last_updated":"2024-12-17T14:39:07Z","snapshot_observed_at":"2026-08-13T00:47:29.218862Z","submitted_at":"2024-03-23T03:23:29Z","title":"SceneX: Procedural Controllable Large-scale Scene Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15698","snapshot_observed_at":"2026-08-12T11:51:36.748864Z","title":"Scenex: Procedural control- lable large-scale scene generation via large-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.748864Z"},"links":{"cited_paper":"/paper/2403.15698","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:842814ef8bea2def95c08392b556e60b17101dd5f56ebf1dcae1791c5062b7f0","observation_id":"8d8b72c9-1337-44e8-93b4-dc69c6df7172","resolution":{"observed_at":"2026-08-12T11:51:36.748864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.306943Z","title":"Scenex:procedural control- lable large-scale scene generation via large-language mod- els, 2024","venue":null,"work_id":"6ff6d773-7cfb-42ea-8e4d-15c8c4962760","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.752913Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:5cb3244340af1b668e2aabbe399aa8f4728d7d79fc4f112d1d4896ee03e43089","observation_id":"e0320b56-3a70-4714-9721-461f07452cf9","resolution":{"observed_at":"2026-08-12T11:51:37.311271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.293891Z","title":"Llafs: When large language models meet few-shot segmentation","venue":null,"work_id":"cc00249a-a878-46b2-b75c-b8a81e230b06","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.757126Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:fb8cc1bdb7bee2f17dddaab4cf1d2bb0295f240b135baa0ffe1ffeb5eea70c79","observation_id":"ec822d50-6b77-41c7-95d2-dfb16a09b238","resolution":{"observed_at":"2026-08-12T11:51:37.298929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.281468Z","title":"Wayvescenes101: A dataset and benchmark for novel view synthesis in autonomous driving, 2024","venue":null,"work_id":"fdd4eae3-fb33-4784-8784-bca417868b77","year":2024},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.760977Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:6cdbd8e1bcf048cfd28a7c223cd0ca6c1d9f277312e1862a85e32998fe0d88ab","observation_id":"aae77f5c-45bb-4943-9fb1-9538a2a013e6","resolution":{"observed_at":"2026-08-12T11:51:37.285566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.270165Z","title":null,"venue":null,"work_id":"6ed1cb73-6ea1-4954-83ed-07f3d367502f","year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.765060Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:694df7610ba591a2c1f91bb5cb74d027756c1422a5dbf7bedb5c2a3973666688","observation_id":"3c717d97-202c-4d83-bec2-e08ee73f7471","resolution":{"observed_at":"2026-08-12T11:51:37.274117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.258776Z","title":null,"venue":null,"work_id":"cb9204c7-814a-4115-aecf-be6c3fc4903e","year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.768862Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:d67db778795e61940ac9fe1e8faff00825539bee6def04e889135fee39298d5c","observation_id":"2ebce5d7-816f-4eba-8f24-1f1b9298a09e","resolution":{"observed_at":"2026-08-12T11:51:37.262767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.247237Z","title":null,"venue":null,"work_id":"b4a5b4dc-05d0-4cc8-be87-e9f4626c013f","year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.772647Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:41f495a1a357ffb434f4e6654863fbb833e7de75a3d702735604c8064423d636","observation_id":"ab4b681b-48d3-4f99-928c-e45bfe0700fc","resolution":{"observed_at":"2026-08-12T11:51:37.251088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:51:37.232342Z","title":"Important: The 〈thinking〉and 〈reflection〉sections are for your internal reasoning process only","venue":null,"work_id":"544908a9-7cea-4820-a120-79c9bc1da23a","year":null},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.776949Z"},"links":{"citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:0350a4db42827c58d58955d3a5ebecf5b4e69cb5a9382473299072ae8bf33826","observation_id":"f839dd52-862c-40e8-9477-4d47b9822ad9","resolution":{"observed_at":"2026-08-12T11:51:37.238608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:44:00.501108Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2411.18644."}