{"as_of":"2026-08-04T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84c938f5a91eaa018ea07bfaf9d7af417b93c3cb4cec87d76d290c031049b8f4","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T19:39:16.410139Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.12957/citation-record","integrity":"/paper/2605.12957/integrity","json":"/paper/2605.12957/citation-record.json","paper":"/paper/2605.12957"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the First International Conference on Computer Vision Theory and Applications, pp","venue":null,"work_id":"1049d4e3-1462-47b2-bdb6-b02c4116ae81","year":2006},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:d64c570cd12af9885f247fae9da01c80d2830c4b86fcc2623c25cb98a0e5d981","observation_id":"9097fda5-42bb-4359-af7e-b8276ceaa69b","resolution":{"observed_at":"2026-05-14T19:39:24.272121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17807","last_updated":"2024-01-31T13:06:48Z","snapshot_observed_at":"2026-07-06T17:23:05.927644Z","submitted_at":"2024-01-31T13:06:48Z","title":"Advances in 3D Generation: A Survey","version":1},"cited_work":{"arxiv_id":"2401.17807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.17807","snapshot_observed_at":"2026-07-01T00:25:09.869427Z","title":"Advances in 3d generation: A survey","venue":null,"work_id":"5e518ad7-f98d-40e8-9b03-847e2ecb266a","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2401.17807","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:01e935afd48b39fc12fd07dbbc44cc044043cc75a1ec5fb896d7cd372090db99","observation_id":"65450e5d-9451-43de-afc8-e4e324b11398","resolution":{"observed_at":"2026-05-14T19:39:23.553976Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"e2d3ffde-f71b-4b91-95ac-9eae123393f9","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:c46b3e724725b955116af131e3f46207f1fd2eeb6bf88094886d59f2241c4318","observation_id":"06ca3168-e64d-4149-be64-38d63c261fed","resolution":{"observed_at":"2026-05-14T19:39:24.298514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial Intelligence Review56(9), 9175–9219 (2023)","venue":null,"work_id":"b88f7f1b-dc14-4655-b0cb-ed48eae5c305","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:aa52b84c6413fc6db70c924f0feeabf9a2e9c32ffde440d096c7fb2081c9be96","observation_id":"052c6c09-3393-4180-8b0f-33dc6f73c2f4","resolution":{"observed_at":"2026-05-14T19:39:24.293156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05474","last_updated":"2025-05-08T17:59:54Z","snapshot_observed_at":"2026-07-06T21:21:05.912197Z","submitted_at":"2025-05-08T17:59:54Z","title":"3D Scene Generation: A Survey","version":1},"cited_work":{"arxiv_id":"2505.05474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05474","snapshot_observed_at":"2026-07-01T10:15:44.985602Z","title":"3d scene generation: A survey","venue":null,"work_id":"a1a77d70-f8f9-4076-add3-65d0886016fe","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2505.05474","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:56774675f0263e57662e626cdfa363ea9c6d5ece57feb030f2d0936b25659c7f","observation_id":"1704447d-816a-4324-82e2-d265a41bbead","resolution":{"observed_at":"2026-05-14T19:39:23.560248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Computer Vision112(2), 188–203 (2015)","venue":null,"work_id":"f86c279b-6bce-4f40-9d8a-2c87991cfc3a","year":2015},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:a120d13052711218e197abce5fbf1bf9982abffd24549bc5a188afa0261be1ea","observation_id":"1a7c67d5-3008-4742-b831-68fe255ef658","resolution":{"observed_at":"2026-05-14T19:39:24.282793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Computer Vision132(10), 4456–4472 (2024) 20","venue":null,"work_id":"ca2460eb-0ed6-45a0-8746-638cd9f1ad31","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:a8500e0253c6f7c3616cfbde5af6022e7d760f114960a01f4ef29482998acb33","observation_id":"25a56f9a-3fcc-4ec2-b755-33154d3a8db5","resolution":{"observed_at":"2026-05-14T19:39:24.267996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interna- tional Journal of Computer Vision128(10), 2534–2551 (2020)","venue":null,"work_id":"63512685-0e84-447c-9029-8d979dc74cd3","year":2020},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:636d496ea49035a86c8eebe4187da3e9dd447e825c030092dd51bc8cd0a40d04","observation_id":"0c421605-51fa-4de0-8830-576dbd0efd26","resolution":{"observed_at":"2026-05-14T19:39:24.272471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interna- tional Journal of Computer Vision133(5), 2886–2909 (2025)","venue":null,"work_id":"0482546a-9344-44f2-9083-2d3eb1659213","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b846116e7efc0dc07087b6d1a02c005ad26d1c1158a23c02dabcd3e8f96770c0","observation_id":"85645e86-5d9d-43e5-ab9f-48351ecfe0ef","resolution":{"observed_at":"2026-05-14T19:39:24.288210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interna- tional Journal of Computer Vision131(11), 2816–2844 (2023)","venue":null,"work_id":"0b99babf-ccca-4926-b039-acc1753b3b12","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:4f6bbe22f8cc90b1bb5d6913807f3d998645d3016f426ef5379d21ac1bedabb5","observation_id":"df555f3d-6710-45aa-9ec7-87e27f45619b","resolution":{"observed_at":"2026-05-14T19:39:24.278123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"3ebb0349-b323-4e7c-b033-3b2808e27244","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:5114c332f53174fea372d3484bb809371205f54ac47ae159cd16fa6df9e1e4d0","observation_id":"624661b5-5921-4b40-9785-b95ca8f11018","resolution":{"observed_at":"2026-05-14T19:39:24.179207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10600","last_updated":"2025-06-16T08:50:31Z","snapshot_observed_at":"2026-08-02T11:35:50.938932Z","submitted_at":"2025-06-12T11:43:50Z","title":"EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence","version":2},"cited_work":{"arxiv_id":"2506.10600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10600","snapshot_observed_at":"2026-07-04T10:49:46.451842Z","title":"Embodiedgen: Towards a generative 3d world engine for embodied intelligence","venue":null,"work_id":"60a29e77-ced1-486a-a32b-607339c75448","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2506.10600","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:ec401bd134c6fd4c934bf98c1554e029f1831c8867fe5fcae5d083397294936f","observation_id":"55d670ec-060a-4262-9cbc-aa13f973463e","resolution":{"observed_at":"2026-05-14T19:39:23.438683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-02T02:18:00.133799Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"cited_work":{"arxiv_id":"2509.07996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07996","snapshot_observed_at":"2026-07-21T03:22:29.733321Z","title":"3d and 4d world modeling: A survey","venue":null,"work_id":"0197d8fe-e11f-40f4-9254-87e63d981bf9","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2509.07996","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:0154fc5d446bc736fcc8e716c1bbf218269ca35835c4d401e884a9ac8ed1588b","observation_id":"409a2041-7df7-4def-9a2a-2643d5f783b5","resolution":{"observed_at":"2026-07-21T03:22:29.733321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Computing Surveys 58(3), 1–38 (2025)","venue":null,"work_id":"e5a64bc5-17fb-4387-9aca-0cbfe3802f38","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:889d455ee9a51bb7d3d53e304e33be31412c29c34128ee81b93a06b559baa87e","observation_id":"069373a7-eee4-4c32-84a6-4660f0bd751a","resolution":{"observed_at":"2026-05-14T19:39:24.142871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"34464dca-f75d-4cc3-87d3-5e99277b524c","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:28e3d2158fcc28983847266d7c3c1fcbeac2f3111e4c1f061b0c22727e1fef92","observation_id":"71b703ce-75a5-493b-84f8-3c8a35ae3038","resolution":{"observed_at":"2026-05-14T19:39:24.073928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":"2209.14988","doi":"10.48550/arxiv.2209.14988","metadata_source":"pith","pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","venue":"cs.CV","work_id":"7529df29-9980-4a8a-b55e-307e3c2f357b","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:0ac3c4b5ababfa384e01eb74f8a4431082c761662e20a9584232130365cf9dea","observation_id":"98331e12-8812-498b-90ce-fbee626d1396","resolution":{"observed_at":"2026-05-14T19:39:23.496328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:01.924447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:01.924447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"3a7d3d3c-2ecc-4289-bc8e-5241a81c0d47","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:be3f1968f4a49437dd9ce7e9a7bc2f1bc81993b420690249761391ad6cd4c939","observation_id":"f3c09bed-7def-48bf-8407-238588d09afc","resolution":{"observed_at":"2026-05-14T19:39:24.120072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Inter- national Conference on Computer Vision, pp","venue":null,"work_id":"af2a2716-df3d-4e79-9cb9-fe047e3d7b87","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:40973ad4c0c90ca52787a5ef198a4bc0119713c9570c49028fd90b14ed58a4e4","observation_id":"daad5753-6eb6-4459-8037-02cf1f756b20","resolution":{"observed_at":"2026-05-14T19:39:24.118293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"1b4eda3c-15a1-4ec9-a02b-79cff68e62ef","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:aa37ffa293d9d39dd83e13fca4fd6c7a5477eac0eba4c345a53a40780f567598","observation_id":"d740ed3b-0095-4b91-8f7b-5c0403547217","resolution":{"observed_at":"2026-05-14T19:39:24.101907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:91e70b3369b24f352bf0928275d8ec106b21803b231f944aa475adb0e88b999c","observation_id":"c8d5072a-e192-4abf-822d-64474e47295e","resolution":{"observed_at":"2026-05-14T19:39:23.463338Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Com- puter Vision, pp","venue":null,"work_id":"d99ca4db-72f9-4f15-ba74-ae20d4561802","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:aa9db163c23b18b96345847b199eb238344e5c9716ad3d09b133e207d8672c3c","observation_id":"232f7f3a-7221-4567-87a9-a01407d4305e","resolution":{"observed_at":"2026-05-14T19:39:24.192778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: SIG- GRAPH Asia 2024 Conference Papers, pp","venue":null,"work_id":"213c8211-d6e0-4c68-bbc5-aa905f9d0cde","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:7c3a0a83ca3137ae757d89cfc99d63e30651ddd2d169bec113f4c4b30c9511e9","observation_id":"5a369e40-a1df-4c39-b18c-204556f9c5eb","resolution":{"observed_at":"2026-05-14T19:39:24.157882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-02T14:57:48.676109Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:8464496c8076f89396440d2efb3b79cbbbcba00ca874c018966e3fa5a75eb1a2","observation_id":"e847931f-721f-4a66-8405-5d49e270f879","resolution":{"observed_at":"2026-05-14T20:34:53.267725Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:5537b93481e9ecbac17d4145e53ab978419626040817b3d76b9325379e90524a","observation_id":"8dc8fe02-ae02-4b84-9d97-9f945aa585c6","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-07-06T19:46:50.403301Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":"2411.04928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-07-07T14:33:54.345685Z","title":"Dimen- sionx: Create any 3d and 4d scenes from a single image with controllable video diffusion","venue":"cs.CV","work_id":"c0c2b97f-2c4b-4f39-b154-6ced939a883d","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:8ebaaed3e66ed3272d5332c7cb7f4ff863689e2d817820de5edf645ba6ef9adb","observation_id":"f1cd2688-4729-4590-987f-92b7fa53a40d","resolution":{"observed_at":"2026-05-14T19:39:23.538276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"da316f73-0f11-4d5f-96f7-ed466e9c44f7","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:0525a6059003ecebc352076804cc5310c6a917e6e796096995c43e66c7dd8855","observation_id":"e40401fc-5561-4a8f-9789-9592c690a073","resolution":{"observed_at":"2026-05-14T19:39:24.197536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"1780262d-bc26-41e5-b4df-afd8fcb1c28e","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:3d816136bce77ee3cfb7885ed0c8b38abbdb55137dcd06a8977c1554de641f09","observation_id":"24225c09-ab84-49bb-9b75-a9f357a87b15","resolution":{"observed_at":"2026-05-14T19:39:24.174576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":"2409.02048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-07-07T14:03:48.606626Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","venue":"cs.CV","work_id":"af2e8736-e001-407f-b94e-21e98f89ec55","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:32bb22a72ecb6f88ed8d399875849c2092f092c2b33df7422d8412e175d738da","observation_id":"159930a4-16ea-437c-9bf1-c4f85200aae5","resolution":{"observed_at":"2026-05-14T19:39:23.435450Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"4d30e156-acca-4e04-ae8c-73fd375b9ac9","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:8b8286f0681eaabf2bd399a8d0073ee57dae460a11b805e12d062ce0b0525a26","observation_id":"d2637e77-5c3d-4c00-be24-a5d83bb10a93","resolution":{"observed_at":"2026-05-14T19:39:24.221238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:971b9a502a122811eb38e2ca7a00dcd585c6884d5f3e6fc4cb15e194717e2971","observation_id":"f4ba53a4-b482-47f3-8c98-bf2a07674512","resolution":{"observed_at":"2026-05-14T19:39:23.508614Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ACM SIGGRAPH 2024 Conference Papers, pp","venue":null,"work_id":"8b7303c6-fcaa-4638-9fe8-2b689dc81f34","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:46effae5b49bd65f6f36cf47629d89676a83fe0df43bca85277827e009c00e13","observation_id":"7b07cd39-d014-4019-b99d-bd13a56dadea","resolution":{"observed_at":"2026-05-14T19:39:24.026598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Transactions on Graphics (TOG)44(6), 1–15 (2025)","venue":null,"work_id":"65155e51-086a-41c5-897a-11f8eef66b36","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:11ac30b33687f70bebd1152886c84fbfadc08af62e50a260d2ff5aaea3224186","observation_id":"d58e9eac-855f-48b2-bae4-70164d0dbf36","resolution":{"observed_at":"2026-05-14T19:39:24.216890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.383019Z","title":"Fantasyworld: Geometry-consistent world modeling via unified video and 3d prediction","venue":null,"work_id":"96b4282a-775b-40f8-a4dc-a6ddb2d050fa","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:708b1fec201537868d73a9933fe14eec29efb79b696935169a478966550422f3","observation_id":"0a4a4ff6-71ef-4077-8fb5-69aff102573c","resolution":{"observed_at":"2026-05-14T19:39:23.546069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2511.23127 (2025)","venue":null,"work_id":"61209707-2975-48aa-a164-ce3234866853","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:dfca3663768eac065f029ccc579257d04518b94c56d4fe66feffd1bdae3caa10","observation_id":"a4a506e7-dca3-4dd3-a5e5-e4881bf0a366","resolution":{"observed_at":"2026-05-14T19:39:23.513976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive psychology9(3), 353–383 (1977)","venue":null,"work_id":"a768fc2d-6be1-43dc-973b-28fb8e0eb3ff","year":1977},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:e51de365733272c120a1fe21806730fd819448ef0543390a1e1dcab2b7ef5b7a","observation_id":"891d9fd4-0fa8-45e5-b829-8556a02d0012","resolution":{"observed_at":"2026-05-14T19:39:24.212279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of the Opti- cal Society of America A4(10), 2006–2021 (1987)","venue":null,"work_id":"a9855c89-63b9-42c6-bec6-b89d49980118","year":2006},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:50320e451e263c703cab51bf4b9b0be72d9fc5091d38c7326b28dc4a8d548c66","observation_id":"59db2d8e-ca12-4848-a36e-89cbb5157bb9","resolution":{"observed_at":"2026-05-14T19:39:24.167009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Computing Surveys57(2), 1–42 (2024)","venue":null,"work_id":"56a74733-16f1-4ffc-a8d6-977549ffd9a1","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:e9395c943d74b1804b09e0265b3280ff2f5f2f8266c1474c7169e1144abfbe5f","observation_id":"0f4bfa7b-b8ed-4cf0-9787-79f173687fd3","resolution":{"observed_at":"2026-05-14T19:39:24.209820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Computing Surveys58(6), 1–35 (2025)","venue":null,"work_id":"0561f688-04d7-4f85-9b54-2050bb1ae601","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:d655d7dad28bb26eb1e87f86279eb0ca5e27e18b53ae986498a8ac964a6f5469","observation_id":"b755346f-c6a4-4e65-b5a8-2277860dffba","resolution":{"observed_at":"2026-05-14T19:39:24.213575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial Intelligence Review58(11), 338 (2025)","venue":null,"work_id":"df6f4805-40ec-4a8b-8c1e-9618c3de402a","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:71122b0157ac1594d9c52cf8c7f3278302609bc18b080f0a5426eef492e90609","observation_id":"83a0d08d-0db3-4b84-9caf-73d2a6ccd386","resolution":{"observed_at":"2026-05-14T19:39:24.170658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and 22 Pattern Recognition, pp","venue":null,"work_id":"7252ec97-d27e-496d-8fb7-8a0dae350da6","year":2018},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:9b4cf2e40e18d9e34de121c5f99823bb55621ea6b46efa37bfb8ea056c054fe2","observation_id":"9c54046c-2a93-41ff-a86e-c124c7fbaacf","resolution":{"observed_at":"2026-05-14T19:39:24.255200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceed- ings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"efb9224c-95e5-4497-94e5-8f7f424b81ce","year":2018},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:049d5dde5d3110df43dc36ed33e19635274e2e96d465e160ef6a05b3d2258c53","observation_id":"2eb69874-94d0-4f5f-824a-d835d19bd6f2","resolution":{"observed_at":"2026-05-14T19:39:24.078414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:e887bd3d5b39c81c02010af250659480e120521100a465b30359c29befc60f50","observation_id":"16c55b4a-7a2e-4cbd-a63f-072df8152b39","resolution":{"observed_at":"2026-05-14T19:39:23.507759Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems37, 29489– 29513 (2024)","venue":null,"work_id":"7a512aa9-68d0-4a35-ae70-c073c27779ff","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:f4c8de7cce4171d2896fa13e2267d878f286925ed9f67bc73490b76f397ea81a","observation_id":"d4a38439-ebca-4dce-a452-acc1bb52c67e","resolution":{"observed_at":"2026-05-14T19:39:24.162611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"0c27bff5-fab8-4536-8f20-da8351779336","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b6dc8db60ae903d88861ce7dcf5e86ee6004522d6555bfc79770c4d0fa44076d","observation_id":"f1754eb4-2005-42ed-9731-7a555825a920","resolution":{"observed_at":"2026-05-14T19:39:24.069737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Computer Vision 133(5), 3059–3078 (2025)","venue":null,"work_id":"f7679a5c-ca15-41b2-887a-44ad1fa4e56c","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:c7b7e59ef21306b230971edde29960723b477119767d5588da052fcf13c868ee","observation_id":"a0314f0a-dc1f-4b86-8a77-a0e4dc4a23bb","resolution":{"observed_at":"2026-05-14T19:39:24.230919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"48c92fad-08c7-4864-8b4b-fe55127b98f3","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:e8c4ab483983e84b014964d179d02103844fd1cb771f6c73d4bbc80a2d84197f","observation_id":"9014f510-a537-41dd-a104-b721a7019620","resolution":{"observed_at":"2026-05-14T19:39:24.183210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:47:05.833119Z","title":"Controllable video generation: A survey.arXiv preprint arXiv:2507.16869","venue":null,"work_id":"a9598a61-86be-4dc1-9b59-62c3641e0113","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:8443adcaba4ffda8ff42a4adb70859d3ae3fd4d88290da1d89a753e9302707a7","observation_id":"c71e59d8-75b2-4efe-8708-988136f03760","resolution":{"observed_at":"2026-05-14T19:39:23.532668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"f700954a-b1b3-43e7-a21e-6d1d16f9f467","year":2018},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:581c41019ad7dff5cc8845da24b9f9da5852321f4d8285e838cb6e1e0519f86d","observation_id":"239b3c76-25d1-465f-a236-3fb64c6a57d3","resolution":{"observed_at":"2026-05-14T19:39:24.087029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"4ce5f129-fe09-4d72-b3b3-1e5b29651a0e","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:2636f1f94dc60b93ce518ce35e11359fdeda31b034be24b4c56c7a42d52cce19","observation_id":"5ea7c983-16ee-4626-88a2-86e7050d1cbc","resolution":{"observed_at":"2026-05-14T19:39:24.082892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ACM SIG- GRAPH 2024 Conference Papers, pp","venue":null,"work_id":"ce58d5ba-081b-46fd-9d89-1acebf27f844","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:2d5b5e125b462ecf4b0c3d60ada89a172bd8dc649d35f991d1ee6cf1aa99c497","observation_id":"5e07adf8-aac8-4193-b2f9-ed5854db3abb","resolution":{"observed_at":"2026-05-14T19:39:24.259620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16407","last_updated":"2024-03-25T03:47:53Z","snapshot_observed_at":"2026-07-06T17:49:52.751335Z","submitted_at":"2024-03-25T03:47:53Z","title":"A Survey on Long Video Generation: Challenges, Methods, and Prospects","version":1},"cited_work":{"arxiv_id":"2403.16407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16407","snapshot_observed_at":"2026-07-02T12:26:56.735824Z","title":"A survey on long video generation: Challenges, methods, and prospects","venue":null,"work_id":"2c0053e5-bf22-4d26-beac-e6b5f277f0d7","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2403.16407","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:50eaa750979beefae2e4b54c8ba21d33f01996f923e361228e74cad82d3fc6d0","observation_id":"fb6c872f-e6c3-45be-b0df-db303aec2f41","resolution":{"observed_at":"2026-05-14T19:39:23.448664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"1c8cafcf-ae86-4142-a783-584ae3ce874f","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:d2bf0685fe150eb60eaaaf7c035591ef98cbe19b51b00b2172da6a02f75097b1","observation_id":"6aaa0ea7-a7bd-45f8-8eb0-9811eab2add7","resolution":{"observed_at":"2026-05-14T19:39:24.172187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recog- nition Conference, pp","venue":null,"work_id":"8bc44346-13b8-461b-86a4-799199ca0027","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:86c90ad32e005503609289753ac887a302310d7b106850c94882359280451bed","observation_id":"722ac9b7-7939-4205-bf52-069f75d96fda","resolution":{"observed_at":"2026-05-14T19:39:24.168533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems 37, 131434–131455 (2024)","venue":null,"work_id":"ef7a53df-4892-4d78-9b2e-a49acd5949b7","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:88bf7968ea1161dcdcae9c549c032afbf507bbe1a51a6efebefc81c826c9b3b6","observation_id":"625a29d2-17d4-452e-830c-5708b9cdf476","resolution":{"observed_at":"2026-05-14T19:39:24.044997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bidirectional sparse attention for faster video diffusion training","venue":null,"work_id":"9835cbda-7ae1-4c7f-8e6e-e32994eea87d","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:a818edde108426db7fe4ee19d35924815cc21be27eb51f4c2b6d40148eb40c58","observation_id":"e9764e44-67f5-4bf6-a93f-d75319927a02","resolution":{"observed_at":"2026-05-14T19:39:23.519903Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer 23 Vision and Pattern Recognition, pp","venue":null,"work_id":"b0b067f1-a176-4b10-af15-94aec3b619af","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:7703e3ea7f73cea0a514d7e7d895e2f89f332acd3d282883843019112f5628ba","observation_id":"4c538df8-94ec-4909-9fb4-f6a7c57a54d4","resolution":{"observed_at":"2026-05-14T19:39:24.175765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-07-06T15:58:43.241452Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":"2307.14073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-07-04T03:29:29.500903Z","title":"Videocontrolnet: A motion- guided video-to-video translation framework by using dif- fusion model with controlnet","venue":null,"work_id":"cdaa110c-ff52-47fb-accc-b153c0213976","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:df1d582bffc0fee77556f7f8e59c524c7a7fd3ec23a2183092992fd36dc97290","observation_id":"edc118c8-2bb9-4c2d-a369-0991112a71ce","resolution":{"observed_at":"2026-05-14T19:39:23.526496Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:59:42.121465Z","title":"Mixture of contexts for long video generation.arXiv preprint arXiv:2508.21058","venue":null,"work_id":"b800ec2a-ab41-48e3-a98d-a26b4942bb2a","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:9386c0fc8d8b2786173653f097ce141dc4c78f7733d6424298beafb84911c522","observation_id":"c34c8fa8-94e6-4f73-8d15-50911a53ec82","resolution":{"observed_at":"2026-05-14T19:39:23.526166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems36, 8406– 8441 (2023)","venue":null,"work_id":"19d62fa3-90df-4aa6-9266-c832f3a46cf2","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b78748ccb41272cecb60cdb404297fed311793cf9fcc9745b930f6c4478bc498","observation_id":"a5deb092-a0b5-4cad-b2da-7db5cecf58b6","resolution":{"observed_at":"2026-05-14T19:39:24.205715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"be232fb5-67e1-4c3e-91b8-ba7368567f3a","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:283f9027456c37d6aa07612c7cd398d6625ab8aa7164e70a2dadf22f296e2702","observation_id":"97e65404-5853-4693-9d4a-5bfb3541d5cd","resolution":{"observed_at":"2026-05-14T19:39:24.088216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"08c17c52-05d8-4916-bd10-a8b5c6682c9f","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:92e25e10bf7f42efd31511ba80009560225c3f0e0be434406f71f81a2f850584","observation_id":"cff6a2c0-ca38-4403-9c3f-d0570a53bafc","resolution":{"observed_at":"2026-05-14T19:39:24.111168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"6ea09f48-b2b1-4037-95f0-568b90d9ea94","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:cf027c68f29e419a3b2e4b33f8e1f28d3df8c208770c8d77226b6aed606f0ac9","observation_id":"6825fffa-b70e-4da2-a3ff-2f63b3f2c0c3","resolution":{"observed_at":"2026-05-14T19:39:24.231195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"01e7ce07-3567-4fe9-9f4a-cc6513afb46e","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:9f9e1566c9f5d0beff1b091d6619eca4bf4289880317884c2419bbf0bc8a0615","observation_id":"baa21025-5de8-400e-9c81-3b11e94f9ca3","resolution":{"observed_at":"2026-05-14T19:39:24.155087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"fc7c097a-d85c-4bc3-a335-2330c15a0415","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:a54a84abf7b7abc62823becb72363c0c9dbc213ecf4378b78119c4526fe6f5d8","observation_id":"d845de5a-dd61-4817-8d6c-fbdb73567b87","resolution":{"observed_at":"2026-05-14T19:39:24.149562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems36, 22226– 22246 (2023)","venue":null,"work_id":"79b69a0b-2dc4-473f-97c7-b776daeb3581","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:daa743147bbce9ec9456d3824576dad6e9cfafb732a1d002a660d47fdd10c287","observation_id":"c503edb9-aed1-4769-a540-8d931e764e99","resolution":{"observed_at":"2026-05-14T19:39:24.236451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"0c498ae7-e9da-4652-8516-d690b4feb62a","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b0d20f5ddade0c6d9ab63dcd41fb1855efc19b306a566bb8d012b5059086d6e4","observation_id":"868051ea-bc84-4d31-b4e6-f9f10ef9a18d","resolution":{"observed_at":"2026-05-14T19:39:24.164386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"0f44bfea-46f7-4085-aeb9-3e411c4b01bc","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:af5bdb8a27e1d08669a171da4292509b45d1f8a0fcb544a108f21070127e230a","observation_id":"c86e20f7-edb9-4f7a-8a0d-efe3742abc0e","resolution":{"observed_at":"2026-05-14T19:39:24.187490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion, pp","venue":null,"work_id":"e3d3a2c4-af28-4016-b7df-3f8e4d174747","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:6ddd4596b183a241fb945c4c1488073f35c2fd38b535174132d261fb3e6d0e23","observation_id":"866b06ad-891d-4b11-be46-e36d231c922c","resolution":{"observed_at":"2026-05-14T19:39:24.217406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-07-06T16:51:06.781541Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":"2311.13384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-07-04T13:49:51.650606Z","title":"Luciddreamer: Domain-free gen- eration of 3d gaussian splatting scenes","venue":null,"work_id":"24a684d2-afbc-461d-9ff8-92fa3c51ff4c","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:0515e9d1aa60408aaa2ae315eba04d8f02f91d7ed8ac83b2d08d8d5eae1ef924","observation_id":"b9c925e8-78d0-4aec-a0c3-574ee6d9d27e","resolution":{"observed_at":"2026-05-14T19:39:23.533443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pat- tern Recognition Conference, pp","venue":null,"work_id":"19f306c7-178d-43af-8e16-8723bb9b7b82","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:218a69badbddb7679b0f9cf844b82ad88c7f6c4e75e985298b3bd9160ebb6dbd","observation_id":"27fe4bca-ec18-49ac-9a84-611a753a5106","resolution":{"observed_at":"2026-05-14T19:39:24.147267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02261","last_updated":"2025-04-03T04:10:47Z","snapshot_observed_at":"2026-07-06T21:03:26.104352Z","submitted_at":"2025-04-03T04:10:47Z","title":"WonderTurbo: Generating Interactive 3D World in 0.72 Seconds","version":1},"cited_work":{"arxiv_id":"2504.02261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2504.02261 (2025)","venue":null,"work_id":"4fc91260-6210-4ceb-a44d-7e74a3429c64","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2504.02261","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b60e6a8f8d31ba9d21f5886393fc605768dca540d22a06f080b7eca89b1db513","observation_id":"071c8dd0-49c9-4c04-8bd8-04a933641be8","resolution":{"observed_at":"2026-05-14T19:39:23.539721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13265","last_updated":"2025-03-19T08:26:31Z","snapshot_observed_at":"2026-07-06T20:54:00.272496Z","submitted_at":"2025-03-17T15:18:38Z","title":"FlexWorld: Progressively Expanding 3D Scenes for Flexiable-View Synthesis","version":2},"cited_work":{"arxiv_id":"2503.13265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13265","snapshot_observed_at":"2026-07-05T16:51:14.282275Z","title":"Flexworld: Progressively expanding 3d scenes for flexiable-view synthesis","venue":"cs.CV","work_id":"a1fe36bf-a902-4767-be84-e37081ae64e8","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2503.13265","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:45e68ba1899af0a818c132219d7fbe2d99c8d6fe9cb50249e287c533694267cf","observation_id":"ba25342a-341f-4e50-acf6-9ab676a9698b","resolution":{"observed_at":"2026-05-14T19:39:23.514524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: 2025 International Conference on 3D Vision (3DV), pp","venue":null,"work_id":"bd61f6c1-f065-4753-a284-0978059179d1","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b56a6b568964afdefca994bc3d96ff6ba5c45f865c5f232f03a18f3129e8badf","observation_id":"263f65e2-ebca-4bd2-bc7b-800e5eee77be","resolution":{"observed_at":"2026-05-14T19:39:24.131053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"ef7b837e-e0ca-4d8f-9b93-5715b2dc6fbe","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:362cba43c91ad7d8e970a9904feb7722f13bcbf41502e4a5db74b64b161c7dca","observation_id":"cba3e222-1dc6-4c4a-a796-3b4fd37766e7","resolution":{"observed_at":"2026-05-14T19:39:24.115517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"46d002d9-b881-47d4-aca8-eb851cbc2f1d","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:8db80108a9db825e05e5c4ea42c3eb70cabe8958a388ec625ef9df8fe6e7d94c","observation_id":"b1a206d3-4809-4c67-8c0d-eccf0fa97eff","resolution":{"observed_at":"2026-05-14T19:39:24.226229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems33, 6840– 6851 (2020)","venue":null,"work_id":"fa819775-2f12-4827-856b-d5bf1cd634d8","year":2020},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:2245ab189f77478c70f9c0285f53e0369ce2945d0a9b3178f87fc63a81aec5de","observation_id":"ac1d1ebc-9ab0-4aaa-962c-4d489eb220c9","resolution":{"observed_at":"2026-05-14T19:39:24.201728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems35, 8633–8646 (2022)","venue":null,"work_id":"d093940b-8db0-46a2-9e30-dd05b89b35ee","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:b843107356874a4feb43453c21f5581dfc1923093a238fa641a10b6f3d6628b5","observation_id":"03dbf02f-a22c-402a-b8af-e72e63866bfe","resolution":{"observed_at":"2026-05-14T19:39:24.222530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"1ee5c7e6-a991-452d-9c1b-34f9540aedbb","year":2022},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:965165e8adcc7ec2d48eade071c556004294c34db4dd0b7d41523a38cdb0a005","observation_id":"37580a44-85d5-4124-8b87-cf3f39e4c183","resolution":{"observed_at":"2026-05-14T19:39:24.245821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"6e1ea99e-dd24-418a-b514-7769e50f5487","year":2016},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:1b7eeebbbac69f02eedb5b6a46d224ce3d7c83fba89f1ad0617d2fa1909fad6e","observation_id":"c84702a4-db52-41ca-bdad-fe65dd1e82c1","resolution":{"observed_at":"2026-05-14T19:39:24.187886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d82dc04a-7f75-4d3b-832d-cb870f7790f5","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:d0aece8193a98b4e9f4da6fc73eb2e6e61425fd8870745f52c8a7a352ee005f2","observation_id":"b82f5a7f-884e-446e-b0c9-b5d40419692c","resolution":{"observed_at":"2026-05-14T19:39:24.236113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-07-06T06:41:05.545426Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":"1805.09817","doi":"10.1145/3197517.3201323","metadata_source":"pith","pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","venue":"cs.CV","work_id":"f6abb68f-df5c-4569-af1b-9ede43a44468","year":2018},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:f284a92d2e8a7976e11db757a847659b9c67fe5fa4864a58e94f718f62c5571a","observation_id":"e0cb7f61-0de9-4ccf-88bc-2b99a0c87a16","resolution":{"observed_at":"2026-05-14T19:39:23.476389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05638","last_updated":"2025-03-07T17:57:53Z","snapshot_observed_at":"2026-08-03T18:13:43.768525Z","submitted_at":"2025-03-07T17:57:53Z","title":"TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models","version":1},"cited_work":{"arxiv_id":"2503.05638","doi":"10.48550/arxiv.2503.05638","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05638","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Trajectorycrafter: Redirecting camera trajectory for monocular videos via diffusion models","venue":null,"work_id":"a82fed40-e96b-4d33-834b-f0ab36c82d56","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2503.05638","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:60eae62519fc9e453560e36c8c81ef7f22c73ad0f81d5221cbbeeedfd9e8aa4d","observation_id":"1420a960-5bec-4c51-b6c5-9bd44991e114","resolution":{"observed_at":"2026-05-14T19:39:23.410882Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":"2312.17090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-07-08T01:44:26.160588Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","venue":"cs.CV","work_id":"2a0ee74c-0c50-4cd3-91ce-b75cc297715e","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:c9752a63fe67e9f136b16c278851e7839f9f95e567ab5cd196a198026e06d9c4","observation_id":"d076b35b-2140-466e-8a82-2cc3d5a20eaa","resolution":{"observed_at":"2026-05-15T16:35:48.845096Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:94031b317a58eef86835818f26a92821969d3ba92dc2ddf2550d3ccb62ac6af5","observation_id":"e447fa58-de48-483e-83e8-d1c6926b74ad","resolution":{"observed_at":"2026-05-14T19:39:23.495415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Pro- ceedings of the Computer Vision and Pat- tern Recognition Conference, pp","venue":null,"work_id":"8b69dc1e-e13c-46bc-ad90-17f5b95513be","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:084ecb8e8e10ae694f44de44c65e9b4fa4727ba32d4b2154a754d0d6f3b50175","observation_id":"44bf464e-cf88-45b4-909c-b3c5f5f16b51","resolution":{"observed_at":"2026-05-14T19:39:24.241584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"83a0003a-e8d9-48fb-9e4c-64211d1bde20","year":2025},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:9d7a5c9f7acdac986918548fe91b0d0821aa83a74c84df29debff359620ec033","observation_id":"84020691-92e4-4043-bcd7-b95a329097af","resolution":{"observed_at":"2026-05-14T19:39:24.250842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems37, 21875–21911 (2024) 25","venue":null,"work_id":"07463d4f-c66c-489e-b586-4f44dd67719d","year":2024},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:fc44beeb0a8f8993a8372af5b8cb89f42620883a16c6c45507866a216d124638","observation_id":"5d45e4bd-c57e-423e-8e7a-b13e1a2961b1","resolution":{"observed_at":"2026-05-14T19:39:24.226881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":22,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":61},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2605.12957."}