{"as_of":"2026-08-07T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd0b9a7700b3b68749232c9ee068da2cbb835e9e664e06db31d10deca012ac84","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:02:28.913510Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:05:34.406350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:15:44.967658Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":"2507.21045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-01T10:15:44.967658Z","title":"Reconstructing 4D spatial intelligence: A survey","venue":null,"work_id":"d1dfd87a-04ea-454f-810f-0e3484b07ed5","year":2025},"citing_paper":{"arxiv_id":"2510.17568","last_updated":"2026-08-04T12:59:26Z","snapshot_observed_at":"2026-08-07T09:12:32.700401Z","submitted_at":"2025-10-20T14:17:16Z","title":"PAGE-4D: Disentangled pose and geometry estimation for vggt-4d perception","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T06:19:22.275116Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2510.17568"},"observation_digest":"sha256:4dad537f23203dff565ef7bb1b7609f3f3e09943e9a5b6c36b1bbdc031674bb2","observation_id":"72d89ce9-bfa9-4f90-bf78-3f2b92e094c1","resolution":{"observed_at":"2026-05-18T06:20:58.410981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-08-04T09:05:34.406350Z","title":"Reconstructing 4D spatial intelligence: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17568","last_updated":"2026-08-04T12:59:26Z","snapshot_observed_at":"2026-08-07T09:12:32.700401Z","submitted_at":"2025-10-20T14:17:16Z","title":"PAGE-4D: Disentangled pose and geometry estimation for vggt-4d perception","version":7},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T09:05:34.406350Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2510.17568"},"observation_digest":"sha256:4b90765299b33fd90d5b9456920e7e0a6acc558e7b8b5c150bfe9549870de25d","observation_id":"bfd21bf4-25c7-4aa3-8d80-60f0a11e5ca2","resolution":{"observed_at":"2026-08-04T09:05:34.406350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-08-04T08:45:14.759040Z","title":": Reconstructing 4d spatial intelligence: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.19255","last_updated":"2026-06-15T21:42:55Z","snapshot_observed_at":"2026-08-05T15:00:58.411417Z","submitted_at":"2025-10-22T05:22:20Z","title":"Advances in 4D Representation: Geometry, Motion, and Interaction","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T08:45:14.759040Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2510.19255"},"observation_digest":"sha256:5003294dfb8bf2e3b3a7faeebc779015b4e643ed62c5f77325ef3234e874ba71","observation_id":"19c1df8a-7ddf-4f7d-9f4b-fa45b3533431","resolution":{"observed_at":"2026-08-04T08:45:14.759040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":"2507.21045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-01T10:15:44.967658Z","title":"Reconstructing 4D spatial intelligence: A survey","venue":null,"work_id":"d1dfd87a-04ea-454f-810f-0e3484b07ed5","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:cc763f2d5fbfaccfb417488704742cb4efd07d195713ba6c380e5621634687bf","observation_id":"e3cc3bbe-5995-4340-bc0c-6b0b1414eb61","resolution":{"observed_at":"2026-05-16T13:47:57.520596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":"2507.21045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-01T10:15:44.967658Z","title":"Reconstructing 4D spatial intelligence: A survey","venue":null,"work_id":"d1dfd87a-04ea-454f-810f-0e3484b07ed5","year":2025},"citing_paper":{"arxiv_id":"2604.07923","last_updated":"2026-07-01T09:11:07Z","snapshot_observed_at":"2026-08-02T22:35:45.631804Z","submitted_at":"2026-04-09T07:45:51Z","title":"Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:19.044269Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2604.07923"},"observation_digest":"sha256:bb01e7d4ca27af8475bd85dcb433fee454be6ba3cb5d00b9c1391d21d118bfc4","observation_id":"812886aa-9395-4f1a-8867-a7bc8e618169","resolution":{"observed_at":"2026-05-11T05:31:00.499998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-13T00:10:18.016312Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07923","last_updated":"2026-07-01T09:11:07Z","snapshot_observed_at":"2026-08-02T22:35:45.631804Z","submitted_at":"2026-04-09T07:45:51Z","title":"Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T00:10:18.016312Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2604.07923"},"observation_digest":"sha256:3053cfd8cfa26cd2057fdd4222e378e83fe4b330bc7178b1f6210b01d126014d","observation_id":"943342c0-c503-42a4-a790-556bb57acd82","resolution":{"observed_at":"2026-07-13T00:10:18.016312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":"2507.21045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-01T10:15:44.967658Z","title":"Reconstructing 4D spatial intelligence: A survey","venue":null,"work_id":"d1dfd87a-04ea-454f-810f-0e3484b07ed5","year":2025},"citing_paper":{"arxiv_id":"2605.14462","last_updated":"2026-05-14T06:56:57Z","snapshot_observed_at":"2026-08-02T11:43:51.742393Z","submitted_at":"2026-05-14T06:56:57Z","title":"Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:51.976969Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2605.14462"},"observation_digest":"sha256:ae0c0351a330b36207d1a5a35e89e3ef9621f4cbe61701692505e205e218a7a3","observation_id":"7a00b81c-1662-4420-93a9-f7de33928076","resolution":{"observed_at":"2026-05-15T02:49:41.510037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":"2507.21045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-01T10:15:44.967658Z","title":"Reconstructing 4D spatial intelligence: A survey","venue":null,"work_id":"d1dfd87a-04ea-454f-810f-0e3484b07ed5","year":2025},"citing_paper":{"arxiv_id":"2606.31388","last_updated":"2026-06-30T09:16:21Z","snapshot_observed_at":"2026-08-02T07:18:38.830324Z","submitted_at":"2026-06-30T09:16:21Z","title":"One Video, One World: Turning Monocular Video into Physical 4D Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T05:38:19.541391Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2606.31388"},"observation_digest":"sha256:e158b38eb591176782aa0ae22d7220ebf6a138d029e1c76c3cd848b0ae2636b4","observation_id":"8f327591-e523-40e7-9771-937a58c48eb4","resolution":{"observed_at":"2026-07-01T10:15:44.970278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21045","snapshot_observed_at":"2026-07-31T01:49:33.542976Z","title":"Reconstructing 4D spatial intelligence: A survey.arXiv 2507.21045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28625","last_updated":"2026-07-30T17:59:50Z","snapshot_observed_at":"2026-08-06T22:06:04.216657Z","submitted_at":"2026-07-30T17:59:50Z","title":"ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T01:49:33.542976Z"},"links":{"cited_paper":"/paper/2507.21045","citing_paper":"/paper/2607.28625"},"observation_digest":"sha256:a7c439b5e0a0d2557ba386fc4b26fa5ed78c8118d645c692d210f2bf9d43a0dd","observation_id":"26bc1c29-aea4-4686-8583-c5ab3534f2c9","resolution":{"observed_at":"2026-07-31T01:49:33.542976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21045/citation-record","integrity":"/paper/2507.21045/integrity","json":"/paper/2507.21045/citation-record.json","paper":"/paper/2507.21045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.419368Z","title":"Neural point-based graphics,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.419368Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:43b65d70d3059b444c37a2120efa91579db68760aa36184bb70712ea20d973f3","observation_id":"c6e7ff7f-c07b-46cf-82f6-1756d3af94b7","resolution":{"observed_at":"2026-08-06T13:02:28.419368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.425203Z","title":"Deep video portraits,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.425203Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:df21b089165d13044792b43f57cb333d1a9d3929825d64ed3290da952d1d980b","observation_id":"a1e9439e-57fc-46ea-9c81-33ad30398450","resolution":{"observed_at":"2026-08-06T13:02:28.425203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.430574Z","title":"Fov-nerf: Foveated neural radiance fields for virtual reality,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.430574Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:d85c0c102650ae4209e6e9120896b6cac238981cdf0c3222c3178dfa889bab61","observation_id":"c1a7844c-9afb-4a4f-80c8-49cc637865d0","resolution":{"observed_at":"2026-08-06T13:02:28.430574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.435742Z","title":"Instant-3d: Instant neural radiance field training towards on-device ar/vr 3d reconstruction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.435742Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e366b20e680b617ebf10fbd503544659812a1b8a666c17e3c00bca63216cb3f5","observation_id":"f1308af7-0091-4275-9884-107bc55a7e00","resolution":{"observed_at":"2026-08-06T13:02:28.435742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-06T13:02:28.441307Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.441307Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:adf4b93eb7dfe7452eb31f2502694badefb64f62c3f4dccaeeecc073ddd7e537","observation_id":"d11c3e30-22fb-4d8a-bc94-76b53e6e1d85","resolution":{"observed_at":"2026-08-06T13:02:28.441307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06665","last_updated":"2024-04-29T23:21:33Z","snapshot_observed_at":"2026-07-06T17:28:10.554625Z","submitted_at":"2024-02-06T17:15:33Z","title":"The Essential Role of Causality in Foundation World Models for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06665","snapshot_observed_at":"2026-08-06T13:02:28.447709Z","title":"The essential role of causality in foundation world models for embodied ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.447709Z"},"links":{"cited_paper":"/paper/2402.06665","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:bc1c1babc347e1b313e71ac7bbe1495c0e49cb099b2a589d2c1c6b07ca54a456","observation_id":"10b34215-92ce-4319-a3b9-465a753d4ec2","resolution":{"observed_at":"2026-08-06T13:02:28.447709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T13:02:28.454159Z","title":"An embodied generalist agent in 3d world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.454159Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:7517cfa925b153e00bb000de62709411aeb699d7fa6b9e6bb3ae486ee1256997","observation_id":"08f6783d-50f3-49c1-b0aa-eaffd47c4d48","resolution":{"observed_at":"2026-08-06T13:02:28.454159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T13:02:28.459549Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.459549Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:5a79ea37a5129300d428fc7be997b3bfb15653ee95357de742c81500ca5ceda6","observation_id":"cbe25985-f876-4a60-ab34-47c1b18f445c","resolution":{"observed_at":"2026-08-06T13:02:28.459549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.464591Z","title":"Recent advances in 3d gaussian splatting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.464591Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:1a1c3591d695b895d5ddf8c31b66209040626cecdd14abfe382e37186f1e769e","observation_id":"12475e8c-247c-47c1-b67b-f839ece9e26e","resolution":{"observed_at":"2026-08-06T13:02:28.464591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.469592Z","title":"3d gaussian splatting as new era: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.469592Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:c6df1536ef2a742e45707f09462e1984aecaf1a8df9d5c93c20a9ac0f70244fe","observation_id":"f5aae689-edcb-470c-8ff1-fc3d8c5d79ff","resolution":{"observed_at":"2026-08-06T13:02:28.469592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.474115Z","title":"Stereo matching algorithm based on deep learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.474115Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:ff2863b10ea9a77ce7781ec02bb4e900a7ea7a9905be5e42574b61ee611c3316","observation_id":"8f860274-898a-4c50-92db-2087b2bdd7e2","resolution":{"observed_at":"2026-08-06T13:02:28.474115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.479707Z","title":"Review of stereo matching algorithms based on deep learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.479707Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:f232f2c110a55d8b65d083c3a90cc1263eb7751c7d06408e5b47bff4ca9d72a2","observation_id":"8a6f37d9-86e6-4149-ad3e-b98bd52ccb78","resolution":{"observed_at":"2026-08-06T13:02:28.479707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.484726Z","title":"A sur- vey on deep learning techniques for stereo-based depth estima- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.484726Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:bfcc4a3b271026ae6699ba66612a4d7fa22c0f281b0c3a015bbf71767d2e8114","observation_id":"e335c623-4028-4dd5-9e27-2a7a37828bf5","resolution":{"observed_at":"2026-08-06T13:02:28.484726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00379","last_updated":"2026-02-12T16:09:50Z","snapshot_observed_at":"2026-07-06T13:58:37.592838Z","submitted_at":"2022-10-01T21:35:11Z","title":"NeRF: Neural Radiance Field in 3D Vision: A Comprehensive Review (Updated Post-Gaussian Splatting)","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00379","snapshot_observed_at":"2026-08-06T13:02:28.489403Z","title":"Nerf: Neural radiance field in 3d vision, a comprehensive review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.489403Z"},"links":{"cited_paper":"/paper/2210.00379","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9d503e3cded546046a037052b0479b41c2c6a967b8e3057e58326a7de8c942ab","observation_id":"8199cb7a-909d-4cf8-93ed-c88a93082c50","resolution":{"observed_at":"2026-08-06T13:02:28.489403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.494181Z","title":"3d gaussian splatting: Survey, technologies, challenges, and opportunities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.494181Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:40115da6660b7482f1b900fd925bd856a87d2be91309979cec99edf72bc7b933","observation_id":"b8434432-44e7-42c3-8fd5-39b8219a516a","resolution":{"observed_at":"2026-08-06T13:02:28.494181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01333","last_updated":"2025-07-02T01:46:31Z","snapshot_observed_at":"2026-08-07T03:19:09.642620Z","submitted_at":"2024-05-02T14:38:18Z","title":"NeRFs in Robotics: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01333","snapshot_observed_at":"2026-08-06T13:02:28.498546Z","title":"Nerf in robotics: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.498546Z"},"links":{"cited_paper":"/paper/2405.01333","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:73a9fb8eefb582a960846179b5258ca2baa0237a904865ab812db7ca615fbd84","observation_id":"9fd19c95-e2bf-4a49-a4dd-3d524cef8f84","resolution":{"observed_at":"2026-08-06T13:02:28.498546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.503607Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.503607Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:b93f2a37bd4e6b00ee4a3a7940c082b2cac8b5b128c53b62c5a0e4d2e670ca61","observation_id":"1a0fa5f9-580b-44b7-91e1-6dbd12b14ae0","resolution":{"observed_at":"2026-08-06T13:02:28.503607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.507780Z","title":"Deep marching tetrahedra: a hybrid representation for high-resolution 3d shape synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.507780Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:1e0dcba7026a54a5bcb817765440cfc11fad34a6c55f66eb3f5e9ef0869f39dd","observation_id":"f3979560-811f-43b3-878a-647906ce60ce","resolution":{"observed_at":"2026-08-06T13:02:28.507780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.512197Z","title":"3d gaussian splatting for real-time radiance field rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.512197Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:5f0083a5b777c91ff085d02d4bae78612e5cb07ebd87345d059c821b38269259","observation_id":"511d9e9f-576b-4770-82c7-cfa382134a63","resolution":{"observed_at":"2026-08-06T13:02:28.512197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.517181Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.517181Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:b8b97ae14098920dc9856a02ce7d17b7ce28ec47065465ea98c298ec648f0fce","observation_id":"128e6d1b-aa1c-4e0b-908a-a210d71abd99","resolution":{"observed_at":"2026-08-06T13:02:28.517181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-06T13:02:28.524542Z","title":"Imagen video: High definition video generation with diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.524542Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:82dd868cb6146f52397e7b2fe37c8e5710e7b4697c19654d4b6c64582f2dbe4f","observation_id":"666c0483-83c7-428b-95bc-bb04896ddbff","resolution":{"observed_at":"2026-08-06T13:02:28.524542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T13:02:28.529792Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.529792Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:dfb67dd5a1724db534b04e91d9ca15bb44961a6235ccf5f98d9eb0d2e60aa50a","observation_id":"257614ee-a28b-41f6-999c-cb64003f62ae","resolution":{"observed_at":"2026-08-06T13:02:28.529792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.537987Z","title":"Sift: Predicting amino acid changes that affect protein function,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.537987Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:495846a8f98d02956b877a9fdb2a89e7717fa159cc7d7a456932102857584448","observation_id":"0026f052-50fe-44d6-915c-ec1f4a5599d9","resolution":{"observed_at":"2026-08-06T13:02:28.537987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.543574Z","title":"R2d2: Reliable and repeatable detector and descriptor,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.543574Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:aec620d280dc6f2f4faa588744e00a5e47484516fbfc1b9254b057cdcd268065","observation_id":"2a0b0285-bac7-4c27-a7d8-22b012cef2a3","resolution":{"observed_at":"2026-08-06T13:02:28.543574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.548175Z","title":"Superpoint: Self- supervised interest point detection and description,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.548175Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e2f85e9b915e7a0f5244f26753804571cb95eb184fca758fa09483432da098af","observation_id":"366d6eb0-b2f1-4fb9-a9b7-fbec2de8975b","resolution":{"observed_at":"2026-08-06T13:02:28.548175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.553255Z","title":"Superglue: Learning feature matching with graph neural net- works,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.553255Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:7423a3bda628c8dfff06a4ba4dcabf64636467f1af37ac904e326459c349ff33","observation_id":"88fd6f4b-98b3-4e1d-a9e7-0c90f73a8496","resolution":{"observed_at":"2026-08-06T13:02:28.553255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.557555Z","title":"Loftr: Detector- free local feature matching with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.557555Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:ab403e5fbb85fea7a09b2c87b003ec68fcbebfebcb4a02785078776c80537776","observation_id":"5e6d1284-c534-45e4-bd56-f4cc777e0d14","resolution":{"observed_at":"2026-08-06T13:02:28.557555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.562152Z","title":"Neural-guided ransac: Learn- ing where to sample model hypotheses,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.562152Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:4639b8dedf648fdf2a1ebc98495872d61c21795b29f7c261cbcaf8858f00a415","observation_id":"34d7f5a8-f705-49c1-961c-b4919e2e17ac","resolution":{"observed_at":"2026-08-06T13:02:28.562152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.566848Z","title":"Lightglue: Local feature matching at light speed,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.566848Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:d31aaddccf473dcab72c3b233672c74bb0966bcf85827d85f6f6147f34157e63","observation_id":"ec9b5140-aafd-484a-9d94-94f5280c877b","resolution":{"observed_at":"2026-08-06T13:02:28.566848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15381","last_updated":"2023-07-28T08:05:36Z","snapshot_observed_at":"2026-07-06T15:59:38.850337Z","submitted_at":"2023-07-28T08:05:36Z","title":"AffineGlue: Joint Matching and Robust Estimation","version":1},"cited_work":{"arxiv_id":"2307.15381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.15381","snapshot_observed_at":"2026-08-06T13:02:32.717939Z","title":"AffineGlue: Joint Matching and Robust Estimation","venue":"cs.CV","work_id":"cb7170ff-993b-4fb8-88cb-e612f7610c01","year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.571255Z"},"links":{"cited_paper":"/paper/2307.15381","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:141f109b764a87c80cee054b307ae80afb4e10ed0fe493937e409a3547456b0e","observation_id":"975cc149-dd51-4be9-9ffc-494037e71293","resolution":{"observed_at":"2026-08-06T13:02:32.777980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.576091Z","title":"Structure-from-motion revis- ited,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.576091Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:16d8d5326a605cc925805197f5c9c2e88d8f06a565b740447f6b3f24d01cc7fd","observation_id":"41971552-fc4a-4857-96ce-5a32801b96a5","resolution":{"observed_at":"2026-08-06T13:02:28.576091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.580811Z","title":"A survey of structure from motion*","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.580811Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:0ef154574659c05e2877afd28beb71010a71681dba108117eac614786b8340a5","observation_id":"4f06510c-a1b3-4d1c-ab3b-5167dfb6e869","resolution":{"observed_at":"2026-08-06T13:02:28.580811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.585947Z","title":"Structure from motion photogrammetry in forestry: A review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.585947Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:efbbd7197ca0c76ab9e761a14e3a9b19400f15b6a120b879b6ec2f7b96fc5335","observation_id":"40f9676d-8e61-4347-a1a2-d8b1ec8294ca","resolution":{"observed_at":"2026-08-06T13:02:28.585947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.591059Z","title":"Pixel- perfect structure-from-motion with featuremetric refinement,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.591059Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:8b4565be56c929d3e37438349b8ba949b6d042d9f3d54482e3cfbf08a3c2f05d","observation_id":"6dcf4a3e-a2fc-4040-bcf7-c900a80f725b","resolution":{"observed_at":"2026-08-06T13:02:28.591059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.597662Z","title":"Bundle adjustment in the large,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.597662Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:89ecb8bdbff0d146c3f1297efd7e6625c570b3fb53099c2fec411e292ab22e03","observation_id":"38862f6b-859d-407d-803c-782905b38a5e","resolution":{"observed_at":"2026-08-06T13:02:28.597662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.602366Z","title":"Bundle adjustment rules,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.602366Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:ce3fa941965053628aef1982e22a3fd58f14a6c5137118a66986a4a86941fe2d","observation_id":"8746f4f0-2a83-4795-ab42-403380c68b94","resolution":{"observed_at":"2026-08-06T13:02:28.602366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.608307Z","title":"Robust bundle adjustment revisited,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.608307Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:68c1a9714a6e2bf31d754127f66309f7a126def22fda006a989909989a198d92","observation_id":"b5996345-34e6-4457-8242-e100488ec87f","resolution":{"observed_at":"2026-08-06T13:02:28.608307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.612979Z","title":"Bundle adjustment—a modern synthesis,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.612979Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:3736b3f2114d83637cf86862b6d466f9bb41d7b606370cedba1a8d1315d05caa","observation_id":"33e0e349-8f07-450c-9408-e2e420ca138f","resolution":{"observed_at":"2026-08-06T13:02:28.612979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.617699Z","title":"Pixelwise view selection for unstructured multi-view stereo,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.617699Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9490b90a1ba0ddbd2a9b004164e5cadee1f67481b93b69e3568dabbe4a1e24a8","observation_id":"e92b7b1a-159a-4835-8bbf-ec6e49f89f62","resolution":{"observed_at":"2026-08-06T13:02:28.617699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.622713Z","title":"Visibility-aware multi-view stereo network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.622713Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:92463a95a9719549c3f0d78dac0ea9a7f902d5dfbdf387d52b7d1bcb2fd5c2f3","observation_id":"7f42f9e8-75a4-4f72-9793-c0f850207b64","resolution":{"observed_at":"2026-08-06T13:02:28.622713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.628213Z","title":"Cost volume pyramid based depth inference for multi-view stereo,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.628213Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:a10b780da9bd494eab524216e104595224224a8a681c4df6dea13507b23f0b53","observation_id":"10f2e351-bd53-4dfb-ad38-1942653ea95a","resolution":{"observed_at":"2026-08-06T13:02:28.628213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.633394Z","title":"Patchmatchnet: Learned multi-view patchmatch stereo,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.633394Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:f8316a89f77c58bad77814fe519fe1ff9fb1f4a9072227f00b8659bb11632280","observation_id":"aa00828e-46ef-4130-a524-759172ae9bd9","resolution":{"observed_at":"2026-08-06T13:02:28.633394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.637870Z","title":"Cascade cost volume for high-resolution multi-view stereo and stereo matching,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.637870Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:c5733cbdfc5ef8894cc65ff41d3f7800b73646651ca1f9a495941dbe99183bd8","observation_id":"9f86db23-6669-415c-8b5c-c8aec544bfc9","resolution":{"observed_at":"2026-08-06T13:02:28.637870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.642579Z","title":"Dust3r: Geometric 3d vision made easy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.642579Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9086abc52e5d2dcbff07856168d2bc37be55af52ca6c81c98dc2d5432f508349","observation_id":"67445b25-e7cd-4187-b631-553b8cc354dc","resolution":{"observed_at":"2026-08-06T13:02:28.642579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12392","last_updated":"2025-06-02T13:44:10Z","snapshot_observed_at":"2026-07-06T20:08:12.033767Z","submitted_at":"2024-12-16T23:00:05Z","title":"MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12392","snapshot_observed_at":"2026-08-06T13:02:28.647067Z","title":"Mast3r-slam: Real- time dense slam with 3d reconstruction priors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.647067Z"},"links":{"cited_paper":"/paper/2412.12392","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:1f6cd87c2e5d3786e2f74773f6ddc34ec9fa2c593a069ec7601d4ce8250cc04a","observation_id":"40dc9659-ae0c-48ff-a452-0fe0c59f6063","resolution":{"observed_at":"2026-08-06T13:02:28.647067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-06T13:02:28.651730Z","title":"Monst3r: A simple approach for estimating geometry in the presence of motion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.651730Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:ac45904dc8380be41dc319fec607a48c561edaa60b5c571eb6255b017047315a","observation_id":"7cb70d8f-b439-43c4-b707-d76e823d6213","resolution":{"observed_at":"2026-08-06T13:02:28.651730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03079","last_updated":"2024-12-05T14:16:07Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T07:09:59Z","title":"Align3R: Aligned Monocular Depth Estimation for Dynamic Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03079","snapshot_observed_at":"2026-08-06T13:02:28.656186Z","title":"Align3r: Aligned monocular depth estimation for dynamic videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.656186Z"},"links":{"cited_paper":"/paper/2412.03079","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:62ebb5ed3a9d630bcbe9dd4eedad6dd29ee69f48437928a23b5158bdee745c85","observation_id":"16f5040d-184b-4b9c-a63c-8153ed52ecbb","resolution":{"observed_at":"2026-08-06T13:02:28.656186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13928","last_updated":"2025-03-19T19:35:52Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:55Z","title":"Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13928","snapshot_observed_at":"2026-08-06T13:02:28.661267Z","title":"Fast3r: Towards 3d recon- struction of 1000+ images in one forward pass,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.661267Z"},"links":{"cited_paper":"/paper/2501.13928","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:8497d085c45be7784f7aa13c30b7aec84f323bb221dbcbd327a1b28284ca0bbc","observation_id":"a2e8551b-ae97-4353-9b5b-f15144821955","resolution":{"observed_at":"2026-08-06T13:02:28.661267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.666024Z","title":"Transformer in transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.666024Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e5c3c28bbe3cfca68ba6cdc5db0e25b885cf4c5d6428c6e3d433dc609e48ba62","observation_id":"252328cb-b926-4f86-bd4c-91d26f82b493","resolution":{"observed_at":"2026-08-06T13:02:28.666024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.670423Z","title":"A survey on vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.670423Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:a967135bb69370bfd941f937bba30f94980aecdd15cf756795e0509f9c80ee76","observation_id":"92a1cd8b-87db-47c2-b35f-dfbd5da7ecae","resolution":{"observed_at":"2026-08-06T13:02:28.670423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-06T13:02:28.674898Z","title":"Reformer: The efficient transformer,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.674898Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:52803f2496de28e4d35e9a64645c37b8f1c6242537265c41e9dc586d70f7df1e","observation_id":"0acb0fbc-e236-4bd8-bd30-88373d6024f3","resolution":{"observed_at":"2026-08-06T13:02:28.674898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.680102Z","title":"Point trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.680102Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:a664a9d582b47f2eb6cdcd4238aa2fdd2f41f505943a0c2840dca37c9149392b","observation_id":"d1abb665-928f-4dcc-b32e-895830f01ed2","resolution":{"observed_at":"2026-08-06T13:02:28.680102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.684907Z","title":"Image transformer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.684907Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e8d24c99d59a2eb01b77e732919c5575667d1d278d3fe7fe7d4efaf087d79b33","observation_id":"41334d01-311f-40ab-98a5-0cdb94ed2091","resolution":{"observed_at":"2026-08-06T13:02:28.684907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.689601Z","title":"Vggt: Visual geometry grounded transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.689601Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e89627599522b6ae12a3a236e2e4ef6295ca77f261ddeb6f3a1b3f984ac58676","observation_id":"4ba37fd8-008c-4704-ab3c-9c67cdb302ec","resolution":{"observed_at":"2026-08-06T13:02:28.689601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.694509Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.694509Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:8f30201868c563a04a65ea39f6106f74762d67a30f2ad49d73e14cc73d60b069","observation_id":"7bf2e189-bced-459c-8c02-910aecd87fd4","resolution":{"observed_at":"2026-08-06T13:02:28.694509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.699278Z","title":"3d gaus- sian splatting for real-time radiance field rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.699278Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:aec699a30cd34cfd56a1f45588905e7d9522ab4473a62bb1642b8700d7b51634","observation_id":"75832935-0107-4abd-9507-d9d6ce408870","resolution":{"observed_at":"2026-08-06T13:02:28.699278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.703915Z","title":"Flexible isosurface extraction for gradient-based mesh optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.703915Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:5af9007f71c0c618db33f4051cac1f05db373a1ee804e48fa3ed2b5a0f118e6f","observation_id":"f3ed81cb-827d-4f4d-8a80-e9afd7176447","resolution":{"observed_at":"2026-08-06T13:02:28.703915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.708634Z","title":"Nerfies: Deformable neural radi- ance fields,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.708634Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:b6c21db77ecaf5866cd932ee9749477302468a72a1e10391fbb3fec0b0e5fa39","observation_id":"58544010-9747-49eb-a24f-7aa9b4cc55ed","resolution":{"observed_at":"2026-08-06T13:02:28.708634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.713660Z","title":"Non-rigid neural radiance fields: Reconstruction and novel view synthesis of a dynamic scene from monocular video,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.713660Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:29077c6f7dc2ce53d7d99aabbb1c16639707d7888010d48257c98dcf8086bc77","observation_id":"3ec67928-0e2a-4aa6-a42e-001e9f2c5e9e","resolution":{"observed_at":"2026-08-06T13:02:28.713660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13228","last_updated":"2021-09-10T06:34:46Z","snapshot_observed_at":"2026-08-01T21:25:58.883569Z","submitted_at":"2021-06-24T17:59:03Z","title":"HyperNeRF: A Higher-Dimensional Representation for Topologically Varying Neural Radiance Fields","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13228","snapshot_observed_at":"2026-08-06T13:02:28.718303Z","title":"Hypernerf: A higher-dimensional representation for topologically varying neu- ral radiance fields,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.718303Z"},"links":{"cited_paper":"/paper/2106.13228","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:5215173eb510cc6a9cc33453e07a2948ebb0c8a40549667a2a849b4a4900fc42","observation_id":"25647800-e458-40c8-83d9-bad5b9cb2faa","resolution":{"observed_at":"2026-08-06T13:02:28.718303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.723527Z","title":"Dylin: Making light field networks dynamic,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.723527Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9d2307587cbaaa81477bfc35bc82e8b9ad8870f07810b2d29803187a3d1de5cc","observation_id":"6fab469c-8dc3-46c0-b145-0966e13ca41e","resolution":{"observed_at":"2026-08-06T13:02:28.723527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17249","last_updated":"2025-03-25T16:10:41Z","snapshot_observed_at":"2026-07-06T19:38:00.663759Z","submitted_at":"2024-10-22T17:59:56Z","title":"SpectroMotion: Dynamic 3D Reconstruction of Specular Scenes","version":3},"cited_work":{"arxiv_id":"2410.17249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.17249","snapshot_observed_at":"2026-08-06T13:02:32.385813Z","title":"SpectroMotion: Dynamic 3D Reconstruction of Specular Scenes","venue":"cs.CV","work_id":"9e109631-5766-43cd-81c7-90dcadf08155","year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.728580Z"},"links":{"cited_paper":"/paper/2410.17249","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:377591ccc564fba64e374bdba383ef005f5e342642112c46ff9d06e340449c13","observation_id":"3e8d9ef5-3ef1-494f-91be-707486e89ee3","resolution":{"observed_at":"2026-08-06T13:02:32.458725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.733564Z","title":"Neural scene flow fields for space-time view synthesis of dynamic scenes,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.733564Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:c1c621670a8e2eac0ddca84c0667d91f074c2edbe7aa9aaa43167a3353c36317","observation_id":"526f613c-91df-41a4-8f49-b0487d07a375","resolution":{"observed_at":"2026-08-06T13:02:28.733564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.738151Z","title":"Dynamic view synthesis from dynamic monocular video,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.738151Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:f970c4d429ff012369b120ff372e7fdd2315fcf9f59cedc851f5749e80a8de04","observation_id":"a71e1f89-d020-4bcf-b018-61b28b62c8ba","resolution":{"observed_at":"2026-08-06T13:02:28.738151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.742732Z","title":"Decoupling dynamic monocular videos for dynamic view synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.742732Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:30625222c244e0ebb7180ae6c01740d473c1842b4f464cfbc18a7d42cc332fe9","observation_id":"a371938b-1eff-4c0e-8579-f9c0477f8d8e","resolution":{"observed_at":"2026-08-06T13:02:28.742732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05994","last_updated":"2021-05-12T22:38:30Z","snapshot_observed_at":"2026-07-06T11:08:59.470370Z","submitted_at":"2021-05-12T22:38:30Z","title":"Neural Trajectory Fields for Dynamic Novel View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05994","snapshot_observed_at":"2026-08-06T13:02:28.747523Z","title":"Neural trajec- tory fields for dynamic novel view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.747523Z"},"links":{"cited_paper":"/paper/2105.05994","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:fed9c5ca94fe0dca11e60790e60a08f993d6c0c1eed4171a50acc5d4da6d61cf","observation_id":"d96fb4e2-fee4-4077-9bc0-3bed4844e37e","resolution":{"observed_at":"2026-08-06T13:02:28.747523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.752556Z","title":"Neural scene chronology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.752556Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:8a3934adbe21cbce694fdb0d08fbe8b5d74b93b1f1bacec01df01618d3a186bd","observation_id":"7ff990da-bae3-42d4-9fc9-72024058345b","resolution":{"observed_at":"2026-08-06T13:02:28.752556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.757472Z","title":"Darenerf: Direction-aware representation for dynamic scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.757472Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:63c3f3b44a436ffb6830149f062f2ee9b09ba18f1ce4d8085c919da20f669509","observation_id":"3f50f4f7-ed4f-49e8-910e-d7795452af69","resolution":{"observed_at":"2026-08-06T13:02:28.757472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02077","last_updated":"2023-11-03T17:59:55Z","snapshot_observed_at":"2026-08-03T23:31:39.294900Z","submitted_at":"2023-11-03T17:59:55Z","title":"EmerNeRF: Emergent Spatial-Temporal Scene Decomposition via Self-Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02077","snapshot_observed_at":"2026-08-06T13:02:28.762758Z","title":"Emernerf: Emer- gent spatial-temporal scene decomposition via self-supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.762758Z"},"links":{"cited_paper":"/paper/2311.02077","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e63cb0356c771cd10fc83a1cecce946f4990e9e69caa5ff6ec0fe07f3897e5b5","observation_id":"a685bbb5-ed60-4461-86a5-cb65df421f0e","resolution":{"observed_at":"2026-08-06T13:02:28.762758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.767767Z","title":"Gravity-aware monocular 3d human-object reconstruction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.767767Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:7da0bfc1f5d41dbea3514b2d131caf47dd0cb1d0ada7c88edb2fc2c2058c1af4","observation_id":"860b554d-8800-41a5-bb7d-103f99e7ed60","resolution":{"observed_at":"2026-08-06T13:02:28.767767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08420","last_updated":"2021-08-19T00:49:01Z","snapshot_observed_at":"2026-07-06T11:39:26.575335Z","submitted_at":"2021-08-19T00:49:01Z","title":"D3D-HOI: Dynamic 3D Human-Object Interactions from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08420","snapshot_observed_at":"2026-08-06T13:02:28.772694Z","title":"D3d-hoi: Dynamic 3d human-object interactions from videos,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.772694Z"},"links":{"cited_paper":"/paper/2108.08420","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9999edd2a3706f112a69569ad0222ebae955b9cf7793d5e91de2aa7c8704690c","observation_id":"e28055c2-e59e-4a3c-9788-d9d469d14fab","resolution":{"observed_at":"2026-08-06T13:02:28.772694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.777960Z","title":"Behave: Dataset and method for tracking human object interactions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.777960Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:5f9a6a2e947fb134267bb6fe02c3f70c487ec935c7e9a5109a950133a505aa82","observation_id":"6cd655e2-5df6-46d1-a02b-f6585917cccd","resolution":{"observed_at":"2026-08-06T13:02:28.777960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.782864Z","title":"Intercap: Joint markerless 3d tracking of humans and objects in interaction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.782864Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:ddd286f4deace70a7177e05f4d529d40b33ed4de80c39f0aa4956a4cccf3d2f9","observation_id":"eab26ea9-9390-45fd-9aa1-59a539bea58f","resolution":{"observed_at":"2026-08-06T13:02:28.782864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.787541Z","title":"Full-body articulated human-object inter- action,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.787541Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:fb0f46591fd7bf5a945989aff2745b9efaa5d76dd3ef2bee851cbd38ab9e7ea0","observation_id":"b1f9718c-3c71-424d-9eb2-10345d3c733b","resolution":{"observed_at":"2026-08-06T13:02:28.787541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20545","last_updated":"2024-07-30T04:57:21Z","snapshot_observed_at":"2026-07-06T18:53:44.274398Z","submitted_at":"2024-07-30T04:57:21Z","title":"StackFLOW: Monocular Human-Object Reconstruction by Stacked Normalizing Flow with Offset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20545","snapshot_observed_at":"2026-08-06T13:02:28.792493Z","title":"Stackflow: Monocular human-object reconstruction by stacked normalizing flow with offset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.792493Z"},"links":{"cited_paper":"/paper/2407.20545","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:3f4c5e1d7820f248cae1ca5b7e04d9d846cc49f1204a6a350f3c4a2fbcce15df","observation_id":"fefc755b-2754-417e-9266-ac0ce537708c","resolution":{"observed_at":"2026-08-06T13:02:28.792493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.797346Z","title":"Monocular human-object recon- struction in the wild,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.797346Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:701cc4a3e8838b7e52fb7a226be13c3f1850687f0186826d6ebc449108f43ef1","observation_id":"9fcbd8cd-8965-44e7-94c7-6ddf8bd7ba76","resolution":{"observed_at":"2026-08-06T13:02:28.797346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.801891Z","title":"I’m hoi: Inertia-aware monocular capture of 3d human- object interactions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.801891Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:432006d0ae1295d0a922e7e7ed96132a54ac3c5456b1cad155deb383e547ae44","observation_id":"0adb414a-c4d3-4366-9166-fa9a10709aff","resolution":{"observed_at":"2026-08-06T13:02:28.801891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17470","last_updated":"2025-02-27T21:52:39Z","snapshot_observed_at":"2026-08-04T05:24:01.192706Z","submitted_at":"2024-07-24T17:59:43Z","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17470","snapshot_observed_at":"2026-08-06T13:02:28.806630Z","title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.806630Z"},"links":{"cited_paper":"/paper/2407.17470","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:245d4537c9c2df70f6c8041c86cc962baf36081ea6d134e65be1acfbc60a8068","observation_id":"98d946b5-81dd-48e5-bc77-2497abca4b06","resolution":{"observed_at":"2026-08-06T13:02:28.806630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13953","last_updated":"2024-08-25T22:26:46Z","snapshot_observed_at":"2026-08-06T11:13:19.673489Z","submitted_at":"2024-08-25T22:26:46Z","title":"InterTrack: Tracking Human Object Interaction without Object Templates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13953","snapshot_observed_at":"2026-08-06T13:02:28.813129Z","title":"Intertrack: Tracking hu- man object interaction without object templates,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.813129Z"},"links":{"cited_paper":"/paper/2408.13953","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:a673be38cf8b99c54a34df6250401e42442ccb84f0a293d55797782a95cb57fd","observation_id":"434af2c3-3f40-490a-ab10-e58855fe3860","resolution":{"observed_at":"2026-08-06T13:02:28.813129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07164","last_updated":"2024-10-09T17:58:56Z","snapshot_observed_at":"2026-08-04T12:29:41.675680Z","submitted_at":"2024-10-09T17:58:56Z","title":"AvatarGO: Zero-shot 4D Human-Object Interaction Generation and Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07164","snapshot_observed_at":"2026-08-06T13:02:28.818237Z","title":"Avatargo: Zero-shot 4d human-object interaction generation and anima- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.818237Z"},"links":{"cited_paper":"/paper/2410.07164","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:8d0ca4aa2df423adc7aae9ad45cf865906378c733537de84f827062afdc6641d","observation_id":"9e8406f3-fcbb-4376-a3c5-7477622babb3","resolution":{"observed_at":"2026-08-06T13:02:28.818237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.824114Z","title":"The one where they reconstructed 3d humans and environments in tv shows,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.824114Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:1f5fc6cff1ea5ac25734667c75e292432855527b1a6314b5f5054b4ad78d0f00","observation_id":"e1cb13cc-12ff-413c-843e-b5944adee604","resolution":{"observed_at":"2026-08-06T13:02:28.824114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02158","last_updated":"2026-06-29T19:38:44Z","snapshot_observed_at":"2026-08-06T14:43:41.891230Z","submitted_at":"2025-01-04T01:53:51Z","title":"Joint Optimization for 4D Human-Scene Reconstruction in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02158","snapshot_observed_at":"2026-08-06T13:02:28.829575Z","title":"Joint optimization for 4d human-scene reconstruction in the wild,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.829575Z"},"links":{"cited_paper":"/paper/2501.02158","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:7f0e43b48dfee53354eeca4233ada54a1e72e61c4fff9c31c5d4242057e3af61","observation_id":"ce736998-eb89-4015-b243-c4707f6a395a","resolution":{"observed_at":"2026-08-06T13:02:28.829575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.835330Z","title":"Odhsr: Online dense 3d reconstruction of humans and scenes from monocular videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.835330Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:3a83e2bf8c6b341240c00ee4dd128006050af9a335ff58ab8b40d2098125abfe","observation_id":"28acbc36-f43f-4a04-be28-79d615eec000","resolution":{"observed_at":"2026-08-06T13:02:28.835330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.839788Z","title":"Hosnerf: Dynamic human-object-scene neu- ral radiance fields from a single video,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.839788Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:40ae84315f5bf1d329722b7538a2f08abda2fbb075bc86ffd92045b4a1e1d15c","observation_id":"09ada350-2779-4d27-b659-8bf87af3c972","resolution":{"observed_at":"2026-08-06T13:02:28.839788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.844890Z","title":"Neuman: Neural human radiance field from a single video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.844890Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9bd2b10a6875b584282bd8e668c6c4e7e020e6b6fdfda360fe5dd8303b83bb06","observation_id":"b14afb07-2f2f-4915-9cb0-20741adf8ec6","resolution":{"observed_at":"2026-08-06T13:02:28.844890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04393","last_updated":"2023-12-07T16:06:31Z","snapshot_observed_at":"2026-08-06T12:06:41.391790Z","submitted_at":"2023-12-07T16:06:31Z","title":"PhysHOI: Physics-Based Imitation of Dynamic Human-Object Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04393","snapshot_observed_at":"2026-08-06T13:02:28.849195Z","title":"Physhoi: Physics-based imitation of dynamic human-object in- teraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.849195Z"},"links":{"cited_paper":"/paper/2312.04393","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:82bfad4b42ab09cd4486c87b464886277ab8bcb8d6c2c39fc3cf3661af6f9a74","observation_id":"a2830648-99d7-4592-b864-3c7ed6ba11b7","resolution":{"observed_at":"2026-08-06T13:02:28.849195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.853667Z","title":"Perpetual humanoid control for real-time simulated avatars,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.853667Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:feb98a7017b4d248296e94d728f522013e0afd1b47576744dac24bc2031b8420","observation_id":"8876312f-7d6b-4f7e-af69-40e384290c6c","resolution":{"observed_at":"2026-08-06T13:02:28.853667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.857916Z","title":"Universal humanoid motion representations for physics-based control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.857916Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e27bc10b52ed5ff6895e4ec9e545d19ac779d0af8ef788145456eb726fa643b1","observation_id":"906b0fe4-9eb3-4c03-a83d-83dc6009d54c","resolution":{"observed_at":"2026-08-06T13:02:28.857916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T13:02:28.862444Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.862444Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:f3e71f16b520b2c1778f90cec2e8df471cec624499e716c00d3652d5cda2be4b","observation_id":"35a47705-4269-437a-9452-97c9b5f3155a","resolution":{"observed_at":"2026-08-06T13:02:28.862444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.866857Z","title":"Reinforcement learning,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.866857Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:bb81010c5482b1a4fe53f58b23d2395756e6d8f326f1e69b7727597153b7d4e6","observation_id":"841601de-7b5d-4e99-983b-d3a06ef59ab3","resolution":{"observed_at":"2026-08-06T13:02:28.866857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.871324Z","title":"Reinforcement learning: A survey,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.871324Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:73cf72f54cd032c5df9d9c83d882962fd065f96204a66a893177158bdfd9d824","observation_id":"aa8a111f-079b-4c5d-979b-0411510c96cb","resolution":{"observed_at":"2026-08-06T13:02:28.871324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.875639Z","title":"Reinforcement learning,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.875639Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:04782b17b98ac5c83f3353cc084c86cb9f0660137d553ca0b3f9a894526cf89e","observation_id":"dcc8069f-92bd-4c28-a8fa-bd400dddb976","resolution":{"observed_at":"2026-08-06T13:02:28.875639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.880151Z","title":"Physicsnerf: Physics-guided 3d reconstruction from sparse views,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.880151Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:204cb55bbd326c7485e25ca7b74297e000a7c3e217677e498d6e8622e94c82fd","observation_id":"fb5c6197-befd-428c-a4cd-cb85b66efa7e","resolution":{"observed_at":"2026-08-06T13:02:28.880151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.884509Z","title":"Pbr-nerf: Inverse rendering with physics-based neural fields,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.884509Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:788b594bf1d37782b917bd9c5820202a02772572906e41d606b90ff78caf586b","observation_id":"f99a04f3-0cee-4190-ac03-044238855d2d","resolution":{"observed_at":"2026-08-06T13:02:28.884509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.889401Z","title":"Cast: Component-aligned 3d scene reconstruction from an rgb image,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.889401Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:2c69ce810da539312bcb408ffc3e7b382c0248f768dd85b174a45aedc8116773","observation_id":"e475ce1c-ff34-4c2f-b74c-7838a936f74f","resolution":{"observed_at":"2026-08-06T13:02:28.889401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.894051Z","title":"Sv3d: Novel multi- view synthesis and 3d generation from a single image using latent video diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.894051Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:87ae7c7db66c3bf7761b33a2000a7f13e1ae9debc0780b8fbcae3d90083332a1","observation_id":"26f7958c-e65f-45bc-bbea-8ecd53848a47","resolution":{"observed_at":"2026-08-06T13:02:28.894051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06738","last_updated":"2024-03-11T14:03:36Z","snapshot_observed_at":"2026-07-06T17:42:37.195473Z","submitted_at":"2024-03-11T14:03:36Z","title":"V3D: Video Diffusion Models are Effective 3D Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06738","snapshot_observed_at":"2026-08-06T13:02:28.899027Z","title":"V3d: Video diffusion models are effective 3d generators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.899027Z"},"links":{"cited_paper":"/paper/2403.06738","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:9d5c53addacbad0ce78304d62b5a5b25ab5b9e4541d58d15fdae567c6d11776d","observation_id":"4d743a00-7884-4d48-ab0d-6c448e4b69f5","resolution":{"observed_at":"2026-08-06T13:02:28.899027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.903721Z","title":"Drea- mavatar: Text-and-shape guided 3d human avatar generation via diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.903721Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:e963483a16ac9dadb063ec1c06dc3a952771e810414c3da65a72c14996050d4e","observation_id":"bf376e61-a411-4e0d-8c80-2d5ff58a91bc","resolution":{"observed_at":"2026-08-06T13:02:28.903721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.908275Z","title":"4d-fy: Text-to-4d generation using hybrid score distillation sampling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.908275Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:d0fd937e308b152795d7c26a3c57d4639895bebbed031cb939fb0cf0d5f5c1f4","observation_id":"318abee8-87ef-4918-8846-05ab9913f119","resolution":{"observed_at":"2026-08-06T13:02:28.908275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:02:28.913510Z","title":"Tc4d: Trajectory- conditioned text-to-4d generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.913510Z"},"links":{"citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:2ba6d3b19a560e61750dadd725f718d04c13dfd11714191603f9a98b5089aa1c","observation_id":"6be87aea-db7a-412f-b6d9-23d6d4503812","resolution":{"observed_at":"2026-08-06T13:02:28.913510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:49:34.939383Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 9 inbound Pith citation observations for arXiv:2507.21045."}