{"as_of":"2026-08-07T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2122d375c2b6b569dc1b3c0669abeebe27b0b4ebcb90a2c19d7b06030fa9bbbb","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:30:34.764898Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:22:55.503532Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T00:25:32.931076Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"cited_work":{"arxiv_id":"2507.13344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fuman4d: 4d consistent human view synthesis from sparse- view videos with spatio-temporal diffusion models","venue":null,"work_id":"9eae9727-8296-418f-a6ef-58623eeb4d56","year":2025},"citing_paper":{"arxiv_id":"2511.05152","last_updated":"2026-04-20T10:48:10Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-07T11:07:34Z","title":"Splatography: Sparse multi-view dynamic Gaussian Splatting for filmmaking challenges","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:22:55.503532Z"},"links":{"cited_paper":"/paper/2507.13344","citing_paper":"/paper/2511.05152"},"observation_digest":"sha256:99bf1e70e5ad9f639e6e376a7255e36475a66bc3f318c010cbc2f6b4b825a002","observation_id":"1cc16329-431c-4af8-8058-054d349c6e10","resolution":{"observed_at":"2026-05-18T00:25:32.934331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"cited_work":{"arxiv_id":"2507.13344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fuman4d: 4d consistent human view synthesis from sparse- view videos with spatio-temporal diffusion models","venue":null,"work_id":"9eae9727-8296-418f-a6ef-58623eeb4d56","year":2025},"citing_paper":{"arxiv_id":"2603.26481","last_updated":"2026-04-07T06:59:09Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T14:44:52Z","title":"SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T23:41:24.423859Z"},"links":{"cited_paper":"/paper/2507.13344","citing_paper":"/paper/2603.26481"},"observation_digest":"sha256:187f427570f5e2679ad78733e9be73bbccc713fa40e23b7b4d42a73a7d48a77a","observation_id":"026f7edc-e9a8-445e-ad1e-15107d66761c","resolution":{"observed_at":"2026-05-14T23:43:18.026626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13344/citation-record","integrity":"/paper/2507.13344/integrity","json":"/paper/2507.13344/citation-record.json","paper":"/paper/2507.13344"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.420799Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.420799Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:34cbd292d769988c8867ba1347e5fafe658833de4bc02dfe6dbd3c8bf7399aca","observation_id":"8571a637-e73d-4f7f-855d-d5a9b3b2307b","resolution":{"observed_at":"2026-08-06T16:30:34.420799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.425120Z","title":"Creation of 3d human avatar using kinect","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.425120Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:7573aa04ab8d99ec988f7507442d941c66949cb6b3d1130d676e1ce89c91d028","observation_id":"b9608fa7-51de-47d9-aa6d-230bc712c26f","resolution":{"observed_at":"2026-08-06T16:30:34.425120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.429227Z","title":"Tc4d: Trajectory-conditioned text-to-4d generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.429227Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4834ffbd60375ff87573a4c14840fb0f5202079098ca5476a2176848601fd2c7","observation_id":"37df16ba-3007-4cda-8f54-942195d81f19","resolution":{"observed_at":"2026-08-06T16:30:34.429227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.433775Z","title":"4d-fy: Text-to-4d generation using hybrid score dis- tillation sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.433775Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:60df1ac722381fe27b3bb21a81b1d3b5c17f07e7627cb18f1a898233ddc27e99","observation_id":"f1515e09-b1b1-4f20-827c-c2fa1ab62330","resolution":{"observed_at":"2026-08-06T16:30:34.433775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.437662Z","title":"Detailed full-body reconstructions of moving peo- ple from monocular rgb-d sequences","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.437662Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:ae6b50872cfdda61629cfc6fe3e15ee77d83a81988503c7e3625f78bdc65b3d1","observation_id":"8e6c181b-52a0-45f0-8d1e-2bbfcfc8f81a","resolution":{"observed_at":"2026-08-06T16:30:34.437662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.441532Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.441532Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:8f4bcacc32d8be054019b9fefacdf46f1d52a93ec150383f3e595ebe0d74811e","observation_id":"3e90e633-72a8-449c-a8d7-26581edcb1e1","resolution":{"observed_at":"2026-08-06T16:30:34.441532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.445677Z","title":"Hexplane: A fast representa- tion for dynamic scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.445677Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:5e8d8f2c251a6d5abe5c504517757679a54b9a0a960c01d13840e2ee1e0b9b5f","observation_id":"7f9d07fd-e859-4e60-9c03-e96119de7221","resolution":{"observed_at":"2026-08-06T16:30:34.445677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.738377Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":"451b47f2-a3b6-49be-a838-6ffc43631a57","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.450060Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1ac99f82ee7dbaba29fc7f33dba65378bf9709dff7c2209075e3ca7bfd7f4a69","observation_id":"35acfce3-5e25-4342-a3e4-6988038785cf","resolution":{"observed_at":"2026-08-06T16:30:35.742244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14627","last_updated":"2024-07-18T13:10:22Z","snapshot_observed_at":"2026-07-06T17:48:35.724692Z","submitted_at":"2024-03-21T17:59:58Z","title":"MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14627","snapshot_observed_at":"2026-08-06T16:30:34.453665Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.453665Z"},"links":{"cited_paper":"/paper/2403.14627","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d1bfc931b702418c226c4237cd8b7c40bdb461ea4916e6bdaf0fd56caa262305","observation_id":"5ed6c430-2746-45c9-8dbe-79c1b92c16ce","resolution":{"observed_at":"2026-08-06T16:30:34.453665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10173","last_updated":"2023-09-30T06:24:23Z","snapshot_observed_at":"2026-08-03T20:15:36.452177Z","submitted_at":"2023-07-19T17:58:03Z","title":"DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-centric Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10173","snapshot_observed_at":"2026-08-06T16:30:34.457845Z","title":"Dna- rendering: A diverse neural actor repository for high-fidelity human-centric rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.457845Z"},"links":{"cited_paper":"/paper/2307.10173","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:acffbe6ee805885c3c2614811ca556b4152ae486591f0d3fa6438388f1f6e96e","observation_id":"41e765d0-2b3f-47a7-a50c-f944d2ee17b8","resolution":{"observed_at":"2026-08-06T16:30:34.457845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.463175Z","title":"High-quality streamable free-viewpoint video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.463175Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:39e1d5e58a2f3f2eeb6dbe04639a69598226131e692add1e023f23f019df4a5c","observation_id":"3487a70a-6586-4f65-94e6-11311f655dce","resolution":{"observed_at":"2026-08-06T16:30:34.463175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08051","last_updated":"2022-12-15T18:56:53Z","snapshot_observed_at":"2026-08-07T01:36:04.006725Z","submitted_at":"2022-12-15T18:56:53Z","title":"Objaverse: A Universe of Annotated 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08051","snapshot_observed_at":"2026-08-06T16:30:34.468225Z","title":"Obja- verse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.468225Z"},"links":{"cited_paper":"/paper/2212.08051","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:e3086de0233f07d16fa03be213474cb65c72ad962f5f83601a0385fd80553bb4","observation_id":"57b4a544-a3ba-4c54-b5c4-de162356275a","resolution":{"observed_at":"2026-08-06T16:30:34.468225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-07-06T15:52:52.180267Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05663","snapshot_observed_at":"2026-08-06T16:30:34.473031Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.473031Z"},"links":{"cited_paper":"/paper/2307.05663","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:fc363167a626588dcadcc4d2e6c2d7492b8941d4489654644de1221ce3d2724d","observation_id":"07c93530-0bef-4680-9950-d5a12ea4c3b3","resolution":{"observed_at":"2026-08-06T16:30:34.473031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.478269Z","title":"4d-rotor gaussian splatting: towards efficient novel view synthesis for dynamic scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.478269Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:048a0d8f2b89e80d912333f4ac11ecac13883184d6ba9d1a350d8d50eef08999","observation_id":"3c9e237d-1edb-4b47-b239-9cba292a755c","resolution":{"observed_at":"2026-08-06T16:30:34.478269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.482394Z","title":"Fast dynamic radiance fields with time-aware neural vox- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.482394Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c99a1701d798f0c957e8ab94697e209e3bf4f3d35d0efcd829d751dff881ab9a","observation_id":"63044d39-968e-4b00-8c94-4cb1d275358f","resolution":{"observed_at":"2026-08-06T16:30:34.482394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.486116Z","title":"K-planes: Explicit radiance fields in space, time, and appearance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.486116Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:cb7507aa8a6e67d8975d779f309d4cacba60aeff9cc13920ffe67e8d1fe39ac5","observation_id":"ebab4608-131e-46c1-b912-45a500bcd16f","resolution":{"observed_at":"2026-08-06T16:30:34.486116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.698663Z","title":"Massively parallel multiview stereopsis by surface normal diffusion","venue":null,"work_id":"dde953c9-711c-49bd-844a-79e9e96c0164","year":2015},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.489747Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:b0583a0ea9c5401d9c7839326b98cb645bd3b7b6b027f5e0fe2156ad65752e34","observation_id":"412dcaad-27c0-451c-ae6d-b8eb5798775e","resolution":{"observed_at":"2026-08-06T16:30:35.702801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.687852Z","title":"Srinivasan, Jonathan T","venue":null,"work_id":"79614307-59e2-4fee-b933-d8e28c6e9bba","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.493299Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:befa5c7e52bb8a0d08dfe22328847a6acab2303aa676b38a7bacbf6fb7d17615","observation_id":"e5a64fc4-8fd2-41f3-b092-fa094ce8fcc8","resolution":{"observed_at":"2026-08-06T16:30:35.691475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.675886Z","title":"Studio production system for dynamic 3d con- tent","venue":null,"work_id":"654a7cff-5417-4619-8736-43ca81ac98d5","year":2003},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.497112Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:7c282920635c8b172c53ab2b36df2f62d62ec5f15e0e71ee49c8c7f557660019","observation_id":"7398098b-d54f-40be-98ac-d56d3e690634","resolution":{"observed_at":"2026-08-06T16:30:35.680019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.500818Z","title":"Viewdiff: 3d-consistent image generation with text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.500818Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:0321b804365af9ada9739ccb0c5bf48e7ed0341651e143c0131aca6d1d76089e","observation_id":"4a3206aa-25ad-4a9d-ba32-0d9fee30c9bf","resolution":{"observed_at":"2026-08-06T16:30:34.500818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-06T16:30:34.505019Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.505019Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:f342279f0c17e93e9d786a418f1f060acfc417885cd85e83af7b13c7258bcc43","observation_id":"9ce25f9d-15f4-4aab-a6a4-28439adf213a","resolution":{"observed_at":"2026-08-06T16:30:34.505019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.651249Z","title":"Gauhuman: Articulated gaus- sian splatting from monocular human videos","venue":null,"work_id":"727b7a62-4a2a-4d8d-8cc4-2da5b527490b","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.509099Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4d89005a35bb9bfc967bba391cd3cc6ec0145eaeb611cdef8f34634acc6712fe","observation_id":"c42cf2d4-c328-43b1-b609-b938e70a2715","resolution":{"observed_at":"2026-08-06T16:30:35.658452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.637117Z","title":"Humanrf: High-fidelity neural radiance fields for humans in motion","venue":null,"work_id":"9f7b76d8-c3d3-44cc-830c-8a0a60c745c6","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.513178Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:0421eed30708a8eba07d5ff003affc3847ee48411b7ce6d3157f90e1aee3d18b","observation_id":"82d4f14e-363a-4454-b731-3c1f90dfd63c","resolution":{"observed_at":"2026-08-06T16:30:35.641401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.623760Z","title":"Pl ¨ucker coordinates for lines in the space.Prob- lem Solver Techniques for Applied Computer Science, Com- S-477/577 Course Handout, 3, 2020","venue":null,"work_id":"e55a8549-3c40-4bfe-86a6-93e52d3ad8a7","year":2020},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.517297Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:6042a3778a55247041bcc09bbbae2b9de340997c3d2038447da8c9670afa34e1","observation_id":"c329a7ff-e1fd-4c29-91fd-4d5bde5f8707","resolution":{"observed_at":"2026-08-06T16:30:35.628383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.612162Z","title":"Virtualized reality: Constructing virtual worlds from real scenes","venue":null,"work_id":"d020472f-bb98-46c9-91cb-c835eeedd0a6","year":1997},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.521154Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1e793860c63e47d45fbb1dfa71dee5b41de910593c9a982d7b5ea033ea858caa","observation_id":"c1115a64-0404-4544-b732-75954c1545f3","resolution":{"observed_at":"2026-08-06T16:30:35.616211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.599589Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"eaf9f4ce-5b18-4b3b-aa28-baa564e53b9e","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.524599Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:e7254ade9b7057e991cacdee9866a37aa394019db5bc0e0554722d3c46dd7737","observation_id":"819f7afa-a1b7-40c0-b24d-b68a3d82104b","resolution":{"observed_at":"2026-08-06T16:30:35.603769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-06T16:30:34.528734Z","title":"Sapiens: Foundation for human vision mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.528734Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c1c081a65192f0dae3267e47c06d6880a1e8dd6e3b8a418200fa9da11cc773c6","observation_id":"6ef0743c-0968-4fe6-b29d-cadef456ac28","resolution":{"observed_at":"2026-08-06T16:30:34.528734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T16:30:34.532489Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.532489Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:86e2068167a0849a62895bed55365ee92b9cee310f409bcc801569d626f4e341","observation_id":"00ad95cc-d284-4256-8955-d3ed759e87b9","resolution":{"observed_at":"2026-08-06T16:30:34.532489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T16:30:34.536274Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.536274Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d7bee4ff602460a4ed7f6fb03f6fb4413923fc143c7276980ec2ccc4f2977237","observation_id":"6e6b6568-9bab-4190-9aec-bc1f1ead95c3","resolution":{"observed_at":"2026-08-06T16:30:34.536274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.586326Z","title":"A theory of shape by space carving","venue":null,"work_id":"31f031e5-95ba-4cf6-beac-9ef64c9a4bcd","year":2000},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.540369Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:850c023a870eea73ce9842eb3f2e55e73dca8e232663269d33a72f3c7669bf44","observation_id":"770f6a6c-308c-4c7a-973c-45dc1bdeb87a","resolution":{"observed_at":"2026-08-06T16:30:35.590851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.573081Z","title":"Vivid-zoo: Multi-view video generation with diffusion model.Advances in Neural Information Processing Systems, 37:62189–62222,","venue":null,"work_id":"d285296c-dde9-48a3-be05-92c7c6c9e495","year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.543908Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4c87fa9c8ba28a6b56cd03930d78a7ca601ce143dcce36ebdb049a1cd2e10656","observation_id":"aa7ce023-2622-481b-b80b-4f6d67963812","resolution":{"observed_at":"2026-08-06T16:30:35.577477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.547337Z","title":"Neural 3d video synthesis from multi-view video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.547337Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:245d45709db2c3ffee3ab7d2118d5eb781b8cd083f2850d91f81321997528778","observation_id":"29b26c72-bd8d-49b8-b107-93cf2560d301","resolution":{"observed_at":"2026-08-06T16:30:34.547337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.553447Z","title":"Ani- matable gaussians: Learning pose-dependent gaussian maps for high-fidelity human avatar modeling","venue":null,"work_id":"cea5f88c-c6b3-4aa4-afde-0bd1b356204c","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.551854Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:4560607c7b1c1d5f845da1b5d5eede9be5f78c5a0cd050cf8799df139918b52e","observation_id":"84bb4f8a-9083-4fc6-87f4-9c849252f5c4","resolution":{"observed_at":"2026-08-06T16:30:35.557675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.541893Z","title":"Efficient neural radiance fields for interactive free-viewpoint video","venue":null,"work_id":"4b521a80-0732-40bf-a14c-60139cf8235a","year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.555847Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:061d456851eaabcef15b001115fe6f27d42b66d510e94d577d04d9b19591622f","observation_id":"cd2ac44b-3338-4bf8-ae12-f587abed1008","resolution":{"observed_at":"2026-08-06T16:30:35.545973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.530661Z","title":"Real-time high-resolution background matting","venue":null,"work_id":"c6a082e6-2ed1-4656-91d5-5d709b645820","year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.560525Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:efa22340c23b13750bd6a83314335c3a2f07179c8a3d3b6235dd3593567e53d3","observation_id":"7df6b6d9-b38f-4d19-bda8-baf082d481d9","resolution":{"observed_at":"2026-08-06T16:30:35.534476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.564842Z","title":"Raft-stereo: Multilevel recurrent field transforms for stereo matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.564842Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:7e7eaaf1bb63a75d5087c9348fd7e81017ce057f4d9e3e9598da7547e24112f2","observation_id":"4e1b59c8-bc22-4328-8b9e-4d310fc6d246","resolution":{"observed_at":"2026-08-06T16:30:34.564842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.510635Z","title":"Zero-1-to-3: Zero-shot one image to 3d object, 2023","venue":null,"work_id":"ae262e24-a1a0-44df-b031-97a2a80e5d27","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.569260Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:7efa12e67cb827121612c9c7e8269e19faea7c04957f09c79458ef46277ec8fb","observation_id":"eca86fea-97ca-430e-a778-5bd85a7cc633","resolution":{"observed_at":"2026-08-06T16:30:35.514838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.497236Z","title":"Mvsgaussian: Fast generalizable gaussian splatting recon- struction from multi-view stereo","venue":null,"work_id":"7923cc36-0672-4a50-8199-f17857de6ece","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.574009Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1dd535c272b0dce5ce78a52889a8fd618c628a7d73305721dbd46c302c059949","observation_id":"ca18d8f5-57fc-4cae-a43b-475f194e0e6e","resolution":{"observed_at":"2026-08-06T16:30:35.502262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-07-06T16:15:31.848927Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-06T16:30:34.578276Z","title":"Syncdreamer: Gen- erating multiview-consistent images from a single-view im- age","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.578276Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:2f3d1ab4782d5b39c4a7b0a2b51bb75f93844a178636bffe815458de0617ad70","observation_id":"b85b8ff9-775d-4be5-a5dc-5a943bc29cae","resolution":{"observed_at":"2026-08-06T16:30:34.578276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.582315Z","title":"Smpl: A skinned multi- person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.582315Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:7cbf1a16e6e0ee0cda4de9d7290953ca233df579746f6386ae7a7501fc55f017","observation_id":"6df977f3-65a2-4882-9929-0db30d540cd6","resolution":{"observed_at":"2026-08-06T16:30:34.582315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-03T02:03:48.954468Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-06T16:30:34.586204Z","title":"Dpm-solver: A fast ode solver for diffu- sion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.586204Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:fe9f08579c9891995c8adb61f6382efb20855ab1394b89da9fb58ff7bad2d895","observation_id":"6df2aee7-a11a-408d-86ed-6d762fd7be18","resolution":{"observed_at":"2026-08-06T16:30:34.586204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.590395Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.590395Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:b292f9adf5c55ed343c41991b954f9f9555b7249a8dc808d8e749c4c68eacdfa","observation_id":"3da23ece-d28f-44a0-b728-6337a9acfe48","resolution":{"observed_at":"2026-08-06T16:30:34.590395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.471051Z","title":"Dynamicfusion: Reconstruction and tracking of non-rigid scenes in real-time","venue":null,"work_id":"cc929fa2-0579-4b9b-8d63-75604cb727df","year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.594323Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1f1aaae231ea8105d5b09306ef3fc682a1f23c42ee7b8cc39bff6320ae8bb4d6","observation_id":"e8523673-e024-4775-b9a8-779c17c5f045","resolution":{"observed_at":"2026-08-06T16:30:35.475108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.598925Z","title":"Effi- cient4d: Fast dynamic 3d object generation from a single- view video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.598925Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:10975ab4e232e692742a6e6fc5f037f78670fa31742b81a1147d77d96b9cff05","observation_id":"d8eee92d-9d03-4e63-8bf0-ac7a052f6fc8","resolution":{"observed_at":"2026-08-06T16:30:34.598925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.602436Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Steven M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.602436Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:765dfa8c57a43c23a6196e2218ac03eb69dc71731a07d818bbcec041aa7d3ac7","observation_id":"2b4724ea-e076-402b-a305-ebb61c952642","resolution":{"observed_at":"2026-08-06T16:30:34.602436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.452086Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Ricardo Martin- Brualla, and Steven M","venue":null,"work_id":"4740375e-5aa7-4f9e-9de5-2b0a05b53e69","year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.605845Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:80db2a260185295f0feca72717b1ee494cb1d50dbcef98d284de480434de18b5","observation_id":"fbe7732f-c675-4c74-ba8d-535217bf7715","resolution":{"observed_at":"2026-08-06T16:30:35.456265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.440174Z","title":"Ani- matable neural radiance fields for modeling dynamic human bodies","venue":null,"work_id":"6b7c2a4d-04d7-4a48-8df8-9ade1daf5ec4","year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.609625Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:f0e39c3d828ac7755a626f5e11331b5d3f214c10e562c923dbab40df72a92a01","observation_id":"0d08a2b5-a4f7-48c2-9398-b13573a35f82","resolution":{"observed_at":"2026-08-06T16:30:35.444141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.613234Z","title":"Neural body: Implicit neural representations with structured latent codes for novel view synthesis of dynamic humans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.613234Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:50ab1eedc534f75d378da2415601b1ace23fd64a4ffe291117eae292ead57c1c","observation_id":"da7146fd-6d79-4243-85e4-db4e97ea0cba","resolution":{"observed_at":"2026-08-06T16:30:34.613234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-06T16:30:34.616681Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.616681Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:42b648212a3ed294d3025f850470be91b60df7b7355adbcebc0beb089b9dc8c4","observation_id":"d75891c5-45a7-4007-b204-f625daac911a","resolution":{"observed_at":"2026-08-06T16:30:34.616681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.419248Z","title":"D-NeRF: Neural Radiance Fields for Dynamic Scenes","venue":null,"work_id":"a4a8b3b9-8bc4-4daf-9ac4-f73473c48677","year":2020},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.620537Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:9f42bbae141d2f597d28be48f734738b7e6ee41e4a9a12d0b7f322f450b727a4","observation_id":"6c6535d4-9fcf-44f8-896c-5510a5e0cb09","resolution":{"observed_at":"2026-08-06T16:30:35.424968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17142","last_updated":"2024-06-10T14:07:53Z","snapshot_observed_at":"2026-08-01T13:37:17.913862Z","submitted_at":"2023-12-28T17:16:44Z","title":"DreamGaussian4D: Generative 4D Gaussian Splatting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17142","snapshot_observed_at":"2026-08-06T16:30:34.624666Z","title":"Dreamgaussian4d: Genera- tive 4d gaussian splatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.624666Z"},"links":{"cited_paper":"/paper/2312.17142","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c2c60eb1f06698e6ceaeaad75f86b26b14251612a0f1dc81ab944fc718a3b3a0","observation_id":"d88181dc-54f9-44c7-ba87-cac7c5bec71f","resolution":{"observed_at":"2026-08-06T16:30:34.624666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.405387Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"dcf17365-5de7-464c-9e42-e7ab3fb187cf","year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.628519Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:14f6d566b44ddce2d49e344ec2e310b0b2367fc75deca22e19d2aa11ef3a0a7a","observation_id":"6fb2c1b8-9158-42b5-873e-d34c29d1f12b","resolution":{"observed_at":"2026-08-06T16:30:35.410653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.393682Z","title":"Structure-from-motion revisited","venue":null,"work_id":"5ef08dce-df54-4b92-b3ba-ca6ed4e2f2a8","year":2016},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.632269Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a1086cee0c686f9cc5a0ab9cf33fa30e9a356fb55d534e542773ebde15dd6917","observation_id":"7c2900e9-3051-4dd5-8801-8eeac70d29f8","resolution":{"observed_at":"2026-08-06T16:30:35.397435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.382427Z","title":"Pixelwise view selection for un- structured multi-view stereo","venue":null,"work_id":"3a02c82c-296c-4eaa-a589-f1ce9f2ad5be","year":2016},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.636478Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:d8c91f264a9ffc2141768a3e445b86b20f48733f592c2b69a07e0377f557dad0","observation_id":"85467ce6-6700-4754-a610-6ba810eae861","resolution":{"observed_at":"2026-08-06T16:30:35.386295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.640007Z","title":"Tensor4d: Efficient neural 4d decomposition for high-fidelity dynamic reconstruction and rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.640007Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:db884126249fd0cb955166e3470af314dc7ba0b895bcf664d6c5c6e5343f68f1","observation_id":"109f7b72-5c41-49ff-8fed-6b6d6dc0bb7f","resolution":{"observed_at":"2026-08-06T16:30:34.640007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.362595Z","title":"Rapid avatar capture and simulation using commodity depth sensors","venue":null,"work_id":"ba375ba9-2e44-48fc-a049-6ccb05ff2e12","year":2014},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.643880Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:c4e80923e70d516c49e1781aadc4a40eca3f26122ed3e47bdc6dcbca4e4600cb","observation_id":"36f7a853-d23e-4e47-96e4-e7f94e51d0c4","resolution":{"observed_at":"2026-08-06T16:30:35.367216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-06T16:30:34.647825Z","title":"Mvdream: Multi-view diffusion for 3d gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.647825Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a88928487e3c658c3bbdd5f003e0ccb06fc8e4f921b63086c5cbf33f41ead3b6","observation_id":"c8afb796-2adf-4e6a-8e56-566a988e6d4c","resolution":{"observed_at":"2026-08-06T16:30:34.647825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11280","last_updated":"2023-01-26T18:14:32Z","snapshot_observed_at":"2026-08-07T05:12:15.974941Z","submitted_at":"2023-01-26T18:14:32Z","title":"Text-To-4D Dynamic Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11280","snapshot_observed_at":"2026-08-06T16:30:34.652426Z","title":"Text-to-4d dy- namic scene generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.652426Z"},"links":{"cited_paper":"/paper/2301.11280","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:24d8e1d3f6ee1ab931f37847b89bf5fe9d9cbe21d4483bf8d84e0cdc29b2f489","observation_id":"d67ffa65-560f-45f4-8755-0c07a3b4cf69","resolution":{"observed_at":"2026-08-06T16:30:34.652426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.351061Z","title":"Virtual view synthesis of people from multiple view video sequences","venue":null,"work_id":"4a304c29-9c2e-4df5-95db-19ff959e9241","year":2005},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.656745Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a3992cd1ff5a082662e05d8f324c0f445b3925d9c05c570e637c1a4d1d3c3a83","observation_id":"e81720c4-0c83-4348-a42b-d4935844e092","resolution":{"observed_at":"2026-08-06T16:30:35.355417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.340289Z","title":"Surface capture for performance-based animation","venue":null,"work_id":"c4083632-a68a-4d38-bd98-3cba9f6078a7","year":2007},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.660850Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:baaea37ef5221d99b0bbcd7eaaafd49098e622d634a8db43434d05e360f88cb2","observation_id":"5c534f71-c523-48a8-a77a-d6b5d7159a72","resolution":{"observed_at":"2026-08-06T16:30:35.343986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.329259Z","title":"Scanning 3d full human bodies using kinects","venue":null,"work_id":"7f7aea4d-cce3-4355-b6cd-74e66432a686","year":2012},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.664462Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:6e3cfed87fd13111615285e764a4077294e0fb417fc0e12039dfba40844fb9af","observation_id":"fb674737-27b8-4ded-ae19-96bf00061333","resolution":{"observed_at":"2026-08-06T16:30:35.332853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.668115Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.668115Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:b0ee1fa1fe7829e80984a1c2e285082568e9d4159aaff82b1ee41a0afd9873f8","observation_id":"37ba4bb2-3918-4330-87f1-b3a0e036720c","resolution":{"observed_at":"2026-08-06T16:30:34.668115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.309047Z","title":"Fourier plenoctrees for dynamic radiance field ren- dering in real-time","venue":null,"work_id":"0745447d-b9b2-4cc1-b355-e0395b6660e8","year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.672266Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:fd7ce3b74aaea26a26c31fff5ec8246506dbb8b260cafc8570b63b0d62498d8e","observation_id":"34eab7ac-c5f1-4ba1-99f3-005bee505737","resolution":{"observed_at":"2026-08-06T16:30:35.312840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02201","last_updated":"2023-12-02T20:41:27Z","snapshot_observed_at":"2026-08-04T13:49:28.484746Z","submitted_at":"2023-12-02T20:41:27Z","title":"ImageDream: Image-Prompt Multi-view Diffusion for 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02201","snapshot_observed_at":"2026-08-06T16:30:34.675972Z","title":"Imagedream: Image-prompt multi-view diffusion for 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.675972Z"},"links":{"cited_paper":"/paper/2312.02201","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:ed70414ba57fba0b9c083182dd87353efcd1ba82e47fd084ed83438b67cea69c","observation_id":"adc958c2-78f9-4542-8d6a-645e4139ff0d","resolution":{"observed_at":"2026-08-06T16:30:34.675972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-06T16:30:34.679622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.679622Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a3b008dae65ebbcc6d1abb4af686b08dc4f0cee7102e0abc87162df5a289cff4","observation_id":"59f7878a-1b95-44ba-a5b8-a5049e69896e","resolution":{"observed_at":"2026-08-06T16:30:34.679622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.683825Z","title":"Hu- mannerf: Free-viewpoint rendering of moving people from monocular video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.683825Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:83692b684e028edc2b07ab22db4845576e8c04ac3749aa4f29faf4cc03625e72","observation_id":"bc604099-22a5-4753-8bc1-3224b8a45be5","resolution":{"observed_at":"2026-08-06T16:30:34.683825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.290852Z","title":"4d gaussian splatting for real-time dynamic scene render- ing","venue":null,"work_id":"44961403-7e88-4404-8aae-16215d1d07b4","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.688073Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:91f5435bc97c9ce1110cbdb714e7d224fff8cbbd2c156f68f432d553a68b0e6c","observation_id":"08c4c103-43fd-4a18-884c-7c2d26f98bb0","resolution":{"observed_at":"2026-08-06T16:30:35.294926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-07-06T19:58:09.591787Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18613","snapshot_observed_at":"2026-08-06T16:30:34.692191Z","title":"Barron, and Aleksander Holynski","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.692191Z"},"links":{"cited_paper":"/paper/2411.18613","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:8db5eaa1e2d0b9409a4f1a6410692bb1dca9202fdd93d6cf855b9fac8d971f26","observation_id":"791357f3-5e62-4e85-b0e5-dd097bf68ffb","resolution":{"observed_at":"2026-08-06T16:30:34.692191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17470","last_updated":"2025-02-27T21:52:39Z","snapshot_observed_at":"2026-08-04T05:24:01.192706Z","submitted_at":"2024-07-24T17:59:43Z","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17470","snapshot_observed_at":"2026-08-06T16:30:34.696845Z","title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.696845Z"},"links":{"cited_paper":"/paper/2407.17470","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:176d7dcfbd331b42335d18f2129125cf4bca8cbb2b00b4cc1ee1d76517a9bb6f","observation_id":"185d1a01-d5b7-4354-a110-2222020e9d07","resolution":{"observed_at":"2026-08-06T16:30:34.696845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.279936Z","title":"Easyvolcap: Accelerating neural volumetric video research","venue":null,"work_id":"a7a60c55-9370-4cca-8c65-95c2747edd3d","year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.700951Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:8158eb0b17647e475e63c16b316d787e04589bbacdb8b18f4be74073ce135120","observation_id":"39c07d01-d3e0-4685-b97b-b45c7187bd69","resolution":{"observed_at":"2026-08-06T16:30:35.283732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.704528Z","title":"Relightable and animatable neural avatar from sparse-view video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.704528Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:58fb56857aa44adb8343950c833f5c58909768dda13a764ef5047df1a0ae009b","observation_id":"a70031ba-c695-4a77-9dfc-fa5e4c2d674a","resolution":{"observed_at":"2026-08-06T16:30:34.704528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.260433Z","title":"4k4d: Real-time 4d view synthesis at 4k resolution","venue":null,"work_id":"39915b6d-75c9-4415-af50-8efcf9a95fb9","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.708737Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1dfc7565326d28ad0aceeb8ff252f573229205f3e7d544b04062db1faaef31ab","observation_id":"3a52ecad-f94e-4650-b2d9-c9b2d96a5b26","resolution":{"observed_at":"2026-08-06T16:30:35.264293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.248532Z","title":"Representing long volumet- ric video with temporal gaussian hierarchy","venue":null,"work_id":"9f00eb81-ff0a-42c6-a6a7-273c8588414b","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.712365Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:5dd2f03e47a86014885e062d3c98a9f091f294e727b6f2fd31789204e84a359e","observation_id":"b428c9b2-58f8-413f-9c12-45a569c91d1e","resolution":{"observed_at":"2026-08-06T16:30:35.252346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.235936Z","title":"Diffusion2: Dynamic 3d content generation via score composition of orthogonal diffusion models","venue":null,"work_id":"4620609d-3c77-42a7-846d-2065d5719f21","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.715946Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:f9cf7a8afcb1681712b67b4bc59b2a7f8a346ee088be0fc5422b40b073418d55","observation_id":"eb6042ec-0c17-4911-83d9-1702e3ca5368","resolution":{"observed_at":"2026-08-06T16:30:35.240943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T16:30:34.720259Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.720259Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:e73f746f34ba39f10653f1f4610a47e0acaba97bdc2878b726d56dc5f8bca21c","observation_id":"185457a4-e58a-42e4-8b12-9ab04db6eff9","resolution":{"observed_at":"2026-08-06T16:30:34.720259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.221485Z","title":"Real- time photorealistic dynamic scene representation and render- ing with 4d gaussian splatting","venue":null,"work_id":"f2de2d5d-e196-437c-bb18-99bb27d3e975","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.725313Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:6fa1f54ba43d9c8d710ccb4232b912dcd7337dc600b9ee46cf9405f616f20603","observation_id":"4ed2c0d3-3c54-404f-bce2-82d27be50d6f","resolution":{"observed_at":"2026-08-06T16:30:35.226367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.208364Z","title":"Mvsnet: Depth inference for unstructured multi-view stereo","venue":null,"work_id":"2ad741d7-0bdb-4628-b57d-befbc60fff0e","year":2018},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.728762Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:9fa2c5e56c17d98d5109bc7259522c706f741107ec2c329594c37e9f4d388b96","observation_id":"68e6eebc-89f4-4db3-a0b3-ed439169d524","resolution":{"observed_at":"2026-08-06T16:30:35.212285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.195389Z","title":"Recurrent mvsnet for high-resolution multi-view stereo depth inference","venue":null,"work_id":"91f08f23-1dde-48f4-9f53-bd6adeb4d8bb","year":2019},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.732702Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1359c6b9934deb7bd1be3e0107a56a10cea8610c605e1695452b33eb8a96dd26","observation_id":"3c1f007c-f168-4c06-9255-ed07bb53c4fd","resolution":{"observed_at":"2026-08-06T16:30:35.200000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17225","last_updated":"2024-12-04T06:11:50Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T18:53:39Z","title":"4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17225","snapshot_observed_at":"2026-08-06T16:30:34.736671Z","title":"4dgen: Grounded 4d content gen- eration with spatial-temporal consistency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.736671Z"},"links":{"cited_paper":"/paper/2312.17225","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:2bf2931b24bb4d6059d0a33f44dd6b986a024a8bd5701d88a9977bf96eb52e31","observation_id":"88bc8735-bdfe-495f-9fb7-1a061878c8eb","resolution":{"observed_at":"2026-08-06T16:30:34.736671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.184237Z","title":"Stag4d: Spatial-temporal anchored generative 4d gaussians","venue":null,"work_id":"291722c7-ade9-4ffe-bce6-cafa13896b0e","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.741102Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:1ae8fc289b231784f53bea5c72149c26ef9982c4dcff49210dc02906c8a6ec96","observation_id":"3ddff97b-ce40-4da3-a71a-cb32d626f213","resolution":{"observed_at":"2026-08-06T16:30:35.188208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.171541Z","title":"4diffusion: Multi-view video dif- fusion model for 4d generation","venue":null,"work_id":"68eae4af-55a4-4502-a81c-863e5d5a2554","year":2025},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.745262Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:a04337f35a814380c8e9fe18c904cdeade5ab4088a7b055d20dc3df4dc39a7f2","observation_id":"e2d7be86-4861-458a-85c0-c2dde556a466","resolution":{"observed_at":"2026-08-06T16:30:35.175996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14817","last_updated":"2024-04-04T16:27:06Z","snapshot_observed_at":"2026-08-05T21:43:14.979886Z","submitted_at":"2024-02-22T18:59:56Z","title":"Cameras as Rays: Pose Estimation via Ray Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14817","snapshot_observed_at":"2026-08-06T16:30:34.749251Z","title":"Cameras as rays: Pose estimation via ray diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.749251Z"},"links":{"cited_paper":"/paper/2402.14817","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:b1596656f308a25566fac1c0d5e28b036f525bf0f466993e810c94f6cca37242","observation_id":"61ec5bc2-708c-44ce-b4ce-4c3fa398894a","resolution":{"observed_at":"2026-08-06T16:30:34.749251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14603","last_updated":"2024-02-19T02:30:14Z","snapshot_observed_at":"2026-08-07T01:00:17.285468Z","submitted_at":"2023-11-24T16:47:05Z","title":"Animate124: Animating One Image to 4D Dynamic Scene","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14603","snapshot_observed_at":"2026-08-06T16:30:34.753710Z","title":"Animate124: Animating one im- age to 4d dynamic scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.753710Z"},"links":{"cited_paper":"/paper/2311.14603","citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:b911ab454a09da62e81da65ecc635bfe442d88545636bc2f7078b75ba5c74a63","observation_id":"f84d5aed-3a19-4720-abed-d554226d3f24","resolution":{"observed_at":"2026-08-06T16:30:34.753710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:34.757492Z","title":"Bilateral refer- ence for high-resolution dichotomous image segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.757492Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:57843ebf0e403ff4a4111364f9447f8236831c98eff3a8179599e20603dbdef3","observation_id":"13578719-044e-47d8-8176-daf2a4d380f8","resolution":{"observed_at":"2026-08-06T16:30:34.757492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.152470Z","title":"Gps- gaussian: Generalizable pixel-wise 3d gaussian splatting for real-time human novel view synthesis","venue":null,"work_id":"45a0d8e2-27f3-48ac-982e-139790b59f3a","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.761142Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:0380c049bd2638e635d82cdde8c769bbe64a728551774490feac48efe4f3d578","observation_id":"3231362c-a61f-4779-aab8-491d4ca0f60e","resolution":{"observed_at":"2026-08-06T16:30:35.156419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:35.135024Z","title":"A unified approach for text- and image-guided 4d scene generation","venue":null,"work_id":"6c8b5e34-4fc2-4fab-98d3-7dd2cc45cbf9","year":2024},"citing_paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:34.764898Z"},"links":{"citing_paper":"/paper/2507.13344"},"observation_digest":"sha256:9207278bd7d93e91f69ef1db075e4aafee3e164d368632bcd858fcd62fa88b04","observation_id":"57c8a991-f2bd-4308-b0ac-7061bb2d9260","resolution":{"observed_at":"2026-08-06T16:30:35.140720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13344","last_updated":"2025-07-17T17:59:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:22:24.343853Z","submitted_at":"2025-07-17T17:59:17Z","title":"Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 2 inbound Pith citation observations for arXiv:2507.13344."}