{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2bec1edb4677258edb2c169d71fe872f89b41de2ad3387faf0e9c403f78b2334","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:28.175667Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T21:59:43.755956Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T14:21:06.813117Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"cited_work":{"arxiv_id":"2505.23085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23085","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geoman: Temporally consistent human geometry estimation using image-to-video diffusion.arXiv preprint arXiv:2505.23085, 2025a","venue":null,"work_id":"1e60b36d-f798-4bd5-8489-bb4901cb1b3d","year":null},"citing_paper":{"arxiv_id":"2604.21681","last_updated":"2026-04-23T13:45:32Z","snapshot_observed_at":"2026-08-01T17:21:19.902700Z","submitted_at":"2026-04-23T13:45:32Z","title":"Sapiens2","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T21:59:43.755956Z"},"links":{"cited_paper":"/paper/2505.23085","citing_paper":"/paper/2604.21681"},"observation_digest":"sha256:3f593ca1b8ad20a7225ce861220791ec7c9d5e7b245c4563560011ab4b04f34a","observation_id":"e42001aa-f210-455b-b801-30b8bb9a1ca1","resolution":{"observed_at":"2026-05-11T14:21:06.816106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23085/citation-record","integrity":"/paper/2505.23085/integrity","json":"/paper/2505.23085/citation-record.json","paper":"/paper/2505.23085"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.718584Z","title":"Photorealistic monocular 3d reconstruction of humans wear- ing clothing","venue":null,"work_id":"f67cd510-295e-4fb8-9f9a-492473f91c32","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:20.930873Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:0d59f93397dcfe373d8fe185411ebecb37a0ce81f44d01b0d61c1f66025e261c","observation_id":"49941d42-b991-47f8-8fde-a70a8c25d5a9","resolution":{"observed_at":"2026-08-07T12:59:39.780982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-07T12:59:20.994210Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:20.994210Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:0de3ba54a7aa1621247a66bb6fd0e103cbb8a4629840b121bab7bfa46dd7ac6d","observation_id":"367974e2-3c0b-494b-9592-b44c88e3edad","resolution":{"observed_at":"2026-08-07T12:59:20.994210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-07T12:59:21.107495Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.107495Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:48227ca77b8f1f536c7bb31972d68f6f1d5c0acb2286ce730033896653ab3144","observation_id":"34b33b62-3e13-48f7-a25c-febeff7487d5","resolution":{"observed_at":"2026-08-07T12:59:21.107495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:59:21.225920Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.225920Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:eb1596b8b4ceee6a9da52f6306251a8fb25c608d6f508059abf8eaa1459e34f1","observation_id":"5eeb489c-94f3-4068-90fd-ef64ce9dc5bb","resolution":{"observed_at":"2026-08-07T12:59:21.225920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-07T12:59:21.343777Z","title":"Richter, and Vladlen Koltun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.343777Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:71f766a4e6c37eb3113f01225ca3bb13094986abf4b8e6772b40355257a5d8db","observation_id":"761a963f-c4dd-4e56-8b3a-b1be18517d16","resolution":{"observed_at":"2026-08-07T12:59:21.343777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:21.482823Z","title":"Video generation models as world simulators,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.482823Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:411c1356fc5cb142824de15bf50facc0bda07c5457889b09da17dcd0d2300e6b","observation_id":"3f355d39-2a11-42f3-af29-3aed37b395c5","resolution":{"observed_at":"2026-08-07T12:59:21.482823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.526054Z","title":"High accuracy optical flow estimation based on a theory for warping","venue":null,"work_id":"98fda0fc-8a82-4ef9-add6-65a42946fc29","year":2004},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.585722Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d731e86e38ab63c1318f4c2fbb0710c6200d731df2c66c07558b1568f30a450f","observation_id":"472d4005-bd5f-4931-80a7-7d08cb53fa49","resolution":{"observed_at":"2026-08-07T12:59:39.611170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.367136Z","title":"Stable- video: Text-driven consistency-aware diffusion video edit- ing","venue":null,"work_id":"ca9abb01-6adc-4eb4-ba28-5feb78f299ce","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.742575Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:50060310b8731901bd65c678577254f022578edce4bbcad277847e7c93b10690","observation_id":"e60237ce-cecf-49a6-9e0a-a7594c0d0c74","resolution":{"observed_at":"2026-08-07T12:59:39.442026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-07T12:59:21.840777Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.840777Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:dde3ae7a685205495f80588325867c578a5aaa85a6ac0e729fc615659fc78242","observation_id":"b1b1a472-c114-448c-b728-2b231a1625c6","resolution":{"observed_at":"2026-08-07T12:59:21.840777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.176402Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"9c502846-279e-4968-8a7f-e7fb371f2978","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.956046Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:c4e90c8c6f34f79845b43599c6414f7de54fcdfa020f2c8aae3db4c110236c0f","observation_id":"f5894e7a-d201-4265-923d-2cb0cc62fd58","resolution":{"observed_at":"2026-08-07T12:59:39.235242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.944953Z","title":"Self-supervised learning with geometric constraints in monocular video: Connecting flow, depth, and camera","venue":null,"work_id":"0ef48b63-bd41-40ee-a4a9-52e51bf5158a","year":2019},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.077547Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d9d1329236efb55afe8c6b2d9a8ac29d1a4d86a8ccf2d1cc779538b1836589f0","observation_id":"4671f298-d307-4434-97d0-d02a079fa059","resolution":{"observed_at":"2026-08-07T12:59:39.104114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.716892Z","title":"Cogview2: Faster and better text-to-image generation via hi- erarchical transformers","venue":null,"work_id":"eccb1ea7-2a0d-45e3-bec9-f0fc41e4a8a3","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.208238Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:6c733cb6d55886e7c91a94ba6cf4cbc02d05c710390f6ee54c048f2c58a7fbac","observation_id":"29448567-24b0-4ad9-8531-348f540a34cc","resolution":{"observed_at":"2026-08-07T12:59:38.826291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.515756Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"03aa4a41-35bb-410c-adee-c3c1bef8cbc0","year":2014},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.296951Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:a603d46274c64fa69a7f1bec8ebdb409a063f9d68f2de5bd198637971776f23e","observation_id":"a65020e1-9b5f-4763-be62-1b7958887b6b","resolution":{"observed_at":"2026-08-07T12:59:38.623717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.328135Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"14d59496-467a-4347-82a5-d5ef485cfc0e","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.365317Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:79360d80c461d5c608153448ff1addbcd6aafc870c5fa32aab5a6e13a1e6ac65","observation_id":"330baaba-8581-4169-b767-c241eb71aedc","resolution":{"observed_at":"2026-08-07T12:59:38.389610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.202198Z","title":"GeoWiz- ard: Unleashing the diffusion priors for 3d geometry estima- tion from a single image","venue":null,"work_id":"68b2af7b-cacc-4d6a-8abb-47af9764cf77","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.458937Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e222170f2f29caf6af6f741e38e344e679dcc50b3f3244d6d783879b13153d25","observation_id":"098ae50c-bc3d-4f47-a039-bf1d6b073d83","resolution":{"observed_at":"2026-08-07T12:59:38.252183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.072539Z","title":"Humans in 4D: Re- constructing and tracking humans with transformers","venue":null,"work_id":"12c92907-7069-428d-b570-5594d8675852","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.597289Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:7a1c95e98cb765f61dd81297b8d845c40c59b1861e974b897ec5f6320caf36a8","observation_id":"a57da66e-926d-49ab-91ad-d91136b814be","resolution":{"observed_at":"2026-08-07T12:59:38.131541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.973847Z","title":"High-fidelity 3d human digitization from single 2k resolution images","venue":null,"work_id":"97d74d94-fab2-487e-a808-b3f2a43e6733","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.692204Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:453057597427608c1d4fd3a08c76206d730c070002756ff89775d04c49bd7b5f","observation_id":"a3564360-2e18-4929-ad3f-7e35594a9d46","resolution":{"observed_at":"2026-08-07T12:59:38.024814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-04T16:50:25.699602Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-07T12:59:22.779637Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.779637Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f35a612d429d22a19a3e3f42c4d187106ecc7c045dae05505d200288ce2d20ee","observation_id":"180f7715-6b33-47ed-a81d-1f40606278b3","resolution":{"observed_at":"2026-08-07T12:59:22.779637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T12:59:22.901882Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.901882Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:7e766d81524d80ff524e25bc3462c67749f0866980c0f434c6aac92298c890f1","observation_id":"862928a1-904f-4c57-acad-c5d91e36df0f","resolution":{"observed_at":"2026-08-07T12:59:22.901882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.857548Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"b1703107-41f0-4fcf-be27-173e323b4d60","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.018296Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:8850cd07cba3b2bf3eb5c753fb15dbb296598d2486942a21c400cf2c9b65da70","observation_id":"38c55ea5-a2ac-40b3-b5b4-e22544322618","resolution":{"observed_at":"2026-08-07T12:59:37.901721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-07T12:59:23.141059Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.141059Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9c8656ce786b57be7e63f69cba29d769645e6630171632ed6f76bcd499818d80","observation_id":"ff12a275-d4bb-475c-b9d0-8c0273694b09","resolution":{"observed_at":"2026-08-07T12:59:23.141059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.706387Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"3420bfab-994c-4562-ad3c-2ae16ffa32c6","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.223405Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:246563b9cc7baa5edbbfc325b1899ac1672aee2c87d8b2488791266f40af4dd9","observation_id":"1d0655c6-1b64-4688-905f-55c08ea4372e","resolution":{"observed_at":"2026-08-07T12:59:37.784968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15506","last_updated":"2025-01-03T15:39:16Z","snapshot_observed_at":"2026-07-06T18:04:42.102581Z","submitted_at":"2024-03-22T02:30:46Z","title":"Metric3Dv2: A Versatile Monocular Geometric Foundation Model for Zero-shot Metric Depth and Surface Normal Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15506","snapshot_observed_at":"2026-08-07T12:59:23.363527Z","title":"Metric3d v2: A versatile monocular geomet- ric foundation model for zero-shot metric depth and surface normal estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.363527Z"},"links":{"cited_paper":"/paper/2404.15506","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:91ec64ff4a3f30b414352ebee0ce2dc421f6915f85cd3b0a14c128171cd6c7ab","observation_id":"4fe6de2f-4a3e-4eff-b9fd-a9a91d1f95da","resolution":{"observed_at":"2026-08-07T12:59:23.363527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-07T23:17:31.541423Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-07T12:59:23.490758Z","title":"DepthCrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.490758Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f3575df5575c9be7877cb67f3668c794d56a731b39e992d598ada55bf3e4cf61","observation_id":"c9d314d8-7044-45ca-a973-8831b2525b77","resolution":{"observed_at":"2026-08-07T12:59:23.490758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.378166Z","title":"ARCH: Animatable reconstruction of clothed humans","venue":null,"work_id":"999f274a-9dfd-458c-8477-9b061855df93","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.710031Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:2c9549a07d4c4d94d43c2903889294b2ed1d357f05775f8b1c0c7f2a2c067c9a","observation_id":"5f48e3d9-f51f-44ff-a2c0-eb692f198ae3","resolution":{"observed_at":"2026-08-07T12:59:37.448315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.165187Z","title":"Flowformer: A transformer architecture for optical flow","venue":null,"work_id":"45d1f0f0-6300-4f6f-a064-26be389f5551","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.844526Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:8cb5f7e0f99e87c20bf7d2deeb2e7b84fe8480dd9f6028a3de0f059b9151f6c9","observation_id":"3ce18d9f-1d23-4551-b295-da670be10b2d","resolution":{"observed_at":"2026-08-07T12:59:37.215736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.031327Z","title":"HumanRF: High-fidelity neural radiance fields for humans in motion","venue":null,"work_id":"1d913206-a5b5-4bd5-b7c9-7fc940adb9d3","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.941445Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:3356bc1a72bc04e28823cd41bd907f4c8ef7e109746224c026a118f696618b04","observation_id":"5e3d4528-7f7b-4b23-a769-4f5f35e85eb1","resolution":{"observed_at":"2026-08-07T12:59:37.098110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.830044Z","title":"Jafarian and H","venue":null,"work_id":"3ffd5fcf-5d06-4f81-a607-e1aa7d09f142","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.038240Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:882d40dab69586aa97b6998b71c728fdf99c0ecd097068239c6a8f846cb00db1","observation_id":"5edd3c3b-c62a-4836-bcb2-b0bc54bc82f6","resolution":{"observed_at":"2026-08-07T12:59:36.950238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.629110Z","title":"Learning high fidelity depths of dressed humans by watching social media dance videos","venue":null,"work_id":"fad5a57e-69ea-408f-8570-ef20b4e5a2d1","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.158543Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:1d71f4f5b9a2cde30a9ae72bc010e74aa2f27b4943dbe4f4ccb2d444ac2b9dfd","observation_id":"65ad9760-e6e4-4e9b-a895-13947f567f5e","resolution":{"observed_at":"2026-08-07T12:59:36.671335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.409442Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"cf127674-1ebe-413b-b208-a10c094dff4f","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.272479Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:35e57d003d13ec65a9714e785820204260ce7bc8dd34971c57eb0ce885253d9e","observation_id":"7ef05ac4-86e6-461b-9ca2-c88b95a586d6","resolution":{"observed_at":"2026-08-07T12:59:36.532733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.247348Z","title":"Sapiens: Foundation for human vision mod- els","venue":null,"work_id":"39e10713-4bfd-474f-8613-85c5991242ed","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.420233Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:4602e014e9884726c9f0487450c17ceffa75086c591edc9e5af3c5ca0bcde054","observation_id":"1b188c7c-7d3d-441e-a9c9-9d1942134c17","resolution":{"observed_at":"2026-08-07T12:59:36.304940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T12:59:24.519563Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.519563Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5a29ce7f577494644f1fd34ee69196b61cdddd338129171c700411aadf69d1cc","observation_id":"ddab9752-2070-4210-beda-baa514076afb","resolution":{"observed_at":"2026-08-07T12:59:24.519563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:59:24.610161Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.610161Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:dbeeab7f33e9cc8a37f7bc4de7277c547a2bcc63741981dde8fa823851a25cd3","observation_id":"0eacca16-ca2e-49ed-9b1a-b7d76a46f35d","resolution":{"observed_at":"2026-08-07T12:59:24.610161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:36.094746Z","title":"Robust consistent video depth estimation","venue":null,"work_id":"eb8cb5c5-93b5-4f64-8153-0b1615cabfe5","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.706712Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:07e714004de65775cede2c14a5c575ccd73680bb85900dc6870530e8f3780399","observation_id":"c02b8bbd-ff08-46f6-8dd8-0878a7f494a1","resolution":{"observed_at":"2026-08-07T12:59:36.168095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-03T19:03:47.269374Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-07T12:59:24.778818Z","title":"Ctrl- Adapter: An efficient and versatile framework for adapt- ing diverse controls to any diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.778818Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:6a24bf4db57b6ddde4a8ec12c341082816f2d93342b28d90b79f0bd2efae5969","observation_id":"9156ee3e-aa92-4401-ac86-7428000a56ec","resolution":{"observed_at":"2026-08-07T12:59:24.778818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.897193Z","title":null,"venue":null,"work_id":"65cbb9a4-9115-4dbf-8f3d-3777659acb5b","year":2015},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.879018Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:a9d87a9ab0c2f8d959bf83fcedfdddddf61ef126991798e845c4b78ebe33d4c5","observation_id":"aca88010-beee-4e50-8f11-1441357d59a2","resolution":{"observed_at":"2026-08-07T12:59:35.989939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.667399Z","title":"Consistent video depth estimation.ACM Transactions on Graphics (TOG), 39(4), 2020","venue":null,"work_id":"f8351817-7721-4acb-88ea-2799e325693e","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.977142Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:3be30b3930b283a8621453ff8b1494fa559bd53043a1dfcbfa387fd0e74af939","observation_id":"83973606-f072-4174-b1ad-cadb94cd9cb4","resolution":{"observed_at":"2026-08-07T12:59:35.783342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.456168Z","title":"Jewett, Simon Ven- shtain, Christopher Heilman, Yueh-Tung Chen, Sidi Fu, Mo- hamed Ezzeldin A","venue":null,"work_id":"523b57f0-7d11-44f2-a75b-974df508cb58","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.067043Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:1dbd763023dcd3d9bc70f26d1984dc4d44f8a2cf0b63c587be559c194888a171","observation_id":"cbc13d4e-e859-4ed7-9445-24b28b22e216","resolution":{"observed_at":"2026-08-07T12:59:35.523612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.221613Z","title":null,"venue":null,"work_id":"c4865db9-e120-4b97-8a6d-a94386646a4a","year":2019},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.114459Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:2228ca8e09f18ef6bc344fc68453bad27e97e645e81d6cc7a815cf2f9891517a","observation_id":"867a13c8-b40c-4a9a-9d4a-e4b41e60cd48","resolution":{"observed_at":"2026-08-07T12:59:35.350523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:35.054047Z","title":"UniDepth: Universal monocular metric depth estimation","venue":null,"work_id":"e3792c90-904c-44b2-adb3-3f089d1e0b69","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.183400Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:61844624b246a8ac169662f7195ce5e174d10c5464c5ac9ce4abdde40120d9a7","observation_id":"d4af9a8c-a7b2-47d6-97dc-f46fcd957eee","resolution":{"observed_at":"2026-08-07T12:59:35.140737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.785694Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"6a7bab8e-a3f4-4342-afa6-b714da3b1e57","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.231414Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9e3b0f138de8f5304e694ac83ac16e6fd38c81c298fc861db84e4db3c6aa4ee2","observation_id":"2987710d-1973-4166-aa8a-dea10b3e31b0","resolution":{"observed_at":"2026-08-07T12:59:34.925641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T12:59:25.277658Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.277658Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5a6dc0a22fa8e0c61c1835cf0c163290e3f7a58ff2d21b4529cdcabe70212871","observation_id":"b8fc48b4-11c9-4495-9c15-5f78d9a96f20","resolution":{"observed_at":"2026-08-07T12:59:25.277658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.583077Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"8b341e0a-4e0f-439d-b24c-e3c126f5ac78","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.340557Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:bb33b2c53e4b3642031ec6b72252eb9d551bc1cae84d33768c2d331688300359","observation_id":"acec3087-4f57-44b1-b37e-effc5550f785","resolution":{"observed_at":"2026-08-07T12:59:34.651003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.445583Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"8ebea2ba-197f-4e42-8eb6-6a6584b805a0","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.393763Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:25f54f776307427c5ed0f7051ec3cb5d4720680aadf63d9589855f214743f46f","observation_id":"0ca20f74-3fb0-48dd-81a7-26e57ddd8f05","resolution":{"observed_at":"2026-08-07T12:59:34.524732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.223799Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"7fd5c68d-0af0-485e-9376-1de97e58ed04","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.463051Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5787be2f943c0f75d39a5d0242f295c7177ab292ab085ce35864bd99795a0cfb","observation_id":"4f78e827-66ea-4b05-8b91-f2a5c145f163","resolution":{"observed_at":"2026-08-07T12:59:34.315839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:34.050836Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"0cf6a2c7-b077-4358-89a7-1fadb40ccbc1","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.530959Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f4f1f10136a3ebbf192648931ccfe534d8f12b760b22bbb822fa7417d5926d80","observation_id":"f860c84d-9f30-4a5c-aa7d-1be88a0bd5ae","resolution":{"observed_at":"2026-08-07T12:59:34.127227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.866593Z","title":"Pifu: Pixel-aligned implicit function for high-resolution clothed human digitiza- tion","venue":null,"work_id":"9a0f0fda-59a3-4681-8fcd-d03a2bd018a6","year":2019},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.621719Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5cd5a31cd85c7c516b501d80009a91ea1b2ba51066177bbf8688897c675db824","observation_id":"862d2a01-f574-4b15-a755-2bb648e0e223","resolution":{"observed_at":"2026-08-07T12:59:33.956629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.693291Z","title":"Pifuhd: Multi-level pixel-aligned implicit function for high-resolution 3d human digitization","venue":null,"work_id":"88374ff3-1fc0-45ae-a7fb-8c4dfeb63ca0","year":2020},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.680799Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:affc7d6406a5dc6ccbde5c81ef3456db0d9ae1585fe79d0876d22347e9914082","observation_id":"a0017d01-24ec-48c7-a2be-393dbf3feb68","resolution":{"observed_at":"2026-08-07T12:59:33.776720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.553252Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":"f4eee1c8-7c48-48f3-bdb1-ab99b3a27161","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.747364Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:613494c55ce706d7e7a9f0cea50b7eb842d03f2afd758bdfb059dfed411eb164","observation_id":"88961aa5-be61-49d3-ac5a-ce28397d65a6","resolution":{"observed_at":"2026-08-07T12:59:33.632255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:33.267573Z","title":"X-Avatar: Ex- pressive human avatars","venue":null,"work_id":"165a6917-66b4-4399-b920-9f8863cef432","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.834387Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:05b51bed2037a7593ea26998ec9718a08acb5a4e93cc38de9265092335c81332","observation_id":"98bcd4a8-55b4-47ab-b3eb-8e6b35804c24","resolution":{"observed_at":"2026-08-07T12:59:33.395997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.965022Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"44823b06-e4b5-418e-b67a-d5055c510ce0","year":2015},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.919767Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:c0d94966b326261d950b9365a31dc07f9770f5f81065ff8b456ab7771e6d4cd1","observation_id":"1d8443e4-d83a-4c5a-85bd-205c0c06c2cc","resolution":{"observed_at":"2026-08-07T12:59:33.116872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.711093Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":"dc84732a-5fd5-4180-8e3a-12d445bc18cc","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.970093Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9f652e4dd9b087c5193f7ae11b1a15c9ebc80140c3129f15a1456eb46732ad85","observation_id":"ff0dd391-6b33-425b-a5b4-453ced72beaf","resolution":{"observed_at":"2026-08-07T12:59:32.825490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.452674Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":"7602f4ac-adca-4458-b7fb-a9aaaa1c1e7f","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.032794Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:c0629d3afef9515600af30ab0d8d8465bef9beff5ddb539bd8610d811e4f4dae","observation_id":"961a342c-79f9-4bc0-a26a-3397d5b7b854","resolution":{"observed_at":"2026-08-07T12:59:32.568013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.136461Z","title":"4D-DRESS: A 4d dataset of real-world human clothing with semantic annotations","venue":null,"work_id":"0e79790c-e784-4808-a25b-a53dc564fa74","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.071652Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:b2f26376d61768db686ea82994f63236c01284cc902755387f77bb5343df5d0b","observation_id":"58349eb9-8492-4cc6-9e65-5e30617d8781","resolution":{"observed_at":"2026-08-07T12:59:32.308039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-04T07:28:33.714480Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-07T12:59:26.160150Z","title":"MagicVideo-V2: Multi- stage high-aesthetic video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.160150Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:2f2c21abb31728c925aa15c1a1907cfab040ddcd35c1ab4d5075a55a469333be","observation_id":"1fa9faa1-24e3-409a-933b-90eb67cd7ed2","resolution":{"observed_at":"2026-08-07T12:59:26.160150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.892369Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"2759eb3c-b07c-45ac-9b80-79f84e191c9e","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.205797Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:0ef1f81889b37b48771724c1b7f0be7f7985f5bcbd46a7cf836fe4a782c96d4f","observation_id":"be46c9aa-c0a1-438e-86d5-da82c6780477","resolution":{"observed_at":"2026-08-07T12:59:32.016949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.525949Z","title":"Less is more: Consistent video depth estimation with masked frames modeling","venue":null,"work_id":"fc916203-5ed7-4210-af4d-425ff239d759","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.280443Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:b597ce91e2d83dfec9d0b0d1853177f798d089c64e771f194f9992c532ffc09c","observation_id":"dfeaf70c-1b4a-4219-b331-b41c37b6b0db","resolution":{"observed_at":"2026-08-07T12:59:31.737807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.352241Z","title":"TRAM: Global trajectory and motion of 3d humans from in- the-wild videos","venue":null,"work_id":"be06d413-89c8-4a16-ac62-5119af255670","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.351944Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f2df8f44153150e1a3ae903c4a26c0d1668e05ccde97338903a122c56f4d40ec","observation_id":"edd21a6f-b0df-4956-b331-04c9a679840d","resolution":{"observed_at":"2026-08-07T12:59:31.453658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.106326Z","title":"ICON: Implicit clothed humans obtained from nor- mals","venue":null,"work_id":"c4036989-44a2-44cb-8364-67e56d549dde","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.425490Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f9e95575b91f9d21829554db9edafa194e464e8d20fa5f86ace11c3308dc2b55","observation_id":"0d9b665b-ae44-48b1-9c76-2fcb8cd12e02","resolution":{"observed_at":"2026-08-07T12:59:31.252652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.932513Z","title":null,"venue":null,"work_id":"50ed33e3-9e82-4852-b9e5-9f56be35dbdd","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.491077Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f481f143d8f0177da39a549278965962c047423fd87164f1a590bf5f8a18fb54","observation_id":"dce71b8a-2f4a-43a4-9806-2ef4bf7cf110","resolution":{"observed_at":"2026-08-07T12:59:31.012696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10815","last_updated":"2025-03-12T09:16:59Z","snapshot_observed_at":"2026-08-02T03:23:18.701055Z","submitted_at":"2024-10-14T17:59:46Z","title":"Depth Any Video with Scalable Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10815","snapshot_observed_at":"2026-08-07T12:59:26.572903Z","title":"Depth any video with scalable synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.572903Z"},"links":{"cited_paper":"/paper/2410.10815","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e012f3391795a34b3606feef9af9c03fbdf57fd60e12944123a63e9b655e343a","observation_id":"fbfb37ba-2077-416a-9b13-f6c4e8fad643","resolution":{"observed_at":"2026-08-07T12:59:26.572903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.703943Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"8ba3917e-f279-4905-b2be-911a6dd615f7","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.634045Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:63a64f733671dc8811384eef8160cffc3949d243c61ac30d563ff6f30400204e","observation_id":"907ed995-7673-44d8-b6c4-7662a0a9e360","resolution":{"observed_at":"2026-08-07T12:59:30.804175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-07T12:59:26.713658Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.713658Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:20e2072dfcc677d9edc4d40853a0f8c4049c8f20315e8d4d2214f57b18c35de1","observation_id":"2fda88d2-6e6f-482a-ad69-38d26ce581be","resolution":{"observed_at":"2026-08-07T12:59:26.713658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.490930Z","title":"Metric3d: Towards zero-shot metric 3d prediction from a single image","venue":null,"work_id":"ab402960-58ff-48fb-8fb6-f22da3fb8b40","year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.790452Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:e0c3525fdff01e5ca411360d838f2c45a84389647d54d0d691a73aea469c6b5c","observation_id":"d8e321ed-141b-4bb9-b7bb-2a68a195f911","resolution":{"observed_at":"2026-08-07T12:59:30.592483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.227902Z","title":"Function4d: Real-time human vol- umetric capture from very sparse consumer rgbd sensors","venue":null,"work_id":"d993a444-8c1e-4e26-a144-0750e9a73bc5","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.845197Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:25bf22e1a48c8609db7899fd78b8f47b43cb6e4a823d080b163545bc245a7ca5","observation_id":"5e4588df-5554-48bc-9615-3cc5b313e01b","resolution":{"observed_at":"2026-08-07T12:59:30.362228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.043736Z","title":"GLAMR: Global occlusion-aware human mesh recovery with dynamic cameras","venue":null,"work_id":"b676f3f7-96c0-43aa-bd6f-cd71f8a356da","year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.919244Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:ceb678e0562243c1ab9ed1abe2a55689e933e3cdc67265f32d0ba51f7dd0fd83","observation_id":"3cd973db-6364-460c-b8e1-6482f89fcd0b","resolution":{"observed_at":"2026-08-07T12:59:30.093061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.972501Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.972501Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9a40cf0a697f2e75ccd41e52ff923dca0b2b68eac7f8b481d212eb3257024b57","observation_id":"d0ff54db-8de9-4f3a-984c-bd65f7edc42b","resolution":{"observed_at":"2026-08-07T12:59:26.972501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.029876Z","title":"Adding conditional control to text-to-image diffusion models.ICCV,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.029876Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:f1903c62233b96fb23d68bdad7487c90e2e5a761186a13ea8236c21c1bd7e990","observation_id":"5f650424-84f2-4430-97a0-a5a51ea0005b","resolution":{"observed_at":"2026-08-07T12:59:27.029876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.815767Z","title":"IC-light github page, 2024","venue":null,"work_id":"2f99418b-6172-41bc-9ac1-d22accdc5204","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.085835Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:fa3711897774cf2e02489ce954d7b2137a9eea2ee351bb689c598409c30776f0","observation_id":"5697c2bc-bf4a-4209-8275-bec6e5e5dd87","resolution":{"observed_at":"2026-08-07T12:59:29.954643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-07T12:59:27.197607Z","title":"I2VGen-XL: High-quality image-to-video syn- thesis via cascaded diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.197607Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:d51682e3382e4f2801537be76c85a8dbcfd3f12d4ee645dee73ad6a3e8951fa9","observation_id":"c4cc89b7-8c1b-4a7f-a543-4af6c43f4f6a","resolution":{"observed_at":"2026-08-07T12:59:27.197607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.574334Z","title":"Consistent depth of moving objects in video","venue":null,"work_id":"abda368d-a335-4723-891a-ad14717fb79f","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.290642Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:37c84460203ec65821740e0d2c6ebcc7101ff49cb20f30cdef881695701f9c3c","observation_id":"551c7ffe-eca2-4e39-9245-198e351bb707","resolution":{"observed_at":"2026-08-07T12:59:29.688301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.364083Z","title":"SIFU: Side- view conditioned implicit function for real-world usable clothed human reconstruction","venue":null,"work_id":"59846c3a-72b4-4b02-9524-ecb8c75a109f","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.465300Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:eb12d4eac2d52677c9830c158eff48bc4d99912bdd2189b4c2bcd76a9e7baea8","observation_id":"f2299730-b323-4bea-bfea-67b1ec70959b","resolution":{"observed_at":"2026-08-07T12:59:29.466161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.138871Z","title":"Bilateral refer- ence for high-resolution dichotomous image segmentation","venue":null,"work_id":"ebc407cc-d9ef-4939-bcde-8f43e06ee7cf","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.622635Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:26fd7964a89aeb76b77aae52dfeb8905af011f9debff1d9ec51c02a6717c9113","observation_id":"3f8c97b7-cf18-42a5-91c6-8db32c16e8c8","resolution":{"observed_at":"2026-08-07T12:59:29.220649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.948614Z","title":"PaMIR: Parametric model-conditioned implicit representa- tion for image-based human reconstruction","venue":null,"work_id":"0d2f3eb8-5636-4d7b-bd1e-767c91169ea6","year":2021},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.745112Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:5a26ea1e04350278225f6ff685ed06958aa32018d9ea4322c18402c783c61259","observation_id":"26fc7723-ac14-4cb9-9337-5a7c06e93f79","resolution":{"observed_at":"2026-08-07T12:59:29.038110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-07T12:59:27.891963Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.891963Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:50daa73afe0f3b03f0b96943776188e76afcc09e25c6af57e9d610003a4a31c7","observation_id":"4182cb87-e610-47f8-9822-d9ce8182df6b","resolution":{"observed_at":"2026-08-07T12:59:27.891963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.727469Z","title":"“1q ř ktPK,dtPDt ››dt´ dgt t ››2 RMSEplogq: b 1řpKt““1q ř ktPK,dtPDt ››log dt´ log dgt t ››2 δă thr: 1řpKt““1q ř ktPK,dtPDt Kt","venue":null,"work_id":"54f9f996-c409-48f8-9402-36c14e875f97","year":2024},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.006204Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:9dce832b1706854b87898bc104b2132abb18a6ff0422e021e817c96c6942704e","observation_id":"838da50b-0235-417d-b38b-897d9c48bdd3","resolution":{"observed_at":"2026-08-07T12:59:28.872014Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.473862Z","title":"24 Figure S18","venue":null,"work_id":"3e07eafd-3023-4f8e-acae-4de5a636f08d","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.175667Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:a9db8411bf33b1f643a8bb4f557be7f69e630e4a7bf4b68675f1cfd072784d90","observation_id":"1cc54783-db91-4d93-9ed1-e99a46b31234","resolution":{"observed_at":"2026-08-07T12:59:28.563642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.554416Z","title":null,"venue":null,"work_id":"efc57d6a-7d28-435a-a2ad-3d6bd78b6b45","year":null},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.588927Z"},"links":{"citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:79866df94c01050626cbf8f85a79e39ee8a52dcb653cafb0c0d4fce6bb48e1bb","observation_id":"3644b666-5d63-48a1-be02-28e9bf3e2bb4","resolution":{"observed_at":"2026-08-07T12:59:37.639984Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:45:56.280878Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":25,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2505.23085."}