{"as_of":"2026-08-05T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9fe5eb10a9effaf1435e1184cb59bb0d914068555976fe3dc1c0a0462f183c5","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:53:07.665803Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:10:53.858692Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19923","snapshot_observed_at":"2026-08-02T05:10:53.858692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13472","last_updated":"2026-07-15T06:02:41Z","snapshot_observed_at":"2026-08-02T05:10:42.286095Z","submitted_at":"2026-07-15T06:02:41Z","title":"EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:10:53.858692Z"},"links":{"cited_paper":"/paper/2604.19923","citing_paper":"/paper/2607.13472"},"observation_digest":"sha256:199d23ef58aa99762c695c77174aed0319e25b70dc64d2587e5a047e42fcfb9e","observation_id":"93b942f9-f6fa-47e2-a1d6-bdf44f0e30ec","resolution":{"observed_at":"2026-08-02T05:10:53.858692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19923/citation-record","integrity":"/paper/2604.19923/integrity","json":"/paper/2604.19923/citation-record.json","paper":"/paper/2604.19923"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-hmr: Multi-person whole-body human mesh recovery in a single shot","venue":null,"work_id":"4514e674-752e-4036-9eb8-1890198a072d","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:d9288d3896fee7554055e1d5a11e1a55be7b0d4f5d2770b5022d4bdee5ddde7e","observation_id":"9fc3a5f6-17ac-42c6-a57f-192761e5dc39","resolution":{"observed_at":"2026-05-12T17:41:45.058009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keep it smpl: Automatic estimation of 3d human pose and shape from a single image","venue":null,"work_id":"ce237ba9-5694-4397-b966-033950698ef5","year":2016},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:57538db723ccae30214ce59b2cf6290e2acabe8a6e72d3c35d3d280af1a7f585","observation_id":"87794b5f-d1a7-4c4b-9d88-35b1de40a791","resolution":{"observed_at":"2026-05-12T17:41:44.992901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation.Advances in Neural Information Processing Systems, 36:11454–11468","venue":null,"work_id":"be63beec-1d9b-432f-a62b-712ad1dcbcce","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:9d31d68bcc79f0e0d2bc19616840dadc09807309e64d0c86b3e383dc04451287","observation_id":"5f3a50e3-6cf4-4272-b59d-ebd2ff16dc4c","resolution":{"observed_at":"2026-05-12T17:41:45.020136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human3r: Everyone everywhere all at once","venue":null,"work_id":"f1a43f0e-a2a5-4ad2-a41e-a4ff8583d75b","year":2026},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:efe23192b26320e48d6350201472134f6b4c7e96d0232523fc085c149c16b5d8","observation_id":"de93c552-f7dd-4481-948c-b7e0b7915cbe","resolution":{"observed_at":"2026-05-12T17:41:44.937246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pico: Reconstructing 3d people in contact with objects","venue":null,"work_id":"e3e4db98-e821-4766-ba1f-fd9a4069d894","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:dbdf826b8d11e06572063779da32a5c7e4e66f09c674dced407ab41eb6a7876f","observation_id":"5f931650-3cde-4e1c-81e1-89f00070b976","resolution":{"observed_at":"2026-05-12T17:41:44.926372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sloper4d: A scene-aware dataset for global 4d human pose estimation in urban environments","venue":null,"work_id":"b4a0a74c-0a98-4fd3-9b71-7356db0f0a02","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:b3a652de9ebbdbf0d4d3e13e4aeee98b88cfb560a5e3fb0a95b87aadb4e72e62","observation_id":"eb647ca6-e224-402f-b0df-d46618f32c61","resolution":{"observed_at":"2026-05-12T17:41:44.918016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokenhmr: Advancing human mesh recovery with a tokenized pose representation","venue":null,"work_id":"034b0aa1-5997-4003-9927-3121033a4339","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:0fa362f1ff14f6c60dd35e3b99f7b922ad1bdbcc058270d693d21070957c2ba5","observation_id":"2f1e53b9-cb51-4207-9b82-a46cb180ffe6","resolution":{"observed_at":"2026-05-12T17:41:44.922478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactvlm: 3d interaction reasoning from 2d foun- dational models","venue":null,"work_id":"2cbdcaed-f167-413f-9458-642428d9722b","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:e1e6cd7f22276b7aec4e00a978de0f95b78b80d2a991988a08ef85784f1e4c3f","observation_id":"5a2323ea-257e-4fdd-bd97-cf6b1a041ab8","resolution":{"observed_at":"2026-05-12T17:41:44.929839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humans in 4d: Reconstructing and tracking humans with transformers","venue":null,"work_id":"5406f405-a507-47d4-8f92-1660671fcbf0","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:04b828906337f427dd78f02bdd5d59a66c412c472769d07ddbb17966d07c8840","observation_id":"16e3b35b-d4ce-4537-a191-46ab2bfb69a4","resolution":{"observed_at":"2026-05-12T17:41:44.933547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:42.500290Z","title":"Mask r-cnn","venue":null,"work_id":"aa4d890a-4e96-4754-b284-bc82da5c52de","year":2017},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:79f350a10e03bca126750c85744cc855214fd6d54abdf5d5d63c577eae24a8e0","observation_id":"bfe20e6c-8c9d-4b9f-919f-e88b20887f74","resolution":{"observed_at":"2026-05-12T17:41:44.959345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Capturing and inferring dense full-body human-scene contact","venue":null,"work_id":"b7bbd3d0-db96-4663-92d5-bfbd2fe652ca","year":2022},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:4b1a02b8c6b42f9f080cdee3b53e8479c815c8e47fd03f241763bc59ed6cc000","observation_id":"551366f6-eaf8-434b-ae01-0c0112a01d7b","resolution":{"observed_at":"2026-05-12T17:41:45.065067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompt tuning","venue":null,"work_id":"2f8746ce-4519-4fbd-8148-e524a12691c3","year":2022},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:1f24e09d2d78d2ad5518998e38b274c030a56be2f9730b823de49e2964c2e721","observation_id":"79087310-a5b1-4649-ab04-d7494ad66d29","resolution":{"observed_at":"2026-05-12T17:41:45.068488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end recovery of human shape and pose","venue":null,"work_id":"87fc4973-2e4c-4d73-927f-043ae898dff4","year":2018},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:57a70355c9bd0a708fafb69b792826a32a11b760dcd1d88e1b05cf012be79cdc","observation_id":"a295dcc7-cc0a-4f6b-9c06-d2b6d342a44c","resolution":{"observed_at":"2026-05-12T17:41:45.016669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:26:26.039922Z","title":"EMDB: The Electromagnetic Database of Global 3D Human Pose and Shape in the Wild","venue":null,"work_id":"1620d119-02e4-4534-bc37-94ce267c6c6c","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:b93c58b0bdcece58a66fdb975e58e7bd757321e3d96976439db75c064a149d2a","observation_id":"2cdf4f8d-76bd-47fb-9ace-321b7e9c9653","resolution":{"observed_at":"2026-05-12T17:41:45.039222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pace: Human and camera motion estimation from in- the-wild videos","venue":null,"work_id":"7550c0c2-6562-4d2f-ac50-f554566e4e77","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:ba479def69c562d3d5f908ac23cffd2f2621e89c2b3597920bd6e2d91223d2db","observation_id":"b66c9b7a-7b02-4e79-a2b8-420535b08eaf","resolution":{"observed_at":"2026-05-12T17:41:45.042860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coin: Control-inpainting diffusion prior for human and camera motion estimation","venue":null,"work_id":"5175341c-ab4a-45d7-aa41-7450de4f45ba","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:5095d1045e0e213a9ce7e4f0a21ccc503d0e99cc49d292bfa3b401546242cb2c","observation_id":"96776124-ce92-43e4-90de-2e36ab51810d","resolution":{"observed_at":"2026-05-12T17:41:44.969464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unish: Unifying scene and human reconstruction in a feed-forward pass","venue":null,"work_id":"3ac3fe0a-4d8c-48df-a522-fd190cefe7e6","year":2026},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:f564854cf41e35014889b7543992f8e9a7e1b645a83634a504cf35b32acc37cb","observation_id":"33ecfa4d-c7a6-4da7-a730-a6a3acdf6866","resolution":{"observed_at":"2026-05-12T17:41:44.976508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cliff: Carrying location information in full frames into human pose and shape estimation","venue":null,"work_id":"ae50a0bf-d5f3-4aa3-8777-bfe490cd3154","year":2022},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:968b19822d56a7ded3e71a2c8ef1255a4c53147a7107d74971686162e4be3138","observation_id":"a5243875-6a1f-49fd-8ab0-00e16a74e4ec","resolution":{"observed_at":"2026-05-12T17:41:44.996419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint optimization for 4d human-scene reconstruction in the wild","venue":null,"work_id":"fc3515eb-bb54-4a6c-b7fa-3a31c9b4bc9c","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:f5a830d63438e697e900ab591d45309b4fb1dd75fb6be2228da69e3df8801511","observation_id":"9158cff0-aa54-4853-ad69-20918b467225","resolution":{"observed_at":"2026-05-12T17:41:45.010105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.801034Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":"be6eeb6e-0550-4b11-9a06-2e4150388990","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:045814a05fb448abf923675c58c6d592b1039615f3043ccdc84a3b492a19df5e","observation_id":"de9d2001-7463-4754-b0a9-3877ab09ad31","resolution":{"observed_at":"2026-05-12T17:41:45.023941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconstructing people, places, and cameras","venue":null,"work_id":"c3bd75c1-1f63-47eb-85fc-9d8986202628","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:c99fdc6069dfe49efe7289b31a4b15c3c8f8c3859ef5d509219b1040ab735b2d","observation_id":"ad3eef9e-697b-4756-954e-4501306c28fc","resolution":{"observed_at":"2026-05-12T17:41:45.061513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Camerahmr: Aligning people with perspective","venue":null,"work_id":"a5c6f7bd-40db-4db9-9886-d73d0321b805","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:5546ed3f2fd7f2719cab0061a4c8378f3fbe372ca532e835a72d0778986f79c6","observation_id":"fd81e7d1-128b-41e8-8034-d6900b280c1c","resolution":{"observed_at":"2026-05-12T17:41:45.031420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive body capture: 3d hands, face, and body from a single image","venue":null,"work_id":"d46cd82a-2028-410f-8080-11305af982fc","year":2019},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:23182a4e7b8fab2403d9b116ad533d904ea29d400b4d5f3c9f568548352811f7","observation_id":"f9a1536e-883f-4659-9be9-c7adbd6e079c","resolution":{"observed_at":"2026-05-12T17:41:45.052814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The one where they reconstructed 3d humans and environments in tv shows","venue":null,"work_id":"9cff5cbd-4bd2-4173-98c9-abc5796fb2e1","year":2022},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:9ffe611c6a3262affef0674331e575569e3261a7c100653a5a9de973035e10b7","observation_id":"565867e0-9bde-4a1c-aefc-1210b704f0a0","resolution":{"observed_at":"2026-05-12T17:41:45.002047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16433","last_updated":"2025-08-22T14:43:18Z","snapshot_observed_at":"2026-08-05T17:22:49.005807Z","submitted_at":"2025-08-22T14:43:18Z","title":"HAMSt3R: Human-Aware Multi-view Stereo 3D Reconstruction","version":1},"cited_work":{"arxiv_id":"2508.16433","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16433","snapshot_observed_at":"2026-06-30T13:44:40.705501Z","title":"Hamst3r: Human-aware multi-view stereo 3d reconstruction","venue":null,"work_id":"858e7139-20f2-48fe-8204-c3ac74e68555","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"cited_paper":"/paper/2508.16433","citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:a62b5cce322a7ea63f7a84bdf2619a066115b683256fb6a49d76ef3eef309428","observation_id":"1d52a644-1be3-4655-aa70-6f103fe14708","resolution":{"observed_at":"2026-05-12T06:51:28.911308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wham: Reconstructing world- grounded humans with accurate 3d motion","venue":null,"work_id":"e12e14e8-719c-4fc5-bd58-b771b87905b3","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:11076ce47607e91ecf2ceb02ac063bc4c3d5887ce27b143668947c22fae7dbcd","observation_id":"ce72d251-d7d4-490b-b59d-5c6f2c363921","resolution":{"observed_at":"2026-05-12T17:41:44.984792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Putting people in their place: Monocular regression of 3d people in depth","venue":null,"work_id":"b70607a3-5652-4475-a915-dd64e3c0b043","year":2022},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:8cea3cd4024887ac5f5f6594bc5bdd6c3e63eed9fb60bd15ca168704c59e2507","observation_id":"1e6494e6-1858-4f85-b826-550c612e2677","resolution":{"observed_at":"2026-05-12T17:41:45.048913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deco: Dense estimation of 3d human-scene contact in the wild","venue":null,"work_id":"b7ff1458-9676-416a-ae86-9493179cc6ac","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:1844431b3a326505c6063f77239e66d6022abb83b9af109a2b264f12ca0bbb13","observation_id":"71a9926b-e647-495a-a352-31e3dca8975f","resolution":{"observed_at":"2026-05-12T17:41:45.006269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang, Taheri Omid, Michael J","venue":null,"work_id":"6ed6284a-3d4b-4ea9-9a13-b3a8d19c78b4","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:d44716d1f258b880e655f9632c46f23b66de7513e1c15000411aa6bc6785667a","observation_id":"c49af7d8-0138-4903-b6cf-235165cab999","resolution":{"observed_at":"2026-05-12T17:41:44.966032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humos: Human motion model conditioned on body shape","venue":null,"work_id":"c37d577d-ac50-4d7e-9335-2649ed042634","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:a66224744d74b7891e228d0db6c9075c4beb8314e64ae015cda9b3cc8bb593cd","observation_id":"83674f58-74dc-4762-9631-f8eb863b655b","resolution":{"observed_at":"2026-05-12T17:41:44.973297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contact-aware retargeting of skinned motion","venue":null,"work_id":"84d48198-4bc9-41f4-984a-461d017db81c","year":2021},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:152cdb58a716221f5052640c0f58ec406d111bddeee20edfdcc5d4398c85b48b","observation_id":"2e8b2323-9f8d-46c6-b5f1-3134ba45a4cd","resolution":{"observed_at":"2026-05-12T17:41:44.981169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recovering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":"5bf4775a-d2d8-4ee9-a73e-986d62df8285","year":2018},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:155ca41e1181881f2d2859f5a56b6608de90052e21354861aea596db479475bc","observation_id":"c09b547d-72c2-4dec-944d-b2d3a97023ca","resolution":{"observed_at":"2026-05-12T17:41:44.989266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efros, and Angjoo Kanazawa","venue":null,"work_id":"f2deeb86-407e-42cb-b704-c39b81e532dd","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:7e87063e6c746b6514a84a20457010621d10460da90da5ad472a27f6b1c6896d","observation_id":"9f8fe451-5f17-4bfa-8973-15fee455f349","resolution":{"observed_at":"2026-05-12T17:41:45.013303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refit: Recurrent fitting network for 3d human recovery","venue":null,"work_id":"ee6a9203-adae-4798-8aae-b9f0afb179de","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:d631345a059ffabcde06477d74f49c2d4f87d837ff0fcfa5d9f565d44f07f1a6","observation_id":"06978947-ab79-4994-b92c-15fada0287e4","resolution":{"observed_at":"2026-05-12T17:41:44.952130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tram: Global trajectory and motion of 3d humans from in-the-wild videos","venue":null,"work_id":"a40b4526-43a2-4678-833f-f2e062d71f5e","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:bd152c8724de4f7cf03a0f50d2e113bbf5f6baa045c97d66e81625099388ecc0","observation_id":"cae6b321-f935-4feb-a72e-72dfa587d5d9","resolution":{"observed_at":"2026-05-12T17:41:44.955925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic 3d human and scene mesh estimation from single view images","venue":null,"work_id":"5da59f3b-c0d6-4e81-86b3-92dfee09192f","year":2021},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:a26ff051e7354a2f7eba4b95c5dde4d39944693bfdda04dccd6e69f54607a85f","observation_id":"43c9d5b8-23a8-401b-b322-f4e7c9682976","resolution":{"observed_at":"2026-05-12T17:41:44.963013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smpler: Taming transformers for monocular 3d human shape and pose estimation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(5):3275–3289","venue":null,"work_id":"3a44437d-31ae-498a-b814-02c3b07269a3","year":2023},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:392a89bfc85cad900ae439f09305277c9ecda9dde6473802739de4b1b78a0913","observation_id":"3cf69581-da72-4bbd-9ae1-329125145cbb","resolution":{"observed_at":"2026-05-12T17:41:44.944707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hsr: holistic 3d human-scene reconstruction from monocular videos","venue":null,"work_id":"ad30db05-c4e7-4004-822f-4a0ef6280523","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:ad278c7c7f0f2c7de40b26a002bc354eac96ffbe4e96484eba0dcfde97916429","observation_id":"2ff73e89-c672-4136-b99d-01a0fb57bc85","resolution":{"observed_at":"2026-05-12T17:41:45.035422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physic: Physically plausible 3d human-scene interaction and contact from a single image","venue":null,"work_id":"4c09d750-1f7c-41f5-b339-adcce428b9ff","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:a3a1c99ec6e24a7302f9fc33a9f8e0dd3edc57d0069073aa4557de4565dfad8e","observation_id":"381ab07b-9f49-4cab-8c37-250fd8ee2167","resolution":{"observed_at":"2026-05-12T17:41:44.948366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09782","last_updated":"2025-01-16T18:59:46Z","snapshot_observed_at":"2026-07-06T20:22:09.358394Z","submitted_at":"2025-01-16T18:59:46Z","title":"SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation","version":1},"cited_work":{"arxiv_id":"2501.09782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09782","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smplest-x: Ultimate scaling for expressive human pose and shape estimation","venue":null,"work_id":"702da874-1be1-4058-9a3b-71e775d3666e","year":2025},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"cited_paper":"/paper/2501.09782","citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:efd293ae299558fe8a9d633379b35dc110d25d1fe31bebe314c2ab7cba893a24","observation_id":"6592ab2a-b527-482b-af93-aba9ebe212c5","resolution":{"observed_at":"2026-05-12T06:51:28.904237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b31f2229-1b64-4345-886e-a2362e12a4fd","year":2026},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:9386eac7a363721a2a4bc17a933cf0fec816cafcffd1caec375a5ff8439d935b","observation_id":"f08f05a8-9ed5-4c16-8bae-f8e18a4cfbcd","resolution":{"observed_at":"2026-05-12T17:41:44.940643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synergistic global-space camera and human reconstruction from videos","venue":null,"work_id":"7e5d862a-ee5b-4862-9178-b91ac7d6b8f9","year":2024},"citing_paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T03:53:07.665803Z"},"links":{"citing_paper":"/paper/2604.19923"},"observation_digest":"sha256:c29cff2e051f416b95f170e326fdcdae2898bfbaa81aae71f5fe312a9e0761f1","observation_id":"ceb48f95-8ccd-4efa-8cc2-60bdf8f32fcb","resolution":{"observed_at":"2026-05-12T17:41:45.027792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19923","last_updated":"2026-05-11T05:47:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T20:46:09.708820Z","submitted_at":"2026-04-21T19:06:50Z","title":"UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2604.19923."}