{"as_of":"2026-08-21T03:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a795248ef375b0e38481b08f9c30f80e6b17afb1fdc6417ea7a2ae136e43605d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:04:43.030542Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.19165/citation-record","integrity":"/paper/2504.19165/integrity","json":"/paper/2504.19165/citation-record.json","paper":"/paper/2504.19165"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:44.111650Z","title":"Ren- derdiffusion: Image diffusion for 3d reconstruction, inpaint- ing and generation","venue":null,"work_id":"818f2210-42ed-4f9b-9543-4527476f93b8","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.689246Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:5dd4f7121e36694388a99d0c3b37b97bbd6e7fe7b5351f5f18e026d2e0ee1e6e","observation_id":"9e333019-eb5d-42ca-8890-1a0a29c583e3","resolution":{"observed_at":"2026-08-16T06:04:44.122100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:44.089816Z","title":"Rignerf: Fully controllable neu- ral 3d portraits","venue":null,"work_id":"c692a9ff-adb9-45f9-a9dc-28e5e6692ebd","year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.699281Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:7eee7dfa99f9aa172a0f7c2fdededd10d90c5f9f0d9f78f1e5993383c0f02306","observation_id":"b94f6888-e32b-4b65-93b3-450bc55bec79","resolution":{"observed_at":"2026-08-16T06:04:44.095579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:44.068921Z","title":"Learning personal- ized high quality volumetric head avatars from monocular rgb videos","venue":null,"work_id":"99e78471-5b3c-45a5-a9e1-8ee4580dfd12","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.705663Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:7e2ebb79f11224ff310d403314732e032a8c6a87f00b18e6e90e9de2799665ee","observation_id":"9f4b36f2-5ab5-45f1-9690-a29b1ab5b300","resolution":{"observed_at":"2026-08-16T06:04:44.074919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:44.046996Z","title":"Effi- cient 3d implicit head avatar with mesh-anchored hash table blendshapes","venue":null,"work_id":"468773a6-3c2a-4606-b75d-9acee9625f00","year":1975},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.712611Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:884697f95801209c993d653c869f3433cf574887af07714005662f68c3d90193","observation_id":"378239ad-3201-4bcb-9938-53408d3a4e01","resolution":{"observed_at":"2026-08-16T06:04:44.053506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-20T04:48:52.471048Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-16T06:04:42.719894Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.719894Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:0170c1088fe812f4675e60267c682092f7ec7266f3d897df2912d20d6afa2c8c","observation_id":"f024a557-b17d-4947-8471-1ccb28dde4d8","resolution":{"observed_at":"2026-08-16T06:04:42.719894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:44.019708Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":"d16bfba3-7b38-4175-878c-b0a8c13d766e","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.729900Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:8e30716705e393e810b7833c289663d28efe6e35f9c91942e92412b243555e0e","observation_id":"01eb0f3e-d7a3-4cd6-ae6a-7d42ce818c39","resolution":{"observed_at":"2026-08-16T06:04:44.027180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.992186Z","title":"Hyperreenact: One-shot reenactment via jointly learning to refine and re- target faces","venue":null,"work_id":"6a8f0424-999a-47f7-8809-12f21c2aa92f","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.739204Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:41e2e243991c3d16ab64682aef6baa2233ff0c43c24dd48ca3ccd62afb930af6","observation_id":"5eba6ddc-2940-4e48-a583-cf6855fd68d2","resolution":{"observed_at":"2026-08-16T06:04:43.998122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.967561Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"7fcc5b10-5f16-4d4e-93c7-b0c15a430e27","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.745807Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:572eb417c2be613440335663057e85bc14e4e60c5a2f3ffea5257bd4d83fd073","observation_id":"97c1bdfd-af73-4ade-a76a-de5b23a2abf9","resolution":{"observed_at":"2026-08-16T06:04:43.977011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.941784Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":"0b3c7eec-b068-4465-bbae-8dd57cf4fdca","year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.753875Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:ed75a607f1443c74d0901d307a6c1d1e4310a78542ba4ff118c26edb32a4a05e","observation_id":"e72ed37a-45cf-4eb8-995a-fc5287ec76b9","resolution":{"observed_at":"2026-08-16T06:04:43.948332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.914253Z","title":"Personalized face modeling for improved face reconstruction and motion retargeting","venue":null,"work_id":"13cd8867-2512-4b9d-9044-34ec9b802d31","year":2020},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.758306Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:3663685418dd7287bb4c1143fb46f2c425f858b75401e8d4bd40f5d2e9559da8","observation_id":"48ed9474-459c-4938-ae06-907bc907b23f","resolution":{"observed_at":"2026-08-16T06:04:43.922932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.763564Z","title":"Monogaus- sianavatar: Monocular gaussian point-based head avatar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.763564Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:6e25b8e811cb2bcfa149b99ddff3a896a99bf398b4911eb7007d914c30520b12","observation_id":"895e8b83-1c67-4f1b-9941-8863cd1cdb9e","resolution":{"observed_at":"2026-08-16T06:04:42.763564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13570","last_updated":"2024-07-11T07:59:02Z","snapshot_observed_at":"2026-08-18T14:48:46.520995Z","submitted_at":"2024-03-20T13:09:54Z","title":"Portrait4D-v2: Pseudo Multi-View Data Creates Better 4D Head Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13570","snapshot_observed_at":"2026-08-16T06:04:42.770897Z","title":"Portrait4d-v2: Pseudo multi-view data creates better 4d head synthesizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.770897Z"},"links":{"cited_paper":"/paper/2403.13570","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:f9ca4dec86698940961d137b2bb8eed605bac270f648550d9ed26ad091befad1","observation_id":"ba3a9968-905c-4f72-a998-8d863298458c","resolution":{"observed_at":"2026-08-16T06:04:42.770897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.880019Z","title":"Portrait4d-v2: Pseudo multi-view data creates better 4d head synthesizer","venue":null,"work_id":"42eaee92-6e95-41f8-97cb-699bd5158071","year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.782178Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:9b00e58f959156d6f0895a7b5ed1416bff78f34d24f4de9a69032622212e738d","observation_id":"640397b4-7ffa-4da1-ab8f-2b8de54be33f","resolution":{"observed_at":"2026-08-16T06:04:43.887468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.857577Z","title":"Diffusionrig: Learning personalized priors for facial appearance editing","venue":null,"work_id":"9a19278b-11db-4ea3-964f-1d1d25e7d117","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.787249Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:78666a2048835982b5dd322d22d9647299d6e19abae7f8bff2180e32002c8927","observation_id":"01bd7109-b9fd-4153-97ed-c81b9234a12c","resolution":{"observed_at":"2026-08-16T06:04:43.864549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.792301Z","title":"Headgan: One-shot neural head synthesis and editing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.792301Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:276a1de79b03fd20754ba971e5dfbc72b2986f7a4c2da85c9162ff41551887dd","observation_id":"fda516f8-b0b8-456b-9825-c49319601a2b","resolution":{"observed_at":"2026-08-16T06:04:42.792301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.797059Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.797059Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:6e8eaf1f3c352abf3709e695a26ee4d63b5c95722ceec6c6389fee14076bf12f","observation_id":"11f32ccb-80c6-4d9e-926d-b8a42fe7f759","resolution":{"observed_at":"2026-08-16T06:04:42.797059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.792110Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":"ba0aa4ee-46f4-4f54-b899-fdbbb6be2417","year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.804358Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:ff8c71697721021d54805b7a33d08905d1a8380e426776c50dd586487919bebb","observation_id":"abaf13a3-df2a-4c40-be28-1d1866c73ef4","resolution":{"observed_at":"2026-08-16T06:04:43.801463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12204","last_updated":"2022-11-10T13:32:44Z","snapshot_observed_at":"2026-08-20T17:24:06.427853Z","submitted_at":"2022-01-28T15:59:58Z","title":"From data to functa: Your data point is a function and you can treat it like one","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12204","snapshot_observed_at":"2026-08-16T06:04:42.808853Z","title":"From data to functa: Your data point is a function and you can treat it like one","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.808853Z"},"links":{"cited_paper":"/paper/2201.12204","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:ba17e203765f51c1c3b20f857f18804b283de77af7586b3cd2aebb43d430fb02","observation_id":"d372b808-2574-46b1-987d-c68d507c1891","resolution":{"observed_at":"2026-08-16T06:04:42.808853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.815231Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.815231Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:a4b58e2d3436f95a66508eb14e2b032e576b4ea113fecb39b17a9d5e7663b09e","observation_id":"f23719a9-bfef-4050-8b9b-c4ce35a2948f","resolution":{"observed_at":"2026-08-16T06:04:42.815231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.756334Z","title":"Dynamic neural radiance fields for monocular 4d facial avatar reconstruction","venue":null,"work_id":"67c1b6be-017b-459b-ac30-d25f90ab7da5","year":2021},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.823293Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:87f417e558dc9963a691d97c64de2b1248596ecb51188de1869b3881b6e3ff67","observation_id":"f0ef7c4c-82b8-4796-9e41-ac83ceee92a1","resolution":{"observed_at":"2026-08-16T06:04:43.763482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.737554Z","title":"Reconstructing personalized se- mantic facial nerf models from monocular video","venue":null,"work_id":"468c31ef-59af-4421-b5a6-1f7bdf5ad109","year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.830093Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:a8fc607a9b29bdb96ac4c717ead090ae6ad46723c2930cce675bde3c6487cd64","observation_id":"d34828a1-671b-4dd2-90ab-8d8fd1ea7b41","resolution":{"observed_at":"2026-08-16T06:04:43.744379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.834353Z","title":"Neural head avatars from monocular rgb videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.834353Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:91dc3ebbdcda59856b8b174d36e7802cf9b05d19c22e305afa1c6db6ac5544cf","observation_id":"61f4a6b8-c4da-4d6a-b175-4696513ac966","resolution":{"observed_at":"2026-08-16T06:04:42.834353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-18T14:48:47.548305Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-16T06:04:42.839847Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.839847Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:2df8d2c19b8234d541d1dbf021afda5bc23fd08a2abe43725514be5bd8445697","observation_id":"0c7d28ad-919f-4f73-b1b6-7067a7b63ce6","resolution":{"observed_at":"2026-08-16T06:04:42.839847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.689931Z","title":"Gans trained by a 9 two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"aba3fbb8-ba84-40ea-9788-600e3610ee9d","year":2017},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.848945Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:2eadfeef3f9f469ebcc992406d9c761ab0f1532ef10b18c736d07061ce9e8cff","observation_id":"8f732032-42c1-4b34-826f-0295548be098","resolution":{"observed_at":"2026-08-16T06:04:43.702421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.853830Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.853830Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:403ebe6eed654fd6fb7a119bd32791235d791ab5d313f806f730397d80d665ae","observation_id":"dd33650e-159a-4490-abff-a6bdc108ffa2","resolution":{"observed_at":"2026-08-16T06:04:42.853830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-08-12T18:09:04.196531Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02463","snapshot_observed_at":"2026-08-16T06:04:42.860950Z","title":"Shap-e: Generat- ing conditional 3d implicit functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.860950Z"},"links":{"cited_paper":"/paper/2305.02463","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:01298fcd91c8269b20bf8f8755bd3da563a93164f7fbbf15915af980aff120fb","observation_id":"ac1e49a8-87d8-44d2-87c0-2096b4e9dace","resolution":{"observed_at":"2026-08-16T06:04:42.860950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.656569Z","title":"Ln3diff: Scalable latent neural fields diffusion for speedy 3d generation","venue":null,"work_id":"89f624fa-7d9e-4e19-be2b-627c36329da4","year":2025},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.867234Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:e60f80e17817da55254c91b371c5dbdbe9add5ec791175030d554061c7291e7c","observation_id":"3c4c3c10-414e-47eb-91fe-c613a3fd1dd9","resolution":{"observed_at":"2026-08-16T06:04:43.662889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.633672Z","title":"Learning a model of facial shape and expression from 4d scans","venue":null,"work_id":"8e1cb53a-4ff2-41d1-84ab-4c3b5b2c0aa2","year":2017},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.873514Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:7399fd438044800993e9cebccfa9b93f78a3d1e4147e575d2bbc7859701dd8f1","observation_id":"432661a3-44c1-4231-b5f7-d3c5ddf3eba4","resolution":{"observed_at":"2026-08-16T06:04:43.643270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.613967Z","title":"Raft-stereo: Multilevel recurrent field transforms for stereo matching","venue":null,"work_id":"fd3486b8-84fa-467a-830f-e2df13c3fccf","year":2021},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.880282Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:57625c0e6fd5baf44998876ab3352fb36afb4b26e4d4dc091d878e9d09093a4e","observation_id":"77826726-8948-4f95-8553-75f8e1546fd8","resolution":{"observed_at":"2026-08-16T06:04:43.618994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.888933Z","title":"Diffdub: Person-generic visual dubbing using inpaint- ing renderer with diffusion auto-encoder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.888933Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:f544a6bbf27be94763f01ae92eed8ae0c715a6d38abe7b9695ab6abf1d0e96e6","observation_id":"4ee9bd4f-a068-4061-890e-5c481df67c80","resolution":{"observed_at":"2026-08-16T06:04:42.888933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-08-18T14:57:45.246060Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-08-16T06:04:42.894821Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.894821Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:df76c891918f3c27374f038e4c9ce5344bf2768fddd4d551152f36b3850f4e9f","observation_id":"71f1f70a-8ad2-4c60-b363-0cc1a1b8f390","resolution":{"observed_at":"2026-08-16T06:04:42.894821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.899570Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.899570Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:37fdd167610293bda9be67ec428a384e23d7f8fd94a34f1a708defca27a17845","observation_id":"00131728-8648-4758-a9c8-32939d87bcbc","resolution":{"observed_at":"2026-08-16T06:04:42.899570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.904536Z","title":"Diffrf: Rendering-guided 3d radiance field diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.904536Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:1f88c65a281bc2553c801ab9842214cf39bec92d4ef8066ff93a1a2053f7ee46","observation_id":"48d35746-f573-4d2e-9b30-d498affff066","resolution":{"observed_at":"2026-08-16T06:04:42.904536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.910487Z","title":"Gaus- sianavatars: Photorealistic head avatars with rigged 3d gaus- sians","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.910487Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:ea693ad8d9758778ceb8e1b01fc31c9d2bfe2ee3843a1eafdb1c92bf519564aa","observation_id":"fb07274f-9a60-4674-83b7-3438574cec79","resolution":{"observed_at":"2026-08-16T06:04:42.910487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.922075Z","title":"Relightable gaussian codec avatars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.922075Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:9ac7e36448d1377e8f7f17d805fc2b0f4afba230738f080cd7a09732689070b0","observation_id":"d27f5b89-d8e8-47d0-bec8-6edaa42a9550","resolution":{"observed_at":"2026-08-16T06:04:42.922075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.929358Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.929358Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:e601e82af984031a4f438bd94f9b4a973d01a8c773857f2a1cf27f79176c2c89","observation_id":"5ab4cd2f-7a74-44ff-bcc8-8a2199f171c3","resolution":{"observed_at":"2026-08-16T06:04:42.929358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.488838Z","title":"Diffusion with forward models: Solv- ing stochastic inverse problems without direct supervision","venue":null,"work_id":"2f8f770f-ab5b-4931-bd2a-9dfb81a26047","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.934970Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:778e1c9dc9c86073714dbffd3f0ab2ab74d823931cc4d48b3aeded5f8848babb","observation_id":"b06ce8dc-4c39-4c49-afaa-76d685eec1b4","resolution":{"observed_at":"2026-08-16T06:04:43.494852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.466193Z","title":"Chan, Chao Liu, Zhiding Yu, Sameh Khamis, Manmohan Chandraker, Ravi Ramamoorthi, and Koki Nagano","venue":null,"work_id":"5ed137d6-304c-4cfc-ad88-315404bd4c48","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.941945Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:879b2722540397c626f2add7fc2b16e239a637e709aba4aae288876b990b5324","observation_id":"7a03ed31-f658-4d2b-a3e0-b7e790661664","resolution":{"observed_at":"2026-08-16T06:04:43.474005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.442869Z","title":"Single-view view synthe- sis with multiplane images","venue":null,"work_id":"4abc7a08-1c48-49d2-9ba2-dbb8c93ad07e","year":2020},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.947702Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:12d531748ec266519e883c38486aacbe2211ae0336cb1b8e7168f5541288f305","observation_id":"4c7d81ea-6620-4153-8df6-cbe30b6b1007","resolution":{"observed_at":"2026-08-16T06:04:43.449010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-16T06:04:42.952677Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.952677Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:e94af55dd11f993ea6daa9b20fed66ed4ca6fad222a5a6476ab7936f018477a3","observation_id":"900e13e8-31ec-43c3-a5ab-d05d2ae1a11a","resolution":{"observed_at":"2026-08-16T06:04:42.952677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.958332Z","title":"Lion: Latent point dif- fusion models for 3d shape generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.958332Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:ab1c0765ea9012bb1588eb346c4f6d4791d53542e78589c5d1345c6a78f73ee0","observation_id":"36235e18-5975-4621-9fc0-56d40abafb2a","resolution":{"observed_at":"2026-08-16T06:04:42.958332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.964174Z","title":"Rodin: A generative model for sculpting 3d digital avatars using diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.964174Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:5bb29f1e108b6d33622e8f9eb9e26e2988bb4982cb086e5ba40e6aeb0860e1fe","observation_id":"aeaaa91b-c604-488f-9f48-7e07fa705751","resolution":{"observed_at":"2026-08-16T06:04:42.964174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.969788Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.969788Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:cafbdbfab52caa94fb8f54cac6a757b44e26079f4ace6ab2cfca87799fb77577","observation_id":"bd29e840-3d99-4e15-ad7e-70f1a3bdddd1","resolution":{"observed_at":"2026-08-16T06:04:42.969788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.372980Z","title":"Mvdd: Multi-view depth diffusion mod- els","venue":null,"work_id":"44c9dd6f-2340-43af-b48f-c982d6aed3bb","year":2025},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.975073Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:a9a28cb20c8e1edae4c6e717ec251141ff41627ed35212f081fc31e8b9e578f7","observation_id":"0b5ea385-f09f-4d9c-89c4-35069fa852b7","resolution":{"observed_at":"2026-08-16T06:04:43.380066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.355680Z","title":"Vfhq: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":"43aea158-0249-4e1f-943a-63a0cd73cbc5","year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.979146Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:90c6a6a55099ec2f3d28f5968a9b3ab8808a20da2ecadb940b45df9f5173b6c7","observation_id":"5dd5e7d6-bf68-4966-91c9-a57862a1bc9b","resolution":{"observed_at":"2026-08-16T06:04:43.361399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.339106Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":"f6ef1b34-4f6c-4986-88ba-d1ba4dd99a50","year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.986581Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:4c7af3c8109818ac3c3d3f75643d5f4b2a15c204db6a3b155f68d88de6d3cd42","observation_id":"e8946256-01df-410d-8ac7-8e3d2f6af16a","resolution":{"observed_at":"2026-08-16T06:04:43.343837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-16T06:04:42.990961Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.990961Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:29f97aa121e550582e95389e2fedd5ef7602ee86766127ccae45aee8ab7ba438","observation_id":"62f99e85-72b4-44c7-ab1d-439fb9459931","resolution":{"observed_at":"2026-08-16T06:04:42.990961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.321904Z","title":"Styleheat: One-shot high-resolution ed- itable talking face generation via pre-trained stylegan","venue":null,"work_id":"3d3ea121-0d47-43a4-8e55-62b5f0de8c0f","year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.995717Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:46ea7629a7debbc43a0aa44995561d772498e5dabb1f19fb92c80415912e77cc","observation_id":"126d6c94-fb95-4c97-8da8-a1eb2d1e686b","resolution":{"observed_at":"2026-08-16T06:04:43.327775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:42.999690Z","title":"Fast bi-layer neural synthesis of one- shot realistic head avatars","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:42.999690Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:9613bf04bad30a8a76aa0aff190db58ef218474a093e0cca7bce92fa6cd429c2","observation_id":"fb2d03ea-0291-44fb-8ffb-d30ea944ce45","resolution":{"observed_at":"2026-08-16T06:04:42.999690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.006003Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:43.006003Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:31fc85f379587785ec2c81072fb4dbac1e22a2dc8f1000a7b59aaf0bddbd7817","observation_id":"a1e65c85-ea80-49c9-a6d0-634f03333952","resolution":{"observed_at":"2026-08-16T06:04:43.006003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.010461Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:43.010461Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:a2cfca762334741c1e7aedcb97c1d09bdf278f39eea52cb24eeb30f04289541a","observation_id":"95ad8f95-f661-49b9-81f5-b902c32c4d98","resolution":{"observed_at":"2026-08-16T06:04:43.010461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.014480Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:43.014480Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:c35da40c8fe663c07d4279940c87595c17aab4d576a03c81f91646cfa6205025","observation_id":"f706462d-5f2b-4fa3-9fe2-2bea7e568185","resolution":{"observed_at":"2026-08-16T06:04:43.014480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.259979Z","title":"Generative multi- plane images: Making a 2d gan 3d-aware","venue":null,"work_id":"b833862a-e60b-42a8-ab7e-cb4dd5e381ca","year":2022},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:43.019943Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:cf6718059fcf4ae50d5213f6d9b24fc2b2d6226448b8d13a8ed0359d4d029838","observation_id":"8693f762-f413-4ecb-9694-1ecb3ac09957","resolution":{"observed_at":"2026-08-16T06:04:43.266884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.243958Z","title":"2D diffu- sion + depth","venue":null,"work_id":"cf8e5f26-9bab-43c7-a78d-7ca2f9dd6050","year":2023},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:43.024683Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:550135f3d1f0f6ff55a19376c537ed57884ae3856a237f7cae0b2d5992ec9d43","observation_id":"82d0e6ce-f84a-4d63-a882-673dd3f98203","resolution":{"observed_at":"2026-08-16T06:04:43.248955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:43.222884Z","title":"In our experiments, all the side view render- ings, stereo renderings and rendering speed measurements are conducted through the first method","venue":null,"work_id":"425e73c7-3878-4482-8d9c-ed6a4989ac1b","year":null},"citing_paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:43.030542Z"},"links":{"citing_paper":"/paper/2504.19165"},"observation_digest":"sha256:be45217fbe7209f83d68d22054a3f1f4a3f34804159a64351f4dd6105376a4bf","observation_id":"a42c6fbb-94f4-4a55-8a74-a8da4b964f9d","resolution":{"observed_at":"2026-08-16T06:04:43.231620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19165","last_updated":"2025-04-29T09:05:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T04:01:05.263003Z","submitted_at":"2025-04-27T08:56:02Z","title":"IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2504.19165."}