{"as_of":"2026-08-08T17:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9015cb7a014e6c515aab5ee7aff6cdb4b4db8f1b19acaa010e5da9b1f13f245","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:01:33.564821Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24124/citation-record","integrity":"/paper/2607.24124/integrity","json":"/paper/2607.24124/citation-record.json","paper":"/paper/2607.24124"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:20.966919Z","title":"Neural point-based graph- ics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:20.966919Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:83d6e974d253676c743f8f21220990dd7fc927422ffebe60018b4517a12b44a5","observation_id":"04b57429-6831-400a-a73f-836a7edc2dca","resolution":{"observed_at":"2026-07-31T23:01:20.966919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.133397Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.133397Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:967adc97a17f4c13969bd4ec9b21dbf070a8d3804a2c6573403dfcc14196f5bd","observation_id":"62092aa2-8681-4707-a00d-b1d826ab419f","resolution":{"observed_at":"2026-07-31T23:01:21.133397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.304100Z","title":"A groupwise multilinear correspondence optimization for 3d faces","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.304100Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:a86df5cdba54f1d08b5cf2f7079b82f4b8fb62c32bc9253109a899715a4759e7","observation_id":"b30c6845-5863-4e97-b04d-d9d157fd7925","resolution":{"observed_at":"2026-07-31T23:01:21.304100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.460945Z","title":"A 3d morphable model learnt from 10,000 faces","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.460945Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:b811898bc08215eb6c1cec9e1ecabb475c1deca0aba64a5c9c4f1aaf1ee8fb71","observation_id":"010412cd-eb77-4f9f-a240-6d138d9ea5a4","resolution":{"observed_at":"2026-07-31T23:01:21.460945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.612639Z","title":"3d face morphable models” in-the- wild”","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.612639Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:38ff4d0307e9b1ae5fa6869ae6f8830569f5d2870e71977ff8b5121fe2da89c7","observation_id":"55ca255a-22ff-47ff-8f95-ed5c0b17e3b0","resolution":{"observed_at":"2026-07-31T23:01:21.612639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.750349Z","title":"Multi- linear wavelets: A statistical shape space for human faces","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.750349Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:e7bbd92ece952c237c64a7487500b0bbb1174726754152f29dc5f6f6d6c34e56","observation_id":"ebc128de-7092-4655-9092-afda8f200efc","resolution":{"observed_at":"2026-07-31T23:01:21.750349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.857913Z","title":"How far are we from solving the 2d & 3d face alignment problem?(and a dataset of 230,000 3d facial landmarks)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.857913Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:86cb11f4760344d2368609ba00531b392d1eb6c77d92ae07c0a27a31a696a270","observation_id":"cc4daef3-edc9-4e37-b5c8-249f45d75959","resolution":{"observed_at":"2026-07-31T23:01:21.857913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:21.999373Z","title":"Facewarehouse: A 3d facial expression database for visual computing.IEEE Transactions on Visualization and Computer Graphics, 20(3):413–425, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:21.999373Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:5f46c10daaa6308630d8ae5890fed02709e5cc08032a3416765a4f372baddbfc","observation_id":"cd112c5b-e992-445b-9372-9d9914382d14","resolution":{"observed_at":"2026-07-31T23:01:21.999373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:22.153694Z","title":"Video- dreamer: Customized multi-subject text-to-video generation with disen-mix finetuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:22.153694Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:d3897a79219a053229baaa2f0eac29fe4ad1ca2402ceabaaf5d0193227ad9aaa","observation_id":"5d46e373-20a9-4a55-9e4e-6bdbaca7ace2","resolution":{"observed_at":"2026-07-31T23:01:22.153694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:22.350634Z","title":"Invertible Neural BRDF for Object Inverse Rendering .IEEE Trans- actions on Pattern Analysis & Machine Intelligence, 44(12): 9380–9395, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:22.350634Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:1db87154ade3f3709539311c487c3679be60e9c24d01ed3a5bf5e87a33597d28","observation_id":"c913a328-0f2e-40f2-84ab-187c516306a0","resolution":{"observed_at":"2026-07-31T23:01:22.350634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:22.526295Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:22.526295Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:3e9f6c362134fc5be8cee3b9a1c44d079e4769a03e01b92ebf1270ba146610e1","observation_id":"6070c41a-041d-46b9-a241-356e7dc62026","resolution":{"observed_at":"2026-07-31T23:01:22.526295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:22.733453Z","title":"Wan-animate: Unified character animation and replacement with holistic replication.arXiv preprint arXiv:2509.14055, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:22.733453Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:7c5909bb7f2767008e4c1d21f136169abecdb5a55eea79764510075e7943709d","observation_id":"5ef63dea-0bc5-42a1-80d5-2ae64f4479aa","resolution":{"observed_at":"2026-07-31T23:01:22.733453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:22.903116Z","title":"Generalizable and ani- matable gaussian head avatar.Advances in Neural Informa- tion Processing Systems, 37:57642–57670, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:22.903116Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:da846a5505975328daaab952b157819499ebf36437ab8d20a2089f13c4614303","observation_id":"4fe5f522-2492-49f3-b265-c6e2688de9b5","resolution":{"observed_at":"2026-07-31T23:01:22.903116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09151","last_updated":"2023-04-18T17:45:50Z","snapshot_observed_at":"2026-08-04T20:02:02.999092Z","submitted_at":"2023-04-18T17:45:50Z","title":"UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09151","snapshot_observed_at":"2026-07-31T23:01:23.077667Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining.arXiv preprint arXiv:2304.09151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:23.077667Z"},"links":{"cited_paper":"/paper/2304.09151","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:fbb9ec0d571b1254ac772ee024d05fddc8ef01474b112bbcaa9954e16279cc51","observation_id":"d4d7d0df-b3c4-4a70-b128-48c2d68f83be","resolution":{"observed_at":"2026-07-31T23:01:23.077667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:23.254039Z","title":"Emoca: Emotion driven monocular face capture and animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:23.254039Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:fcad318bc91f41da4b7e339c2f3aab8117d81e879a297ceeebb1bb56e678c600","observation_id":"e3b3cb13-8b2f-4f7d-9612-370d4afd7337","resolution":{"observed_at":"2026-07-31T23:01:23.254039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:23.445919Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:23.445919Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:074b7302b3b30388047d25053b9580633b506fc2b1f38aafefea46c76a213aca","observation_id":"fc59cfb3-0d1b-4cdd-9ef3-0a33717e4b40","resolution":{"observed_at":"2026-07-31T23:01:23.445919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:23.595294Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:23.595294Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:35aa3f2ae7f531eb00f9e80f9fde33b82b8a91a467e719b69b5cee0b8b55b596","observation_id":"3ae4e101-a193-4b0d-ac53-32fd1e58cbeb","resolution":{"observed_at":"2026-07-31T23:01:23.595294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:23.825791Z","title":"Accurate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:23.825791Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:fa3773ebe1d65cb1a31da27567db56fedf717a4ec8149b47c377c044ff388d6c","observation_id":"18b2b1c5-1eaf-4eed-a8d7-e0b4dc38aa05","resolution":{"observed_at":"2026-07-31T23:01:23.825791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:23.961587Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:23.961587Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:f0df40414050faa1f214d66669ace8ae9df3fca093d1dd9926abdf716baceaaf","observation_id":"15f4031e-e88c-41a6-9790-3b68c87b5559","resolution":{"observed_at":"2026-07-31T23:01:23.961587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:24.176431Z","title":"Black, and Timo Bolkart","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.176431Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:58d82dff7d1fb48ec6098d494194627cc21695e1f18c9c3fb7986d8b920205ee","observation_id":"45d9ddce-5cd2-4beb-b038-e1cc012a6907","resolution":{"observed_at":"2026-07-31T23:01:24.176431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-05T01:30:44.891750Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-31T23:01:24.315729Z","title":"Hu- mandit: Pose-guided diffusion transformer for long-form hu- man motion video generation.ArXiv, abs/2502.04847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.315729Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:f3f7c8cee7c000fa0a320e02f502b9c82af2461b17836d29b3954a950a5cd34f","observation_id":"34bcd504-bca9-4d4c-92d5-282b38a8f4ba","resolution":{"observed_at":"2026-07-31T23:01:24.315729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:24.459042Z","title":"Deferred neural lighting: free-viewpoint re- lighting from unstructured photographs.ACM Trans","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.459042Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:dbb2144c19900d4b79b641beb1a4cb4b21dc51afbb38c35cbf14a30fad6f2b9e","observation_id":"2e7d3526-7462-4ab7-9ab6-456896a01047","resolution":{"observed_at":"2026-07-31T23:01:24.459042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:24.569364Z","title":"Learning neural parametric head models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.569364Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:bb157e11eecc05105147e1fb5d28994af8740218e9d27932451c90432b8af444","observation_id":"b4bfee6c-98cd-4fe3-bbe8-f6f537e11ade","resolution":{"observed_at":"2026-07-31T23:01:24.569364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:24.657933Z","title":"Mononphm: Dynamic head reconstruction from monocular videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.657933Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:ccc5f48b08998f394ac2de5ebda1db7049dadfb9103daeb4950320e3f38b1838","observation_id":"b80df53f-9b3f-4398-aa18-344b816bebb6","resolution":{"observed_at":"2026-07-31T23:01:24.657933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:24.797845Z","title":"Pixel3dmm: Versatile 9 screen-space priors for single-image 3d face reconstruction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.797845Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:df5ef4ca7db7d0854b4916297ad8806f4c1757de6a0dfebe054e9c0e672ba1ee","observation_id":"736ec202-04d6-4e84-b0dc-73770447650e","resolution":{"observed_at":"2026-07-31T23:01:24.797845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-07-31T23:01:24.907644Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control.ArXiv, abs/2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.907644Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:18a96d05b92f01dabef1fd3200382d323b0135f3ef506ee36d768966019587c4","observation_id":"42d9534d-3591-4a52-ab81-3f20e1d11127","resolution":{"observed_at":"2026-07-31T23:01:24.907644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:25.102166Z","title":"Ad-nerf: Audio driven neural ra- diance fields for talking head synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:25.102166Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:bfb1732a4c3357f7cc764e3e45a9c18852fba5a0ac762a362fbb70802c7cf419","observation_id":"20713e95-f4b2-4e23-bc89-47392f9f2406","resolution":{"observed_at":"2026-07-31T23:01:25.102166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-07-31T23:01:25.234379Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:25.234379Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:2a4739538e2b326796c813fb122f62b08baaec3f4dd492a86e0acb1cc4267427","observation_id":"eb998ce2-4370-4f00-a6b4-7be3b238bc68","resolution":{"observed_at":"2026-07-31T23:01:25.234379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:25.416346Z","title":"Belongie, and Ming- Yu Liu","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:25.416346Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:afdd070d51b4246ad958e9b093de95967d6ed680efce241873cc227d972e219c","observation_id":"f2d314c0-83a7-48f9-8834-e419ce7ebafe","resolution":{"observed_at":"2026-07-31T23:01:25.416346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-31T23:01:25.641610Z","title":"Latent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:25.641610Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:206e02bbad3ebb0bac54b2357d4abdf0c7b30ac8b9c27df70f94abb1122cfa55","observation_id":"1c52d0d4-c454-4593-aa29-0d65cf92c4df","resolution":{"observed_at":"2026-07-31T23:01:25.641610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:25.803495Z","title":"Lam: Large avatar model for one-shot animatable gaus- sian head","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:25.803495Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:274ca3a7f58402e1c9c6aeef4d7451624f7c896bc8956f6aea0ef5bd5d30acbb","observation_id":"c3753f72-0a85-4cd7-b6a0-c542d957f18f","resolution":{"observed_at":"2026-07-31T23:01:25.803495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-31T23:01:26.013316Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:26.013316Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:5777719b2dfc8be1ef79022cc164273c55f3f88fa3669b0e871b9e0fb782af90","observation_id":"7827f19d-68f1-4e31-b161-0cb4017fec07","resolution":{"observed_at":"2026-07-31T23:01:26.013316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-07-31T23:01:26.128124Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:26.128124Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:4154f6bf1f138a50acda520aaec45e1b5db3ee9c01f4a60e8cbf14f44399ff03","observation_id":"a7adffdd-b8df-45fa-8728-50144462d1c1","resolution":{"observed_at":"2026-07-31T23:01:26.128124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:26.267084Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:26.267084Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:e248443bd87a847e435fa9193a1db2ae781faf08b89c0900d2f0e0c69482d1b0","observation_id":"3625eb9e-d058-428d-a74c-b0388600f88f","resolution":{"observed_at":"2026-07-31T23:01:26.267084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13439","last_updated":"2023-03-23T17:01:59Z","snapshot_observed_at":"2026-08-02T10:20:57.683645Z","submitted_at":"2023-03-23T17:01:59Z","title":"Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13439","snapshot_observed_at":"2026-07-31T23:01:26.608741Z","title":"Text2video-zero: Text-to- image diffusion models are zero-shot video generators.arXiv preprint arXiv:2303.13439, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:26.608741Z"},"links":{"cited_paper":"/paper/2303.13439","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:0236d743e55857074773ca5bb0da7795a640e3c8acca142c8c97fa9b1f4248cb","observation_id":"66efff04-fa0d-42cb-99ab-8ddd1bc66553","resolution":{"observed_at":"2026-07-31T23:01:26.608741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:26.738250Z","title":"Nersemble: Multi-view ra- diance field reconstruction of human heads.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:26.738250Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:5e9b1e789bafc873a92efe631a399524bf4f8dc1aba9c39d008e24706b015ad6","observation_id":"a6697ff7-16e1-4019-ab57-aa3b9450c020","resolution":{"observed_at":"2026-07-31T23:01:26.738250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:26.894294Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:26.894294Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:8986d06d58fdc5b63d7d070a8016965b28508ad3c0021801405e9e58ec1a3b82","observation_id":"73f37e03-3cda-48ff-9311-980286ce38b6","resolution":{"observed_at":"2026-07-31T23:01:26.894294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:27.022287Z","title":"Learning a model of facial shape and expression from 4d scans.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.022287Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:b86fc4328162a0b4087bbf9d87cfe505ed841832306843cfb5beaa74a15309a4","observation_id":"3abe4f5a-3e54-436c-b201-be2716b9db47","resolution":{"observed_at":"2026-07-31T23:01:27.022287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:27.156765Z","title":"Diffusion- renderer: Neural inverse and forward rendering with video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.156765Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:9afe90f7a57bc0bfc22bd767a655a2624502d4bc43b25c60c4348acfe383744e","observation_id":"aeac6b83-21e0-48a0-a8de-6674c154f23e","resolution":{"observed_at":"2026-07-31T23:01:27.156765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-31T23:01:27.322020Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.322020Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:dda44ab144bfcfb3cfcee0f1b12d659895713ca48008fa0953e7600f74179b3d","observation_id":"4400727c-6256-4557-adb4-6386d0c5a5ad","resolution":{"observed_at":"2026-07-31T23:01:27.322020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-07-31T23:01:27.434604Z","title":"Medi- apipe: A framework for building perception pipelines.arXiv preprint arXiv:1906.08172, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.434604Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:d0229ee03806d9908908c50b75384020d41a7a93c06808728d35c217aaa2f808","observation_id":"88414359-d999-420d-9dd8-807f05b63713","resolution":{"observed_at":"2026-07-31T23:01:27.434604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:27.595746Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.595746Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:67eb7ba49b80b9478a253b3b22935e6f635e7df41031a7dd4cab57d1ee1b03f6","observation_id":"20e187c8-2620-461d-b946-b225b17c9404","resolution":{"observed_at":"2026-07-31T23:01:27.595746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:27.743078Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.743078Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:f7ef31bee652d0beebb4302de218013268976475c0c06129df17125662dae948","observation_id":"9ae842ea-093a-446e-93e4-d7e7525fbb1a","resolution":{"observed_at":"2026-07-31T23:01:27.743078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:27.951933Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis.Communications of the ACM, 65(1):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:27.951933Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:39ab71119a9a57aad6e98df4dafdbab0126590c3b00011fea3f241b66b478a6e","observation_id":"2896304f-32ac-4b70-8bdb-3316535a7f97","resolution":{"observed_at":"2026-07-31T23:01:27.951933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.079815Z","title":"Instant neural graphics primitives with a mul- tiresolution hash encoding.ACM transactions on graphics (TOG), 41(4):1–15, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.079815Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:60e4058af2de50fe2500e66135da71c68f431028f52568f8357939c91ba1f040","observation_id":"779f7637-1159-4545-a7fe-135f3a7c9ee2","resolution":{"observed_at":"2026-07-31T23:01:28.079815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.229626Z","title":"Deepsdf: Learning con- tinuous signed distance functions for shape representation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.229626Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:3478d64a0bb73e2e56bdb0193ad0d82f5310cd6425029e28a04c8751ee891e9f","observation_id":"95562cde-32f4-41a2-aceb-660c52a854cc","resolution":{"observed_at":"2026-07-31T23:01:28.229626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.363946Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.363946Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:b6a75ea6b63733bd6e68d2442c5057f1c9acd6ccc50b07da1772c0d6dbe97f7b","observation_id":"0c5ab859-ab7f-44b4-ad92-a30726e03698","resolution":{"observed_at":"2026-07-31T23:01:28.363946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.495517Z","title":"Combining 3d morphable models: A large scale face-and-head model","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.495517Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:6225fdbf5ae3deb54fdf0e923779c0cc6107ad3ad60c481acb43cfed48b548a3","observation_id":"f1fd0665-92d5-4cc5-a600-1eb62fff8738","resolution":{"observed_at":"2026-07-31T23:01:28.495517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.617844Z","title":"Joker: Conditional 3d head syn- thesis with extreme facial expressions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.617844Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:f8417bb39bc107dec01a67b7acc8ec9e666b866c458522c271725f0dfeec8fff","observation_id":"43780df9-7780-4588-a9f2-1d61a87a71fa","resolution":{"observed_at":"2026-07-31T23:01:28.617844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.760533Z","title":"3d facial expressions through analysis-by- neural-synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.760533Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:62f5a8076c41269c523ed7854c664a93b09c70c9ee54f73b9385ff35c9bf9479","observation_id":"bdf18162-e27c-4c5a-8d10-e56f3d6bb0c5","resolution":{"observed_at":"2026-07-31T23:01:28.760533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:28.930846Z","title":"High-resolution image 10 synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:28.930846Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:995bd6fd4a1742b66506598ff86309ae1570331766a94d7d7c600d6f10ec0d3f","observation_id":"8024ff06-2395-4e9c-89d7-0998d3c9a155","resolution":{"observed_at":"2026-07-31T23:01:28.930846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:29.145622Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.145622Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:c43bda4a8b12c0643af19dfb12d3293996f75774382c8160f1e2549304ceaaf8","observation_id":"22c68df9-23ed-4efa-945c-03242d0d6b1e","resolution":{"observed_at":"2026-07-31T23:01:29.145622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:29.256089Z","title":"Sheap: Self-supervised head geometry predictor learned via 2d gaussians.ArXiv, abs/2504.12292, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.256089Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:1cb88ecf77e5048c892b955cf4115f32e5fdbbfdeac185edb751430ca9afb6b4","observation_id":"c862635b-2135-4953-8f68-3a6ab441da7b","resolution":{"observed_at":"2026-07-31T23:01:29.256089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:29.365293Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.365293Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:4dce7c6e78615ecb14bcc7b67b24a4f5da920cde2b69317004e276e8f887a36c","observation_id":"e3cef81a-dafa-4e42-8a43-804edfad910f","resolution":{"observed_at":"2026-07-31T23:01:29.365293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-01T10:41:24.348491Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-07-31T23:01:29.492740Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition.CoRR, abs/2211.12368, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.492740Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:2eeebe69065dcd1077ada52a65c3e1d965b935da938676dfd40de5c9f8b3846e","observation_id":"f258c68e-b221-4ff5-953b-e0e58885dc31","resolution":{"observed_at":"2026-07-31T23:01:29.492740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:29.620260Z","title":"Dphms: Diffusion paramet- ric head models for depth-based tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.620260Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:6a9f83e4082475d437815367196d0ba1efaecc37e4bcea0e20838cd68807b9a9","observation_id":"197d17ad-da46-48e4-a39d-a5ff6f94143f","resolution":{"observed_at":"2026-07-31T23:01:29.620260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:29.776498Z","title":"Gaf: Gaussian avatar reconstruction from monocular videos via multi-view diffu- sion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.776498Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:54ff76984ae255fdc907d0f559d374c2ad7f4db4642ad998e782045af7125d75","observation_id":"6addc775-c5a9-48f4-b2f1-7e0becd055fd","resolution":{"observed_at":"2026-07-31T23:01:29.776498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:29.883802Z","title":"3D face tracking from 2D video through iterative dense UV to image flow","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:29.883802Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:9b02b4d1daa6b082b1e87f21fd224e227bd3fe57e3af662f5541b6121287ff5c","observation_id":"99403b7f-7b58-4c0b-a5ea-6a1855f99a76","resolution":{"observed_at":"2026-07-31T23:01:29.883802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.053442Z","title":"Saragih, Matthias Nießner, Rohit Pandey, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.053442Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:d556fb4eea2a1ecf261438bf2756641f74f7e674060c52c4c7f090c1eb194762","observation_id":"14ca29a0-d689-4437-90de-47f027fffb65","resolution":{"observed_at":"2026-07-31T23:01:30.053442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.218413Z","title":"Real- time expression transfer for facial reenactment.ACM Trans","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.218413Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:c5b6b1a2a2c2953c524ea7f001870ac901e9a8379ca585d9f10f4b46228e7c45","observation_id":"a944792c-6f60-4d19-b802-f2503d8611f1","resolution":{"observed_at":"2026-07-31T23:01:30.218413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.308069Z","title":"Face2face: Real-time face capture and reenactment of rgb videos.2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 2387–2395, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.308069Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:2597afab9ce999410e765f8690cb2e5e333360849fc1249fffb669fd9cf23ae7","observation_id":"53d0574c-ed41-4f2d-9e30-3c97111c88be","resolution":{"observed_at":"2026-07-31T23:01:30.308069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.430535Z","title":"Face2face: Real-time face capture and reenactment of rgb videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.430535Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:c20513a03775e8d5d6b7da14b24882c1fa1a5b5da7aac867574aaff16f20e8f3","observation_id":"2a523162-7895-45d6-a0cb-591b28c3a7ab","resolution":{"observed_at":"2026-07-31T23:01:30.430535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.623408Z","title":"Headon: Real-time reen- actment of human portrait videos.ACM Transactions on Graphics (TOG), 37(4):1–13, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.623408Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:41bb586ac64f9c6141aff03630ae9a4657c4c42455c1364ee5b6787d1c3931b1","observation_id":"bcf5dbbe-021f-48b3-a60e-f8fa1f699e32","resolution":{"observed_at":"2026-07-31T23:01:30.623408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.754681Z","title":"De- ferred neural rendering: image synthesis using neural tex- tures.ACM Trans","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.754681Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:3958af70e10a052b81c39af760e3436ad0c33123821d770911b881d82be5e8f8","observation_id":"b8eddd12-c0a2-4261-a39b-9cf290e7d608","resolution":{"observed_at":"2026-07-31T23:01:30.754681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:30.915210Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:30.915210Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:952b4bb59584e2b0beb30a8f923103643208deb255f88a448ae49ce8c39ef830","observation_id":"9de28575-18ba-466f-89e2-c37fcd4993c4","resolution":{"observed_at":"2026-07-31T23:01:30.915210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-31T23:01:31.091385Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.091385Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:ec1e6993a2ac6158a55c7e0cc1d9a10e83f5da4e8fdebd5e977a8f9a327bfa92","observation_id":"ec9b9625-23d8-426e-b25e-b942fa2fd634","resolution":{"observed_at":"2026-07-31T23:01:31.091385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:31.194284Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.194284Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:f956887fc74d5f4a756ecd68542f39e42c1d9b4e5061874590eca8913d46de6f","observation_id":"28ecee65-a3fa-4702-b4bb-b4ef19289528","resolution":{"observed_at":"2026-07-31T23:01:31.194284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:31.302403Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.302403Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:26a4e77e38954f5370c96af08654ecf6e38b1d6663783765c217d8926621974b","observation_id":"f6376f85-d8b9-41d5-b5df-64bc2ece37d2","resolution":{"observed_at":"2026-07-31T23:01:31.302403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-31T23:01:31.435147Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.435147Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:17991a02c99dbe0356aeee6d5c80621a8915f004885c699ced5a49b39a825256","observation_id":"2656af68-61a0-4795-8024-6653e9887fee","resolution":{"observed_at":"2026-07-31T23:01:31.435147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:31.580885Z","title":"3d face reconstruction with dense landmarks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.580885Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:453fc908fe5133c9c6b8ff1b703a2cd85024f6aca5d47147f4aef4dc81b3d60d","observation_id":"002410f5-9961-4daa-b1d2-1e16c1513aae","resolution":{"observed_at":"2026-07-31T23:01:31.580885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:31.678575Z","title":"Vfhq: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.678575Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:d1cd5a6c57f919240e4f09df2cf117afc0fcc0b9162faf2e6ecb8a3bf1b7b9fb","observation_id":"4350d8bd-b4e1-476d-85ee-4688ea899bdc","resolution":{"observed_at":"2026-07-31T23:01:31.678575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:31.783848Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.783848Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:51bbe421b4336a90c4b7f8ec34a20f3e512aa8ecbbeb31b954cf868ff6bf9175","observation_id":"4f9313db-840e-40ea-b243-246de89bd8e7","resolution":{"observed_at":"2026-07-31T23:01:31.783848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00943","last_updated":"2023-06-01T17:43:27Z","snapshot_observed_at":"2026-07-06T15:36:45.014921Z","submitted_at":"2023-06-01T17:43:27Z","title":"Make-Your-Video: Customized Video Generation Using Textual and Structural Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00943","snapshot_observed_at":"2026-07-31T23:01:31.919464Z","title":"Make- your-video: Customized video generation using textual and structural guidance.arXiv preprint arXiv:2306.00943, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.919464Z"},"links":{"cited_paper":"/paper/2306.00943","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:4abb72cd1238af41f636cc903e951ceb00c6fba95012b20a77b17bda3731b91c","observation_id":"963eb17a-0c38-4e05-adbc-4d266fac56c0","resolution":{"observed_at":"2026-07-31T23:01:31.919464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-31T23:01:32.039915Z","title":"11 Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.039915Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:635cedbb728df2925918ee6d7d9b166afab22347abac5884b238bca04dcff0a6","observation_id":"6038c66d-f163-47bc-bfd3-a30d05155090","resolution":{"observed_at":"2026-07-31T23:01:32.039915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-31T23:01:32.146368Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.ArXiv, abs/2404.10667, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.146368Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:e6fdce1f09c391f45bc1f23db548a41b17f7248acfb6623b0c68c7c9a1f42f22","observation_id":"5f3263dc-c411-4b99-9f14-0054058726f6","resolution":{"observed_at":"2026-07-31T23:01:32.146368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:32.270772Z","title":"Hunyuanportrait: Implicit condition con- trol for enhanced portrait animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.270772Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:016b08187c7c86bd425c16305406259ff6b6e0b2f2db1353f19c07af2ccb7ec6","observation_id":"2ddcc368-1bb9-4db4-945c-013c0f286581","resolution":{"observed_at":"2026-07-31T23:01:32.270772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:32.343440Z","title":"i3dmm: Deep implicit 3d morphable model of human heads","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.343440Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:4bda44be23c4004a1adc938acfb5a7799488117c9517659a418b995ee83c1b32","observation_id":"8089ce0c-20a1-4e0e-a6af-657f635dd4b1","resolution":{"observed_at":"2026-07-31T23:01:32.343440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:32.478942Z","title":"Renderformer: Transformer-based neural rendering of triangle meshes with global illumination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.478942Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:babf322ef19987c9620b3d5e4fd29501ca2675a797bd2d6a3f5a628290e83d5a","observation_id":"c70dcf92-ceed-4ab4-9c6e-2089d065fc28","resolution":{"observed_at":"2026-07-31T23:01:32.478942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:32.596950Z","title":"Personatalk: Bring attention to your persona in vi- sual dubbing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.596950Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:4a452c58a3406ed00051700b5940ad2e538fca2729e7daac5d89d4c6e75e38ba","observation_id":"766675a4-ae46-421c-84d5-51d216aafe2d","resolution":{"observed_at":"2026-07-31T23:01:32.596950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:32.768625Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.768625Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:125162dcca94cf6669a5a7d30ce48b3a854aecd09967deb946b535115c134e86","observation_id":"409985b4-327d-40bb-b9ce-fba1919d0f53","resolution":{"observed_at":"2026-07-31T23:01:32.768625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:32.902266Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.902266Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:856f9dd5d798674163faed4dfc387b8f6086f4a84fefd90613281638c6b29cf3","observation_id":"5aecc79c-7a8b-4523-92fe-71fc88e04ecc","resolution":{"observed_at":"2026-07-31T23:01:32.902266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:33.043722Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:33.043722Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:1e1d8b03c2b0700b46f253f96c4c985a278427e1ad646e26c760a0b8e5fee06a","observation_id":"714a4546-5c0c-4d25-9f46-f237af751b18","resolution":{"observed_at":"2026-07-31T23:01:33.043722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:33.157071Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:33.157071Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:e4707072af7ba6e6d232e68d92b6809cf89bb6b072b879207d74c3aa2c2aab9e","observation_id":"055da03c-11ff-4e96-98cd-0d6710cfe81c","resolution":{"observed_at":"2026-07-31T23:01:33.157071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:33.316608Z","title":"Imface: A nonlinear 3d morphable face model with implicit neural representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:33.316608Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:600ff245120913ab680358ccb7e1a3dcbe9090586559c7e753b21713582f100d","observation_id":"00b5ab58-320a-48bf-903c-6ef3bad20650","resolution":{"observed_at":"2026-07-31T23:01:33.316608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:33.425017Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:33.425017Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:7798d77cf369e5af4d0399edebbf71c42f3c8be8a9ef154bc071eaaf9cfa77e3","observation_id":"0d5ed0b5-e8a5-46bb-9fab-3d21e31284d6","resolution":{"observed_at":"2026-07-31T23:01:33.425017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:01:33.564821Z","title":"Towards metrical reconstruction of human faces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:33.564821Z"},"links":{"citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:71a8a39b977fc677a496ef0447bd7ae387bd352d278c193e9558f95b3a86177b","observation_id":"37050667-85a9-4348-abe0-a8d175c6fdeb","resolution":{"observed_at":"2026-07-31T23:01:33.564821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2607.24124."}