{"as_of":"2026-08-07T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9df338ef61f97e124a9f721d409cd1a2f8cfe516f94b5c94f231826c8be20184","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:08.145034Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14015/citation-record","integrity":"/paper/2506.14015/integrity","json":"/paper/2506.14015/citation-record.json","paper":"/paper/2506.14015"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.903371Z","title":"Clipface: Text-guided editing of textured 3d mor- phable models","venue":null,"work_id":"4b60059b-9e19-42aa-93de-107a8974a18c","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.898389Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:91ac09c615a1b8d711046bda1cc7a2846ffba5b414a3c77cabbd7039d756854e","observation_id":"735566f0-9610-4d9f-b7e3-458d0f21bd36","resolution":{"observed_at":"2026-08-07T00:31:08.907134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.892513Z","title":"Bergman, Petr Kellnhofer, Yifan Wang, Eric R","venue":null,"work_id":"d80edf91-b78b-4b82-befd-6fdc94913857","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.903530Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:b9aa7c6470ca1ba87f5fceaeab1dad37cc6174f6ccef0b2727877ac5c59c80ac","observation_id":"7d03369b-3ed5-4970-b7a1-47346e794324","resolution":{"observed_at":"2026-08-07T00:31:08.896548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-07T00:31:07.907862Z","title":"Demystifying mmd gans.arXiv preprint arXiv:1801.01401, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.907862Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:73ccb46258824a044ad8517e24af716a11e097fa60d0d2378399d3468353ba72","observation_id":"2bb60aaf-6068-4582-9d0a-fe92ffa4c3a5","resolution":{"observed_at":"2026-08-07T00:31:07.907862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.881003Z","title":"Text and image guided 3d avatar generation and ma- nipulation","venue":null,"work_id":"8c85dee7-6fe4-4a87-87c6-dbd2398d1e13","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.912939Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:ecc3508212ffa48a41b9a574a9ec6286dc61b0e6d7e7dc1bdd632b841cbe9db8","observation_id":"f037af5b-db65-4d06-8022-db41774bdd87","resolution":{"observed_at":"2026-08-07T00:31:08.885244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.870141Z","title":"Chan, Connor Z","venue":null,"work_id":"6ed07662-cc62-4c3a-9e67-501c69abb630","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.917859Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:7eff338eb6d3c4faf94f993e1e270d6b137d1251df09353706ec789fdde277ce","observation_id":"7a8249a7-fc52-4ccb-9b14-8941913789a8","resolution":{"observed_at":"2026-08-07T00:31:08.873696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02083","last_updated":"2023-06-03T11:08:38Z","snapshot_observed_at":"2026-07-06T15:37:31.493443Z","submitted_at":"2023-06-03T11:08:38Z","title":"Efficient Text-Guided 3D-Aware Portrait Generation with Score Distillation Sampling on Distribution","version":1},"cited_work":{"arxiv_id":"2306.02083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02083","snapshot_observed_at":"2026-08-07T00:31:08.341451Z","title":"Efficient Text-Guided 3D-Aware Portrait Generation with Score Distillation Sampling on Distribution","venue":"cs.CV","work_id":"cbd73afe-e270-48c0-99fb-d8df436554f0","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.921887Z"},"links":{"cited_paper":"/paper/2306.02083","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d71a6a659d95104342d5b4632565fa85f4ba90ab077f964a51a3fa82dee154e3","observation_id":"0658603d-2022-4351-8dae-9c5b743717c6","resolution":{"observed_at":"2026-08-07T00:31:08.345738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07971","last_updated":"2024-10-10T14:29:00Z","snapshot_observed_at":"2026-07-06T19:31:13.821669Z","submitted_at":"2024-10-10T14:29:00Z","title":"Generalizable and Animatable Gaussian Head Avatar","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07971","snapshot_observed_at":"2026-08-07T00:31:07.926317Z","title":"Generalizable and animatable gaussian head avatar.arXiv preprint arXiv:2410.07971, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.926317Z"},"links":{"cited_paper":"/paper/2410.07971","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:32326cfbba8c05c839d18e56fcb7ca828dd545289b1459469a84a6ed2515afb6","observation_id":"7f4c8178-9253-419a-8611-114b9894bb22","resolution":{"observed_at":"2026-08-07T00:31:07.926317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.857245Z","title":"Gen- erative adversarial networks: An overview.IEEE signal processing magazine, 35(1):53–65, 2018","venue":null,"work_id":"20d79d24-6863-434b-8ab1-63a257e2c9c8","year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.931478Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e637f9e4de068124672cea1197570e3a2becbef74a4aeeaf5a0c94631966126a","observation_id":"b433735a-71aa-4617-84cf-1f5cb4b6179e","resolution":{"observed_at":"2026-08-07T00:31:08.862171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.845333Z","title":"Cogview: Mastering text-to-image generation via transformers.Advances in Neural Information Processing Systems, 34:19822–19835, 2021","venue":null,"work_id":"44726c74-5a96-4276-8912-da56277bbf4b","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.935502Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d085950c0b732cfb176a9c2355d7364247ecbb5f0888a67412203c74ebce214f","observation_id":"86fc0d01-1ae1-420b-b519-1d0a7d9e4b19","resolution":{"observed_at":"2026-08-07T00:31:08.849292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.833124Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers.Advances in Neural Information Processing Systems, 35:16890–16902, 2022","venue":null,"work_id":"3bccbb5d-65a8-40bf-9e3a-0c603fa2ba6c","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.939875Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:7d882091d3ecef5b34ddaeed1d24b80c44cd1bbcd2a800eeb3738919c2e03016","observation_id":"53ea7cbf-1b06-482c-b969-82bc5854778a","resolution":{"observed_at":"2026-08-07T00:31:08.837144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.820739Z","title":"Semantic image synthesis via adversarial learning","venue":null,"work_id":"60f99ec7-769d-499d-8b02-464b5d684cb7","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.944122Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:a2bd6e0daa29119c6bc1e2d134456f51fa73303942fdaf31fd430f3cf77a485d","observation_id":"88001989-687a-45ae-9954-4b9776ae0453","resolution":{"observed_at":"2026-08-07T00:31:08.825624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.807862Z","title":"Imagebart: Bidirectional context with multinomial diffusion for autoregressive image synthesis.Advances in neural information processing systems, 34:3518–3532, 2021","venue":null,"work_id":"4e2dbd38-651a-473a-b114-6080bdbfb391","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.947588Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e1a245a3ef85da4fd79484461df65d7aa24385054f936144a85284dc2c6e8bd7","observation_id":"9ce23194-ef2d-434c-af26-a5a448a2fce7","resolution":{"observed_at":"2026-08-07T00:31:08.812341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.796124Z","title":"Black, and Timo Bolkart","venue":null,"work_id":"870bef70-d332-4154-be0c-a18e30d27c53","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.951370Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:083950a0390b94456e832a36dfbe99d155326e9a2bfa83aaf3ebed7d8a262cd6","observation_id":"2974ba24-a5c5-44a1-a96f-4e184953b605","resolution":{"observed_at":"2026-08-07T00:31:08.799938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.785137Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":"4d2d8ecd-65cd-4494-9b66-cf17266a8841","year":2014},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.954592Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:426ab91ff40184233c0c3e4b9d483a614a831a5c87ca47db7c99d315af9e9d9e","observation_id":"d2c986d5-db8e-4ecb-8199-9fb53d6fa1dc","resolution":{"observed_at":"2026-08-07T00:31:08.788960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.772647Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"822685fb-e587-4a26-b316-651d2023a639","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.958861Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:6357963c052bb52abbee03f758083f745dfa816b81e99ed53b0a35064463c778","observation_id":"ffe053af-9ceb-4890-b3b8-97d97d978c03","resolution":{"observed_at":"2026-08-07T00:31:08.777099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.759584Z","title":"Denoising diffu- sion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"03e825af-e8f2-4006-b93d-868bc88aa311","year":2020},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.962580Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:a3a669df221401e00abf6d72d8d1586ca28b320280ee8097d0748c6345a55372","observation_id":"a7c2aaa2-f6c5-42f9-8adc-2dfc1ae1a485","resolution":{"observed_at":"2026-08-07T00:31:08.763621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.748656Z","title":"Removing the quality tax in controllable face gener- ation","venue":null,"work_id":"58049811-c0f3-4355-b8ee-a2b1ee6c0c61","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.966318Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:62c4cc39aa6c1e61c3ec73eaaaf6a1dd017528a9f6e6f840519932cbe7f2b302","observation_id":"0241f0a9-ca3a-4eeb-8a02-2e28c7d011f0","resolution":{"observed_at":"2026-08-07T00:31:08.752237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02968","last_updated":"2024-11-15T03:28:16Z","snapshot_observed_at":"2026-08-04T20:32:48.167843Z","submitted_at":"2024-06-05T05:52:20Z","title":"GSGAN: Adversarial Learning for Hierarchical Generation of 3D Gaussian Splats","version":2},"cited_work":{"arxiv_id":"2406.02968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02968","snapshot_observed_at":"2026-08-07T00:31:08.314379Z","title":"GSGAN: Adversarial Learning for Hierarchical Generation of 3D Gaussian Splats","venue":"cs.CV","work_id":"cabe2966-b097-4405-b9c9-bfab7bf4169d","year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.971098Z"},"links":{"cited_paper":"/paper/2406.02968","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:1d2706453821cd4cc033192bb8fc19b7aa235063ecf98af269e105c3bf028231","observation_id":"74915187-9c66-4ddf-a0cb-fa4e1a59dd6e","resolution":{"observed_at":"2026-08-07T00:31:08.319241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12922","last_updated":"2021-09-27T10:11:35Z","snapshot_observed_at":"2026-08-02T12:05:50.267956Z","submitted_at":"2021-09-27T10:11:35Z","title":"ClipMatrix: Text-controlled Creation of 3D Textured Meshes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12922","snapshot_observed_at":"2026-08-07T00:31:07.975824Z","title":"Clipmatrix: Text-controlled creation of 3d textured meshes.arXiv preprint arXiv:2109.12922, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.975824Z"},"links":{"cited_paper":"/paper/2109.12922","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:ab50362ee21efc38353a75531ae66d21bdbda3aaae8b656f085ff612e1a9b1e9","observation_id":"880bfad9-a36c-43dc-90ad-c07c88529523","resolution":{"observed_at":"2026-08-07T00:31:07.975824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.734913Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"afc18226-053f-4fa7-86d6-c45119c2bba8","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.980228Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:fca3eadd3aa21f68eae947b7625fc5051840bd6c6a3ebeb611fe1c088bd4271f","observation_id":"3f66b315-86c1-4ce8-b2db-ff6ced427dae","resolution":{"observed_at":"2026-08-07T00:31:08.739919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.721612Z","title":"Analyzing and improv- ing the image quality of stylegan","venue":null,"work_id":"31a323e0-8998-4020-be94-12ef3e651294","year":2020},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.983506Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:3704f146ae8942e3afb5c4dfa9eb461d9c0fc2fb01297b8dbf52881258eb6c07","observation_id":"7cbadd74-90ea-40f3-8ee9-680ead2a340f","resolution":{"observed_at":"2026-08-07T00:31:08.726573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09377","last_updated":"2024-09-24T14:48:19Z","snapshot_observed_at":"2026-08-05T20:07:41.739336Z","submitted_at":"2024-06-13T17:54:38Z","title":"GGHead: Fast and Generalizable 3D Gaussian Heads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09377","snapshot_observed_at":"2026-08-07T00:31:07.987075Z","title":"Gghead: Fast and gener- alizable 3d gaussian heads.arXiv preprint arXiv:2406.09377,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.987075Z"},"links":{"cited_paper":"/paper/2406.09377","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:6387b99bf76bc7de160149913e72ae8fb769efc11db987e1c6b4f0eada4f98cc","observation_id":"befcd4f9-07ef-44d1-8eff-5413d8aaf0d3","resolution":{"observed_at":"2026-08-07T00:31:07.987075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.706997Z","title":"Gaus- sian3diff: 3d gaussian diffusion for 3d full head synthesis and editing","venue":null,"work_id":"76f5c138-7a4a-42c7-a428-c3d1734e2a2f","year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.991026Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:f4fc1a08b69ac6deab371b90025626cdb0b5d3ae3ff749a82a43bec2fdfd0093","observation_id":"44bd85d5-84b6-4b1d-8c60-4ca0ea6135b8","resolution":{"observed_at":"2026-08-07T00:31:08.712770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.691741Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"091bda70-40da-4a04-9b68-8591535ceb14","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.994745Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d54a2bd196adbd0a93770276668b16130dd48f73da296fc233e03215983cda4a","observation_id":"19d0e1e1-2a9a-4b14-a6cd-102b4858f22d","resolution":{"observed_at":"2026-08-07T00:31:08.696917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.678402Z","title":"Controllable text-to-image generation.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"ea481b45-7e2a-496e-a11a-ee927ca72639","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.998351Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:4cd5984dbd0cd45d0c95a1c88329c3c13dba6b9c24290d3756745acb6488105e","observation_id":"efe04c76-1438-4092-9792-aeac5f121e48","resolution":{"observed_at":"2026-08-07T00:31:08.682714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.663816Z","title":null,"venue":null,"work_id":"a775d7bf-08ce-4fb7-9c82-c900d5296985","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.002098Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:cc24c4a757a470bc957ecea450150e3735fd39eff1d7fe001c59b4a5a84c37e1","observation_id":"c91da531-567f-4987-9d93-521c96403568","resolution":{"observed_at":"2026-08-07T00:31:08.669685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.650321Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems, 35:17612–17625, 2022","venue":null,"work_id":"452f1be0-eb42-4359-926a-7bc745f936d7","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.006665Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:6d8d6428f375775e0283a383a47145d15feb1d98f8492ea7b4f3237a6c1d1900","observation_id":"16653aef-0c9f-43ae-a81a-624c66a64664","resolution":{"observed_at":"2026-08-07T00:31:08.655069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.011103Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.011103Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:6fb092ebbf456dd7fbba2fdba8b2ed34f9ffd412b778ff6d536152337d6fa5a8","observation_id":"9f5d5daa-5666-4899-8ce2-de44176ffab5","resolution":{"observed_at":"2026-08-07T00:31:08.011103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.014647Z","title":"Which training methods for gans do actually converge? In International conference on machine learning, pages 3481–","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.014647Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:c897bcc22f10249af5a2fadc7757e0689b3efd3897a9d25e11886e670e53102c","observation_id":"ed161552-764b-494d-aee3-1dfca435fe4b","resolution":{"observed_at":"2026-08-07T00:31:08.014647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.621342Z","title":"Text2mesh: Text-driven neural stylization for meshes","venue":null,"work_id":"c3ab5e59-65ae-4c62-9a50-b7e0f9a195c1","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.018446Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e7078b010151288596b66b4fb88ebad0eeff56320f4e808e10759ed610fd1ea5","observation_id":"55ba6465-0819-453d-beb0-c4fa7e1ac671","resolution":{"observed_at":"2026-08-07T00:31:08.625751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.609360Z","title":"Text2facegan: Face generation from fine grained textual de- scriptions","venue":null,"work_id":"2e20c7bb-0c15-45a8-a4aa-1f246baa7428","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.022978Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d3f546f35fe3d066aa88439119147eb05ea51637ca9cfe5627dd207e2a90e41f","observation_id":"cdecfc0c-bb8f-40f3-b823-f10f2e6dd514","resolution":{"observed_at":"2026-08-07T00:31:08.613241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T00:31:08.027014Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.027014Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:98baf8791cf62935eab9c252f665822c6c963c7fccdf4362792ad44ea9196d3a","observation_id":"fb625bde-e6e2-4a41-a5ba-cd2506121b33","resolution":{"observed_at":"2026-08-07T00:31:08.027014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:31:08.031156Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.031156Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:3008a9ed4b34fc5ae5478d3dc11fd9e0af5a3010b88afdaadf8a36b1ef996bdf","observation_id":"9696588e-eb09-44ed-8acb-ca15bb5c0a41","resolution":{"observed_at":"2026-08-07T00:31:08.031156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.596930Z","title":"Paysan, R","venue":null,"work_id":"ca56286b-4d45-44e7-8f87-27c47fd972a6","year":2009},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.035456Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:9551d6e5aa51bc3b4d339f22df6624265a0673acdbe3814fa324e5b22a740df8","observation_id":"d3ce2d11-3fdd-40d2-a298-91c524589def","resolution":{"observed_at":"2026-08-07T00:31:08.601451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.584671Z","title":"Towards open-ended text-to-face generation, combination and manipulation","venue":null,"work_id":"8aa26875-4753-48a4-b979-8d30f76fe24e","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.040150Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:07f2fad9117fe47c712acc5100144dd94c960e01a31c8cf15301b827839c0260","observation_id":"a71babae-a84b-464d-be3e-6d794c104e67","resolution":{"observed_at":"2026-08-07T00:31:08.589174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.044522Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.044522Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d06754566b1b97712ab014374ed4fb8e1f7a90f13abb9db3d3fef484be898562","observation_id":"a3fc27ad-1fec-4a4a-9a2d-25e40644444d","resolution":{"observed_at":"2026-08-07T00:31:08.044522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.565903Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"399534bf-bcd4-4eb9-8d1f-4d26e78eeaa2","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.048293Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:a656a160d1000108be93da21f9f3e3b65060cabe89ddc77cd55e85e913d70c35","observation_id":"213a317a-79b8-4bae-8e43-e9043f6835df","resolution":{"observed_at":"2026-08-07T00:31:08.569754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T00:31:08.052495Z","title":"Hierarchical text-conditional image genera- tion with clip latents.arXiv preprint arXiv:2204.06125, 1(2): 3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.052495Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:b6a8003bd5acbe288f89a95aa6e0a7b7ca2fad94d6e70b88d06e86686e23c330","observation_id":"26366c0e-fb3a-495b-b58e-64addc435256","resolution":{"observed_at":"2026-08-07T00:31:08.052495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.553397Z","title":"Generative adver- sarial text to image synthesis","venue":null,"work_id":"9d036fbe-5e03-47f5-a80c-287e5a080aec","year":2016},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.057191Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:2a0f0cff056d962facc3699ba499dc6d153def2da35fa49573e06c41349ccf85","observation_id":"d42417b0-85cb-4b41-a860-62d8c34b4897","resolution":{"observed_at":"2026-08-07T00:31:08.558408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.540449Z","title":"Higher order contractive auto-encoder","venue":null,"work_id":"cba056e7-067a-4a13-b421-339efaab069b","year":2011},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.061800Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:770c8deb218c6cca52ce90a908ff818a98d3aacddd819b46f83eb1ce7ddba179","observation_id":"dd772fa9-2bd6-44fd-a59d-bae03601436c","resolution":{"observed_at":"2026-08-07T00:31:08.545188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.527038Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"7ae86429-1277-4d3e-8fec-5c387a116937","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.065870Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:7e95ba1d95a50ec2c97e3d0f9c26a03c6f10c2eb460a918ecbd61c66052873fc","observation_id":"c335105b-d031-4d89-a0ec-55b35709bc41","resolution":{"observed_at":"2026-08-07T00:31:08.532044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.515350Z","title":"Pho- torealistic text-to-image diffusion models with deep language understanding.Advances in Neural Information Processing Systems, 35:36479–36494, 2022","venue":null,"work_id":"c0c25d81-e159-4b52-a768-b37085c196b2","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.069695Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:2409d76e0fbe307c165b4bb6a7af865364a51697622e62588543124c25f8cdfc","observation_id":"d27c33ae-10cc-4752-86d2-2e213eeeb127","resolution":{"observed_at":"2026-08-07T00:31:08.519580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04909","last_updated":"2020-05-11T08:05:00Z","snapshot_observed_at":"2026-07-06T09:19:14.291342Z","submitted_at":"2020-05-11T08:05:00Z","title":"Conditional Image Generation and Manipulation for User-Specified Content","version":1},"cited_work":{"arxiv_id":"2005.04909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.04909","snapshot_observed_at":"2026-08-07T00:31:08.246595Z","title":"Conditional Image Generation and Manipulation for User-Specified Content","venue":"cs.CV","work_id":"dd6476ad-4dff-4c0f-8530-6dbd430b38c5","year":2020},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.073737Z"},"links":{"cited_paper":"/paper/2005.04909","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:80118bcc02a729bd9096cd31c1dcaa9eb67e913cd6ff64790d7b6d77df7712d9","observation_id":"7100a072-63c4-41a3-ba65-2e7a0008653f","resolution":{"observed_at":"2026-08-07T00:31:08.251257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.504045Z","title":"Multi-caption text-to-face synthesis: Dataset and algo- rithm","venue":null,"work_id":"8a281940-50d6-48b0-81db-5a98253f9de6","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.077667Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:c34a0d94c0a8782bdd9c7abaf27cd2ced7232b37eadbb4e8b95a43b0d4050575","observation_id":"0cbec195-ad96-4239-913f-17d8ca92bb32","resolution":{"observed_at":"2026-08-07T00:31:08.507844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05865","last_updated":"2022-10-15T03:51:50Z","snapshot_observed_at":"2026-07-06T09:46:54.764203Z","submitted_at":"2020-08-13T12:51:17Z","title":"DF-GAN: A Simple and Effective Baseline for Text-to-Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05865","snapshot_observed_at":"2026-08-07T00:31:08.080980Z","title":"Df-gan: Deep fusion generative adver- sarial networks for text-to-image synthesis.arXiv preprint arXiv:2008.05865, 2(6), 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.080980Z"},"links":{"cited_paper":"/paper/2008.05865","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:b56c845f746b1b2daf1ba5bb23da4a0c70bfe9bde0f89942d41581c06dd3895e","observation_id":"e8b7e879-7c43-44d6-9366-f1341cbc5b15","resolution":{"observed_at":"2026-08-07T00:31:08.080980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.492746Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"dbd2e90d-00fa-4bcf-ad46-bf1f4d6a814a","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.085430Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:9d93f196f3d141970ab3dd028f047ccef2b73535a531731b829c1b465fd76d44","observation_id":"7059f785-b9ca-4257-893d-c43652b03ed4","resolution":{"observed_at":"2026-08-07T00:31:08.496591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.481283Z","title":"Faces a la carte: Text-to-face generation via attribute disentanglement","venue":null,"work_id":"5158a384-bd91-47a1-b84c-a79643a04cc3","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.089341Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:376f8f7175928a53a051e75c84a12be43d20193664f25942a6ce08e5df83b517","observation_id":"dbd661aa-31c7-4aa9-b57d-72a9b2714125","resolution":{"observed_at":"2026-08-07T00:31:08.485757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.468040Z","title":"High-fidelity 3d face genera- tion from natural language descriptions","venue":null,"work_id":"cc698406-6896-4347-b9dd-55390d982124","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.093446Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:60c8ef2c66b6c2c6242e2533bfd98a2af90d3f3a031c8133d1b728df3456fb38","observation_id":"c9486153-9104-45a6-a460-1bafc4d19fc0","resolution":{"observed_at":"2026-08-07T00:31:08.473247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.097334Z","title":"Tedigan: Text-guided diverse face image generation and ma- nipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.097334Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:a40ad7a1f6003c52175a24f9af4d845d08df71f25f420f278ca665a7d4f311f4","observation_id":"3950c2f3-7091-40ea-bc7f-7c152449f2a1","resolution":{"observed_at":"2026-08-07T00:31:08.097334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.448911Z","title":"Omniavatar: Geometry-guided controllable 3d head syn- thesis","venue":null,"work_id":"3605f20d-6460-4ef4-811c-53b0dcac7c7b","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.101556Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:2c62365d12c2db3e3c8c396858bc4eea486c04c968498f0060a6d064ad483db0","observation_id":"fb10680f-332b-4266-b744-b0518f0a5121","resolution":{"observed_at":"2026-08-07T00:31:08.453055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.436673Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"cb35d32a-b1a3-416b-9c92-d9184fba446e","year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.105439Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:95c52ec5cca37429cdb6072ed3b21191b3d17c1ae8a93f8b57378af8518b3138","observation_id":"0c14bdda-ff54-4a71-a0c6-dac0b2c93233","resolution":{"observed_at":"2026-08-07T00:31:08.441227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.423417Z","title":"Towards high-fidelity text-guided 3d face genera- tion and manipulation using only images","venue":null,"work_id":"94cf9255-9589-4a42-b569-600f996b744c","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.110294Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:8af45bcf9050487573b0863cac1b47c47dfb2b6d618cd9170638e52261bfa6a6","observation_id":"d43cd068-0b1e-4ce4-ad49-1798121f3570","resolution":{"observed_at":"2026-08-07T00:31:08.427768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T00:31:08.113817Z","title":"Scaling autoregressive mod- els for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.113817Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:a3ba0985321162453a535441fcb532b3feca3ad459d907a2e1607d2e8c48705d","observation_id":"e979a7b2-90d9-4ec4-8946-4ae5a8d52129","resolution":{"observed_at":"2026-08-07T00:31:08.113817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.411144Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"7e3e0f6f-4e5a-4e18-8397-74324f129a48","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.117732Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:448f588cb420100f2d6a607b7c9d195b7a31c10fa704138bfb4239c410bb356b","observation_id":"8893a9f8-19ac-4385-9cb5-284c1d8f5228","resolution":{"observed_at":"2026-08-07T00:31:08.415061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.398830Z","title":"Stack- gan++: Realistic image synthesis with stacked generative adversarial networks.IEEE transactions on pattern analysis and machine intelligence, 41(8):1947–1962, 2018","venue":null,"work_id":"fa3dd35e-a3e3-4f29-baa8-7e979f29e7b9","year":1947},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.121195Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:4c660845a2bf419b9e02de79ecc2455bb93081c234f8cdce22a7fba41d15571e","observation_id":"30d6e647-65ee-4e1d-88ea-2f4c1f240ebd","resolution":{"observed_at":"2026-08-07T00:31:08.403186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03117","last_updated":"2023-04-01T07:22:55Z","snapshot_observed_at":"2026-08-04T04:04:54.771930Z","submitted_at":"2023-04-01T07:22:55Z","title":"DreamFace: Progressive Generation of Animatable 3D Faces under Text Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03117","snapshot_observed_at":"2026-08-07T00:31:08.125192Z","title":"Dreamface: Progressive generation of animatable 3d faces under text guidance.arXiv preprint arXiv:2304.03117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.125192Z"},"links":{"cited_paper":"/paper/2304.03117","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d1ae5bc8ea87e125e46568aecb62816bcee3160f3e9a6214aabe5ba2a798fc64","observation_id":"7c4839b6-b5d2-44ce-b479-1494bdf7799b","resolution":{"observed_at":"2026-08-07T00:31:08.125192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14211","last_updated":"2022-02-19T17:12:14Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T04:42:07Z","title":"M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers","version":4},"cited_work":{"arxiv_id":"2105.14211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14211","snapshot_observed_at":"2026-08-07T00:31:08.199245Z","title":"M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers","venue":"cs.CV","work_id":"da40271d-a4b5-462b-aea1-57c1e5154876","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.128900Z"},"links":{"cited_paper":"/paper/2105.14211","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:1e597af7a859ee843a6f358446237774187bb0ca4e467f0d2feaf190e253b9f2","observation_id":"426d1768-4ea8-4558-9641-85788ae17f1b","resolution":{"observed_at":"2026-08-07T00:31:08.203740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19657","last_updated":"2024-10-30T03:34:49Z","snapshot_observed_at":"2026-08-05T01:18:39.766048Z","submitted_at":"2024-10-25T16:08:08Z","title":"DiffGS: Functional Gaussian Splatting Diffusion","version":2},"cited_work":{"arxiv_id":"2410.19657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19657","snapshot_observed_at":"2026-08-07T00:31:08.178107Z","title":"DiffGS: Functional Gaussian Splatting Diffusion","venue":"cs.CV","work_id":"402f1b09-0ef5-4d3c-aaeb-a4c5745d04b6","year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.132902Z"},"links":{"cited_paper":"/paper/2410.19657","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:f70f683554db8b0c878126894e86fb1c84286d41f4306cf276c3b9b08c86c224","observation_id":"334e4b03-11e9-4b82-ba61-618f27db6aa0","resolution":{"observed_at":"2026-08-07T00:31:08.184971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.386367Z","title":"Generative adversarial network for text-to-face synthesis and manipulation","venue":null,"work_id":"244cb3e6-e467-416d-8070-513c40599b49","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.136966Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:ff131a7113b0b5d146deea66c445b943bc070193390f291ecaa0df749969ca1f","observation_id":"2cc47fac-b3db-41f9-b79e-1a1fd9f57f64","resolution":{"observed_at":"2026-08-07T00:31:08.390930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.374424Z","title":"Generative adversar- ial network for text-to-face synthesis and manipulation with pretrained bert model","venue":null,"work_id":"5e087b95-aa8e-4077-af1c-3d60cbd6db90","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.141082Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:0d5d34178a06415a672db290dd170fc5eff58543f2a1a60af2fbfeb699ba5dd1","observation_id":"0881f328-e6c4-419e-bf31-7a9eaa0d5516","resolution":{"observed_at":"2026-08-07T00:31:08.379003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.363595Z","title":"blonde”, “blue eyes","venue":null,"work_id":"9a06b008-b132-4823-87cf-e898f17f1771","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.145034Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e0ab38a1181a4f417c848d2f5893ad7661beb9d97a318b0445f8f1daba9d3663","observation_id":"3f82aeca-0e7a-4eb1-86bc-93ebdcf242c7","resolution":{"observed_at":"2026-08-07T00:31:08.367112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:22:28.924756Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":41},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.14015."}