{"as_of":"2026-08-12T03:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f12374a0b2c5b3ae4641542d35eaf83d3143102a975fb3e72793aff1f92cf1b","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:41:29.077181Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:28:08.979140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:28:16.885560Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2501.12910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12910","snapshot_observed_at":"2026-08-07T13:28:16.885560Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","venue":"cs.CV","work_id":"4dabaaaa-30f4-4971-ba0a-0ddf479decd5","year":2025},"citing_paper":{"arxiv_id":"2505.21876","last_updated":"2026-05-28T08:11:37Z","snapshot_observed_at":"2026-08-07T13:18:12.902974Z","submitted_at":"2025-05-28T01:45:26Z","title":"EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:08.979140Z"},"links":{"cited_paper":"/paper/2501.12910","citing_paper":"/paper/2505.21876"},"observation_digest":"sha256:282f4c4b5c3f3110361c66a5d74bbaaa5421411a804836737429efd6e16e8a8f","observation_id":"ed665f5c-5629-47f7-b689-c053aef19e75","resolution":{"observed_at":"2026-08-07T13:28:17.000375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12910/citation-record","integrity":"/paper/2501.12910/integrity","json":"/paper/2501.12910/citation-record.json","paper":"/paper/2501.12910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.792685Z","title":"360cities dataset","venue":null,"work_id":"ba8d5402-6f92-45f5-8a85-fab049a0f994","year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.589292Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:27db1a71497814baebb07b159419899bf3f579ee8bd649c3798fb0dd811304f8","observation_id":"96a5ad38-0a75-4709-9e06-a60eac1779f1","resolution":{"observed_at":"2026-08-10T16:41:30.800080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.767931Z","title":null,"venue":null,"work_id":"35b28a89-b06c-4414-9d70-08886d616d34","year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.596758Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:12603fde1b04a2ed860944d24d307bffc1e84e1c9a40a5b27836e6f32de270e4","observation_id":"5235a997-0f8c-4d0a-9773-ea0e40b7038e","resolution":{"observed_at":"2026-08-10T16:41:30.775886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-10T16:41:28.604530Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.604530Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:7d9d4e5697a71ac4d0ac6a383401c6cd93d92ae1b5b81ff122a13351e32c7658","observation_id":"bb71e5e0-b985-4f99-97dc-95255654326e","resolution":{"observed_at":"2026-08-10T16:41:28.604530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:28.610631Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.610631Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:950034e95499ed4fa61501e6f0ec396f7dbc17afb517657a0f20359960be40ed","observation_id":"c7da89be-346b-4372-bed7-42b23fc87874","resolution":{"observed_at":"2026-08-10T16:41:28.610631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.729931Z","title":"A unifying geometric representation for cen- tral projection systems","venue":null,"work_id":"40231f34-9067-441c-b10e-ccf72253dbab","year":2006},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.616329Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:80dba5e13644b075fc0df1d99baed1dd4d7811b04b4bbe4a8c1543e60d992e3f","observation_id":"9a0b4937-d7bd-410f-a229-e450a096a40e","resolution":{"observed_at":"2026-08-10T16:41:30.736137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.698032Z","title":"Loosec- ontrol: Lifting controlnet for generalized depth conditioning","venue":null,"work_id":"c1f8cf6e-c93b-489f-876d-8fcfeaf35fe8","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.624255Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:8eb93c561597b2501b86359e0b2e239d0859ac0b77e298c14cc2c7566a2c5a56","observation_id":"4f9c93bf-2db8-42a9-9a0a-c36dd525ae75","resolution":{"observed_at":"2026-08-10T16:41:30.707383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T16:41:28.636232Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.636232Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:d16feb0d21ad1d9423ac69b0c9c2233e622da5bff238e3f90af6781b22ff2960","observation_id":"d90c3b6b-734c-4dba-8fba-0159aa4d52b1","resolution":{"observed_at":"2026-08-10T16:41:28.636232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.667968Z","title":"Deepcalib: a deep learning approach for automatic intrinsic calibration of wide field-of-view cam- eras","venue":null,"work_id":"665769e7-f2ac-4d5c-bc2e-8f6b35bd22ce","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.647408Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:0d447b1c3c6b3a77acec91f9a4ffc5b752a4865b1f6e652a5ebff42d219c5921","observation_id":"1a3b2f52-35ff-42e3-8683-1315f86869d4","resolution":{"observed_at":"2026-08-10T16:41:30.680957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.635485Z","title":"Photographic image syn- thesis with cascaded refinement networks","venue":null,"work_id":"ccbd538a-4d37-4d06-ae05-1033dea88a24","year":2017},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.655202Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:9af4b58c867d1121e18962d4ba1335e3c183931252b73cd49b1742ea13b1da11","observation_id":"9916102c-c8d1-4925-a988-9cdf4fb6953c","resolution":{"observed_at":"2026-08-10T16:41:30.644481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.599095Z","title":"Sketch2photo: Internet image montage","venue":null,"work_id":"99c75d63-434f-4f6c-bfae-dc522cbfa1b3","year":2009},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.672536Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:df0d690a740f31849af53acdb918f627b95750b4c290c37cb2ffd7c46b13c9ea","observation_id":"62635136-6bdd-41ad-b3e8-63e99a83237c","resolution":{"observed_at":"2026-08-10T16:41:30.608922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.564765Z","title":"Learning continuous 3D words for text-to- image generation","venue":null,"work_id":"ee581392-be80-4855-8e4d-7958c9702574","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.679672Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:17151aac23f5b28a24f4d9e6ceccdd89b5a81556e2ed5f99460a2d35e4b89d1f","observation_id":"22bddeab-76d1-4d75-a7c4-7c4fd8d20ae8","resolution":{"observed_at":"2026-08-10T16:41:30.580051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.525076Z","title":"Zero-shot spatial layout conditioning for text-to-image diffusion models","venue":null,"work_id":"c8ac0159-1f8d-4eee-85b3-5616a105e1bc","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.687691Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:83496d3a78eeff1dc05264e672a728a0530a23c49cc1169c9de56b802a65f28f","observation_id":"e781210d-cef0-416e-b8bb-6dd104e13486","resolution":{"observed_at":"2026-08-10T16:41:30.536375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.501404Z","title":"Efros and William T","venue":null,"work_id":"ee472271-bf91-407b-bd6d-a8ddc9f49053","year":2001},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.696126Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:a5ab8cdd976ca52aa0ab1402702ceb710445c6a8c0f45728b62a0203922ed9b3","observation_id":"5dc3779c-9017-41e1-8300-82f2f377b1b8","resolution":{"observed_at":"2026-08-10T16:41:30.508562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.478717Z","title":"Efros and Thomas K","venue":null,"work_id":"ed11ee85-2814-43ca-936e-c857f49c54a0","year":1999},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.705022Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:825674250de9fe1be5859800c76efc84916b8d5721231a1dc62e3ff3803e8a64","observation_id":"8f42dfc4-32a5-4107-a0fe-2dc321b0a904","resolution":{"observed_at":"2026-08-10T16:41:30.484140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.450633Z","title":"Photosketch: A sketch based image query and compositing system","venue":null,"work_id":"ba06f377-7541-4fa2-8879-d22e4702d1c8","year":2009},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.714008Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:1051cc8d75963f4a491f96bdbe920e1cb8a3c2b44815adf139a371533c94b2f2","observation_id":"2daa9538-34f5-4d52-ae45-2db230da5fd0","resolution":{"observed_at":"2026-08-10T16:41:30.456635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.418666Z","title":"Diffusion self-guidance for control- lable image generation","venue":null,"work_id":"7055a6c0-2dc7-415f-aa7c-c9185e5efdca","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.719882Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:26e5702208eeeaae9db81b556ae4790afe238e549b1a6ee75e9355fb380e4c73","observation_id":"641ebf6f-06f4-44b6-9d12-c8c2e7ea6224","resolution":{"observed_at":"2026-08-10T16:41:30.426499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:28.732251Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.732251Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:ba014da85e7ab365bcdea30bad1894d138c9d3b61c7f7129a718b6f2d95375d4","observation_id":"86b3454f-1814-4096-a736-e6d4797e2ca5","resolution":{"observed_at":"2026-08-10T16:41:28.732251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.361838Z","title":"HDRIs dataset","venue":null,"work_id":"023c5d74-49b9-4e35-95d9-5cf992f61cc5","year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.741904Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:16fef679b517dfed8e261adf82430dd54d4902174bf16c8f5d411bea6a00a7d9","observation_id":"e4eb0624-9102-45ac-ab00-778502649670","resolution":{"observed_at":"2026-08-10T16:41:30.372811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.325319Z","title":"Scene completion using millions of photographs","venue":null,"work_id":"30e3fc7b-7f14-4136-8e31-e688c3c8efe0","year":2007},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.747346Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f24bd4e3d390039adb0174d9c37a3ab40c4c9caa14c6a822d7ae221317fc4984","observation_id":"d5d20306-e686-45cd-9746-e8e9b496f9f5","resolution":{"observed_at":"2026-08-10T16:41:30.338601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-12T01:27:32.593496Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T16:41:28.752581Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.752581Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f038d1122ce3b78e1dbe272423d46436de686a676cdf2b9c99a4988216235c25","observation_id":"e42aa40f-531b-4deb-82ff-3dbc3ced8eea","resolution":{"observed_at":"2026-08-10T16:41:28.752581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.298928Z","title":"Image analogies","venue":null,"work_id":"a8b74538-cf9e-491d-b5f8-b774cce94936","year":2001},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.758917Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:882c199fe4c4e003c3c62061184dfdc8e2d9421732aedcaec32906e5fb9dae8a","observation_id":"2b453be9-ad9b-4c7c-bf0b-39917cf676f9","resolution":{"observed_at":"2026-08-10T16:41:30.306918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T16:41:28.766742Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.766742Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:1a78530215ed28a7712d0d69c7d5fe5b89d74ff427e9ca627b00232885696d8c","observation_id":"a56ee277-5a17-438f-97f0-9b9b8a7e1783","resolution":{"observed_at":"2026-08-10T16:41:28.766742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:28.775725Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.775725Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:090531430a0276c3a17096cc9a456323529d642ab123cdcc7aa1d5e36a66e2df","observation_id":"e633258d-2468-4674-b6eb-0ec7a971c41f","resolution":{"observed_at":"2026-08-10T16:41:28.775725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.238049Z","title":"Perspective fields for single image camera calibration","venue":null,"work_id":"71354fa7-8ab0-416a-a6d5-12e758d7d652","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.782469Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:1a19ad3702ef0c54fa73ee5f9251df93e5d054cdc608c186135c97999a3dabe3","observation_id":"3d02ccdf-0ac7-4097-9dcd-fad827214e19","resolution":{"observed_at":"2026-08-10T16:41:30.253017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.200181Z","title":"Semantic photo synthesis","venue":null,"work_id":"c1c1cdad-01eb-4bdf-9611-df9405ac4b3a","year":2006},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.792549Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:4ded717b810b8ea7702af71835abdb8b570faca3b61cc13c0d748f4ccbe7912f","observation_id":"7ee08c95-de46-4523-bdaa-d58f08602bce","resolution":{"observed_at":"2026-08-10T16:41:30.208878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.159543Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"6e253bb2-0c78-4804-8885-73146f1fed34","year":2014},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.799606Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:e0e8e1467bbce33caca73329093ccdf58768e8d70207a9a52655b0c5315357b6","observation_id":"850f9c5b-49cd-4f4a-b225-1a2b52a03186","resolution":{"observed_at":"2026-08-10T16:41:30.169814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12333","last_updated":"2024-12-02T21:15:29Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T16:59:51Z","title":"Customizing Text-to-Image Diffusion with Object Viewpoint Control","version":2},"cited_work":{"arxiv_id":"2404.12333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12333","snapshot_observed_at":"2026-08-10T16:41:29.319631Z","title":"Customizing Text-to-Image Diffusion with Object Viewpoint Control","venue":"cs.CV","work_id":"72eaa2e1-8dd7-4494-b597-e3713cc064ed","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.818653Z"},"links":{"cited_paper":"/paper/2404.12333","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:277d367195f2752eaa65e0fe4dfdfd7b823dd01ec6a4bdd0f5e3a29695758828","observation_id":"24187fb1-75a7-4022-b27d-8e8eaef214a4","resolution":{"observed_at":"2026-08-10T16:41:29.332307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.117369Z","title":"Distortion-adaptive salient object detection in 360º omnidi- rectional images","venue":null,"work_id":"6c94d47d-29d6-4288-9cf3-2b118602fcf8","year":2019},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.825541Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:a54ff2da66b13e425be6f36cb2737f7f67c8810a290bfff86faaf329c01be453","observation_id":"d9fde885-6c23-4f9a-ac7b-f64114a89864","resolution":{"observed_at":"2026-08-10T16:41:30.127962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.090098Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"f49bd7be-876d-4d06-b245-36ff858de557","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.833451Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:0e87ada807c108e9815999a93496eb78358d9608a10380be3e1a5c3d12dad720","observation_id":"3af3ca86-6e73-4c8e-bc72-1dab80130a5c","resolution":{"observed_at":"2026-08-10T16:41:30.095488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-11T15:07:58.827504Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-10T16:41:28.839449Z","title":"Ctrl- adapter: An efficient and versatile framework for adapt- ing diverse controls to any diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.839449Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:de6c66a8a540a9abfb0d4d1fccd2322d8adf34de42a2f5ce2e9d09a43eeabd5c","observation_id":"9489f2ae-b299-42d7-9b39-71019c9c3fe6","resolution":{"observed_at":"2026-08-10T16:41:28.839449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.055285Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"9bc799ec-5248-4349-86b2-02f3d32f945f","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.847453Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:7fd7d837922951f979e4b204c7363fbd09e6f2448265ce366b6a2378b0470dbc","observation_id":"83b3f230-d45f-4183-886e-9afe76b53812","resolution":{"observed_at":"2026-08-10T16:41:30.065790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.021963Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"9b341a52-ee90-4538-aba5-7b385d28d98f","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.855417Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:9d8711faa83731c7b65a36815c192bb53eb24e3b4851220f57329529a841fd47","observation_id":"8bd17937-d468-4841-9c5f-2fa68712b442","resolution":{"observed_at":"2026-08-10T16:41:30.033953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.994202Z","title":"Semantic segmentation of outdoor panoramic images","venue":null,"work_id":"b66218cb-bbf6-4eea-8718-fae2b01ba66f","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.863502Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:00cf0b126ea6c1ab5f02611b8c089907369afe2a647a36082618326f4a9dbe74","observation_id":"f20b0bbe-2a51-49c9-bff8-716b754696f8","resolution":{"observed_at":"2026-08-10T16:41:30.001128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.967068Z","title":null,"venue":null,"work_id":"76ee069a-3fdc-474e-9b1f-538026b67882","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.870792Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f85ca41ffa31f0cb4b542948734420d8acedc340388ddb0e468e2c9ee22ec96a","observation_id":"670b9bd7-c649-4974-aa6b-15d0b351eb0d","resolution":{"observed_at":"2026-08-10T16:41:29.975274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.938790Z","title":"Semantic image synthesis with spatially-adaptive nor- malization","venue":null,"work_id":"f8a40275-a6ce-4101-8d9a-ae137dcfe74b","year":2019},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.876118Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:604065f1349fa428e3d91fb8366843b7db2c54211ff260a12ac8572c9289b26d","observation_id":"c84e53cf-f014-4206-9a8c-2f6d18d10fbb","resolution":{"observed_at":"2026-08-10T16:41:29.946367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T16:41:28.881523Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.881523Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:bd61773b32a278aa29491e4ea2fad85f535da8ac06887b9ea40592279a0cd182","observation_id":"730bdf1a-a66d-466a-9bd5-a1c7d4a45673","resolution":{"observed_at":"2026-08-10T16:41:28.881523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.907712Z","title":"Kandinsky: an improved text-to-image syn- thesis with image prior and latent diffusion, 2023","venue":null,"work_id":"83c4c280-3d42-4374-8166-a3f3e6d82e3b","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.890772Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f009235bf1ad8b8aa670150ab54753ff093b874b706d630db50b1327ab81d0da","observation_id":"2079b755-6344-4601-b35f-d6f7bc9b71d5","resolution":{"observed_at":"2026-08-10T16:41:29.917924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.878163Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":"24925879-6cd7-4dcd-b3ed-5ca7a8c12c37","year":2021},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.900577Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:0a4e7565c36ab9351d053ed61fe42c38e82801d020fbb2c233f2fbb5ea948ee6","observation_id":"2d981b71-5973-4770-a2b3-9e8cab297af0","resolution":{"observed_at":"2026-08-10T16:41:29.887135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.853445Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"44b4abac-aa91-4ca0-8c45-75a31af47dca","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.908014Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:0652fab67e9db1e195e945dff2e4d77b08c8d8ba32cebcfc9d83a44e772e5b4e","observation_id":"c3da1fda-f5ba-442d-b7ab-03ccd2b21d6b","resolution":{"observed_at":"2026-08-10T16:41:29.860990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.822133Z","title":"Saliency in VR: How do people explore virtual envi- ronments? IEEE TVCG, 2018","venue":null,"work_id":"f7073f67-ed09-4848-8d7e-3dd56876f2fb","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.916759Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:21a2e8bad241da8f8c8fd54fa08352f4422a85da596dabd8ecb10d897c88406c","observation_id":"a22c34d7-fb3e-4ba9-b5b5-8b9fa3815909","resolution":{"observed_at":"2026-08-10T16:41:29.834654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.790358Z","title":"GeoCalib: Single-image Cali- bration with Geometric Optimization","venue":null,"work_id":"4e5fecb9-019a-4a72-b9c1-a72c2e576bd2","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.923033Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:8b0a6016ad3ed00b8bd5b72a79ab081b706416ad2816e805e61aa39c7cef5634","observation_id":"2c1b5f5f-ff3c-4850-bdf3-26f09ea4a87b","resolution":{"observed_at":"2026-08-10T16:41:29.797494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06601","last_updated":"2018-12-03T15:12:44Z","snapshot_observed_at":"2026-07-06T06:56:30.962909Z","submitted_at":"2018-08-20T17:58:42Z","title":"Video-to-Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06601","snapshot_observed_at":"2026-08-10T16:41:28.941004Z","title":"Video-to- video synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.941004Z"},"links":{"cited_paper":"/paper/1808.06601","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f9bdef197662a6c01f3c2313bca6d0bd5476ce91621af56363b818eeea0c9e93","observation_id":"8d725307-7727-4a0b-8afa-13854baa053b","resolution":{"observed_at":"2026-08-10T16:41:28.941004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.763143Z","title":"High-resolution image syn- thesis and semantic manipulation with conditional gans","venue":null,"work_id":"5f8f7fa1-f63c-4363-ae70-8dbde683bb03","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.955006Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:708797d7b8b010a218ca284e1133e70e1347466c22e2e38b18a9c79bb8d2857d","observation_id":"f11006ec-8e66-4bd3-9eb0-394ed915f73c","resolution":{"observed_at":"2026-08-10T16:41:29.772442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.738359Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"cb454d73-899a-44d1-85d3-4295e4d71e31","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.970101Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f4e8e07ceb67ad09e2124ff41083f4f55102fe4f0b787597efd0fb2dbca0fd33","observation_id":"3ff40146-0aec-4c25-901f-769ccfcd4867","resolution":{"observed_at":"2026-08-10T16:41:29.746969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.708966Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"083934ed-0664-4f7e-beea-ff5ed89493b1","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.981962Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:79ea66b46ed5d0b587eb95ffd73d37678fa3674f70db939ccafbc03ed3eb24f2","observation_id":"f76d0914-f572-4f38-8e7f-32fff3251d22","resolution":{"observed_at":"2026-08-10T16:41:29.717200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-10T16:41:28.993268Z","title":"Camco: Camera- controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.993268Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:48225ace7c722ecd18c9bc195472f6272bd5ab0ccc6475b4b93efaf78e931aee","observation_id":"bd36556e-c861-40a3-9eb3-0348f7e6e2ee","resolution":{"observed_at":"2026-08-10T16:41:28.993268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-10T16:41:29.002316Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.002316Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:ef3bb0595a00780d031057996f6da66400aabd6524aaa2db218ec29bad8121c6","observation_id":"45cae790-5f18-43bd-b78e-2332e51e2f55","resolution":{"observed_at":"2026-08-10T16:41:29.002316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.676499Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"84b82b8b-3c6e-42fd-a031-aa751ecbee34","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.015081Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:873e89216b074824c5cea7588a52ae0e58574f8029db45e8e4d6d05e31e66c07","observation_id":"e321441f-78f6-4a9d-ad34-1528ea478971","resolution":{"observed_at":"2026-08-10T16:41:29.689511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.650102Z","title":"Scenecomposer: Any-level semantic image synthesis","venue":null,"work_id":"f82f49fd-be6a-4c23-91da-502b76041da8","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.032415Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:ad2dd523b37fb3b0b291c67d75ea75eb66851410a660b1842b712ed2934563f5","observation_id":"bb7e60fb-e27d-4a82-a2c5-845736b6a6b9","resolution":{"observed_at":"2026-08-10T16:41:29.655961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.620302Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"7dcba73c-3ea5-46f6-820f-7c744e13468b","year":2017},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.044819Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:2d7c380469c7ab08d43592bc9a2af6369c17d0d07d08c21186bcf474e50316c2","observation_id":"8cc72d48-90c4-426e-8b86-b338cfe0f92b","resolution":{"observed_at":"2026-08-10T16:41:29.632027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.578891Z","title":"Stack- gan++: Realistic image synthesis with stacked generative ad- versarial networks","venue":null,"work_id":"48f51f57-68d2-41ca-900d-207814063414","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.059058Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f41ee1869fb4c80a4de9c53ddb17062496efa21542d9a8b35dd003c3b9afb44f","observation_id":"aa3da337-d003-4018-8001-49013f1a1072","resolution":{"observed_at":"2026-08-10T16:41:29.586690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.553893Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"71351ec8-0c9f-477d-b0cc-5ff03646a230","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.068634Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:b3f9b6794d0e7eecc194323a7e5c1b810d05698c766311c8291f77759a9667a7","observation_id":"cb782a94-1861-449e-be43-a69a13be3a16","resolution":{"observed_at":"2026-08-10T16:41:29.561425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.514378Z","title":"A fixation-based 360 benchmark dataset for salient object detection","venue":null,"work_id":"a23954d7-124d-469d-b668-430b89ab3afe","year":2020},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.077181Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:5b53754d51e762f369c33ffd59efe78ebf4368e73348400a53adf306913040d7","observation_id":"46d8d5d0-548d-49ff-bb9d-de381df75d65","resolution":{"observed_at":"2026-08-10T16:41:29.532165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2501.12910."}