{"as_of":"2026-08-13T09:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:671f01d682b512968520e312e82b83004b3bb60480d2b8687a826edf9fa3adcf","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:40:28.695737Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07674/citation-record","integrity":"/paper/2412.07674/integrity","json":"/paper/2412.07674/citation-record.json","paper":"/paper/2412.07674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.499186Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.499186Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:3364d984b7fcb2fe811cb63beb02b526cbf515467d5702fc5829f66faf6c3cfc","observation_id":"123556f4-da29-4584-b1b4-f614e181b247","resolution":{"observed_at":"2026-08-11T18:40:28.499186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T18:40:28.504786Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.504786Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:e89b8ab779ea1c8bfb9b06c96243254dcc1d5a5143b6b5315bf197068b390926","observation_id":"0ff369a0-008e-4ccb-9ceb-584132a5fc03","resolution":{"observed_at":"2026-08-11T18:40:28.504786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-13T00:59:54.489440Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-11T18:40:28.510156Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.510156Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:fa4a5e5ec34648671580531b121f1be0c3f1fc6bc45b4293c8215aa20e5913ab","observation_id":"3831a5ed-78d5-482f-ac7b-fe1ef7bb6c3b","resolution":{"observed_at":"2026-08-11T18:40:28.510156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-13T04:45:10.488145Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-11T18:40:28.516313Z","title":"Pixart-{\\delta}: Fast and controllable image generation with latent consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.516313Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:268d520081ab8d766943aa25e51253495e9b896f236583dbf649510631d7a13d","observation_id":"8f187c7c-a289-4bb8-bd3c-f2b7dc9ce093","resolution":{"observed_at":"2026-08-11T18:40:28.516313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-11T17:53:51.229692Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-11T18:40:28.521603Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.521603Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:4af28aea6ed4ca130ebba06d334415deddbadab3945eeb822347da6e0598fde8","observation_id":"7b8bfe93-837a-418a-bc33-7275e61f4e0b","resolution":{"observed_at":"2026-08-11T18:40:28.521603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00946","last_updated":"2021-12-16T17:05:46Z","snapshot_observed_at":"2026-08-08T05:43:23.144119Z","submitted_at":"2021-08-02T14:46:46Z","title":"StyleGAN-NADA: CLIP-Guided Domain Adaptation of Image Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00946","snapshot_observed_at":"2026-08-11T18:40:28.526087Z","title":"Stylegan-nada: Clip-guided domain adaptation of image generators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.526087Z"},"links":{"cited_paper":"/paper/2108.00946","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:b8cc812ab8c56f994f0c87c3ae142744d00a6f82601ec14853e6fd6b580cd629","observation_id":"863a72db-3cd7-46a1-b4b5-434cef1123f4","resolution":{"observed_at":"2026-08-11T18:40:28.526087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02133","last_updated":"2024-01-11T13:51:40Z","snapshot_observed_at":"2026-08-13T05:10:09.561730Z","submitted_at":"2023-12-04T18:55:35Z","title":"Style Aligned Image Generation via Shared Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02133","snapshot_observed_at":"2026-08-11T18:40:28.531192Z","title":"Style aligned image generation via shared attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.531192Z"},"links":{"cited_paper":"/paper/2312.02133","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:3985f6dbc76a719d6934d7886db54d34e82c5dcef9e1bd012d1e920af4f1fcf8","observation_id":"2ccdbf6d-f69d-4b6c-8f86-c6fbff59a759","resolution":{"observed_at":"2026-08-11T18:40:28.531192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-11T18:40:28.536843Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.536843Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:b981c4e1fe55df6ea765076c017897b4389904b86e960bf853a19d28c38e5054","observation_id":"00ffe697-6b61-4661-9d87-a2c0b969387c","resolution":{"observed_at":"2026-08-11T18:40:28.536843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-13T05:15:29.772394Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-11T18:40:28.542539Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.542539Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:a75fa58959b80ef3a7f695274c64ec436df6646bcf1a2812526a2a7e6191f062","observation_id":"cb74d589-ca20-4309-8e8c-7bdeda643d97","resolution":{"observed_at":"2026-08-11T18:40:28.542539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.305186Z","title":"U-dit tts: U-diffusion vision transformer for text-to-speech","venue":null,"work_id":"797db0b8-6234-43b0-9003-eeb68a6519e6","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.547520Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:2b3089f851dc95d828cf4dcd5afb001fa7c2fd0cbde017761934860745ceb5db","observation_id":"ee60112f-92dc-49b4-9d06-eee352350115","resolution":{"observed_at":"2026-08-11T18:40:29.310868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.286731Z","title":"Shamma, Michael S","venue":null,"work_id":"71df72f4-04d0-421e-8b8d-53d07f39a07d","year":2016},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.552766Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:7575c145b3294655e66506ae0c37103a5e2219bd90d287551f5ac0fb42eb3322","observation_id":"1ae46ef0-fa04-483a-81af-f9acdb0f6f2e","resolution":{"observed_at":"2026-08-11T18:40:29.291723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.270386Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"019d1462-369f-4396-823a-a60d167db303","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.557545Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:ed84d40efd190705dad0e5cdef97d8fd45801346e81c456a8409df475f1f4e47","observation_id":"4a3be902-907e-43e8-8b10-89e8cb51d104","resolution":{"observed_at":"2026-08-11T18:40:29.275691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14720","last_updated":"2023-06-22T02:36:06Z","snapshot_observed_at":"2026-08-06T18:16:37.085389Z","submitted_at":"2023-05-24T04:51:04Z","title":"BLIP-Diffusion: Pre-trained Subject Representation for Controllable Text-to-Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14720","snapshot_observed_at":"2026-08-11T18:40:28.562905Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.562905Z"},"links":{"cited_paper":"/paper/2305.14720","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:85f93d1d33e580f98e7e4ff32364932a2eb0242621c7fcd96c38e17c67f773d1","observation_id":"52ed3e26-d7ca-40ec-8e86-bb4bbf858261","resolution":{"observed_at":"2026-08-11T18:40:28.562905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.567813Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.567813Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:b11cb9750e738f23b7b234a96ddb154c42338e8032b7b92f9ccdbbd1560a9a61","observation_id":"d85635d7-304a-4021-ba62-35a13fa7fdc7","resolution":{"observed_at":"2026-08-11T18:40:28.567813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.243523Z","title":null,"venue":null,"work_id":"5af1282a-0b03-4c03-b1d0-93c24a6441b9","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.572408Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:e8672aa4bbda5cf100701ae0ed6de99ef23d4218c9c0514692790943f8be6bb8","observation_id":"f17c1609-96ed-4d8b-b483-8b2210fd039c","resolution":{"observed_at":"2026-08-11T18:40:29.248425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.577187Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.577187Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:11ef8981193605c955f9cd987df1db91ee080ef4a0b5e8a859d7b67b024b6077","observation_id":"c93b783a-afec-4fa9-8d06-78d19c1b7d97","resolution":{"observed_at":"2026-08-11T18:40:28.577187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-11T18:40:28.581999Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.581999Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:755629f6c2cd0ad9b4f7edb4b6400ce3682b2daeae4627d5a295d66c3e4a9359","observation_id":"9693c1af-da83-4fe8-b793-fe24540a19d5","resolution":{"observed_at":"2026-08-11T18:40:28.581999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.586866Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.586866Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:0f7692614f5a61113bdd93fcea375e104f8e76b7fa1c8eee5e955d6aaea27eab","observation_id":"422a4f50-5edd-478c-8bac-5b206c302428","resolution":{"observed_at":"2026-08-11T18:40:28.586866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.205085Z","title":"Deadiff: An efficient stylization diffusion model with disentangled representations","venue":null,"work_id":"8c7ee7c1-11e8-466d-a5fb-2db59942ef06","year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.591514Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c6a54d311651bca176e287456d54e29a7c4965c47d66bd36127b5f45619c2da2","observation_id":"216f4f28-7531-4740-9a23-672717f2a722","resolution":{"observed_at":"2026-08-11T18:40:29.210503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.596189Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.596189Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:5d75a058878807364f2b9d4da9ec92ed3986c635c7126fa5a211e59c8d511c70","observation_id":"ccc476a0-c9ee-4095-a455-d4415c888ed7","resolution":{"observed_at":"2026-08-11T18:40:28.596189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.600751Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.600751Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:f7be752749d156350b3ffb2205264bf96aa97526f2775616367c5696ea6aa88a","observation_id":"e5e969db-e17b-436c-a2de-0852b9b6d7cb","resolution":{"observed_at":"2026-08-11T18:40:28.600751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.604965Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.604965Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:693b0ee3c15ec3a102e92392b4b0eb0c5f78e66afe60f489a852e57e321137d1","observation_id":"6ebed150-4ce5-419f-b01f-0c2aa596df0e","resolution":{"observed_at":"2026-08-11T18:40:28.604965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.609185Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.609185Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:0d4ed373d31c400775c32c403c6547b4bc396b257155561ff42dba9187ac8472","observation_id":"61ca893c-e1a0-4c43-85ff-737fdbf7775d","resolution":{"observed_at":"2026-08-11T18:40:28.609185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.613283Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.613283Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:8ccc718c86a89a2153cd67a28fc36315d25d54ed1bf3b9b42bf5d5ec18ebffa0","observation_id":"3f9604d0-f297-4230-a940-f6b8aac25916","resolution":{"observed_at":"2026-08-11T18:40:28.613283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.139890Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"19e8a172-6142-46ac-b00a-484104225a1c","year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.617342Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:3576b8f60df0f3de356e9c251da91852bde828eb58d653f30e5078479e15d3c6","observation_id":"651bbf4a-c436-4f06-8e1b-fa117c04f349","resolution":{"observed_at":"2026-08-11T18:40:29.144412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.123097Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"2cd386f6-e7b7-4876-b493-48c1beddfd2b","year":2018},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.621422Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:dad8343be42188601fe258a33f42cdcbdf5ff03d36cf2acc2b31e2e4839f4d87","observation_id":"a05873d1-6f36-49be-b0b8-f554d1766e88","resolution":{"observed_at":"2026-08-11T18:40:29.128749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00983","last_updated":"2023-06-01T17:59:51Z","snapshot_observed_at":"2026-07-06T15:36:45.014921Z","submitted_at":"2023-06-01T17:59:51Z","title":"StyleDrop: Text-to-Image Generation in Any Style","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00983","snapshot_observed_at":"2026-08-11T18:40:28.630681Z","title":"Styledrop: Text-to-image generation in any style","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.630681Z"},"links":{"cited_paper":"/paper/2306.00983","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:df7142da88647637c79917a724cb03ba409c1bdcb3fa2ad3ae6ff11d724f0cc0","observation_id":"8f304f1c-82e2-459a-b33e-a519b0734e1b","resolution":{"observed_at":"2026-08-11T18:40:28.630681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00932","last_updated":"2022-12-05T05:11:31Z","snapshot_observed_at":"2026-08-10T19:43:31.514866Z","submitted_at":"2022-12-02T02:15:13Z","title":"ObjectStitch: Generative Object Compositing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00932","snapshot_observed_at":"2026-08-11T18:40:28.635347Z","title":"Cohen, Brian L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.635347Z"},"links":{"cited_paper":"/paper/2212.00932","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:188ce4283b78a5884dec98c91f495e85acde525fd37eafbf0307b10acd08d76e","observation_id":"2da18837-135c-4929-9a28-78edfa457b65","resolution":{"observed_at":"2026-08-11T18:40:28.635347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.106177Z","title":"Shamma, Gerald Friedland, Benjamin Elizalde, Karl S","venue":null,"work_id":"4bb95c87-f95b-4c45-aa97-9b6efb4dd792","year":2015},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.641437Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:3612d9f3d4ef1859215dd0231b70cfbb055189595e79f5a74a413d72681409f8","observation_id":"fe3ea982-b90d-422d-8fe9-1316ba354f9b","resolution":{"observed_at":"2026-08-11T18:40:29.111710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01770","last_updated":"2024-10-30T17:05:17Z","snapshot_observed_at":"2026-08-09T14:50:52.185803Z","submitted_at":"2023-09-04T19:16:46Z","title":"StyleAdapter: A Unified Stylized Image Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01770","snapshot_observed_at":"2026-08-11T18:40:28.646066Z","title":"Styleadapter: A single-pass lora-free model for stylized image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.646066Z"},"links":{"cited_paper":"/paper/2309.01770","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:5dbb81bfec67c6a8fbb271e3f936b045dcbaac9ad9e91d75b05ce5d71d66fb9c","observation_id":"d536c86b-0386-46ca-afe7-22e8f05b567b","resolution":{"observed_at":"2026-08-11T18:40:28.646066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-13T06:19:55.111321Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-11T18:40:28.651519Z","title":"Wang, Evan Montoya, David Munechika, Haoyang Yang, Benjamin Hoover, and Duen Horng Chau","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.651519Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:bb3172e7cf8066febd50dd7396f3251387ed36ca33f45cdaeeee928265e7b494","observation_id":"a4da1109-0fb9-447d-b887-b96fd195529d","resolution":{"observed_at":"2026-08-11T18:40:28.651519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.089230Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"53733d2f-9709-4d37-853f-820f18c26758","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.656683Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:345c4aa36e164a3c5832935b86e68d973c10819d510a023fe99c57ee427f4dbe","observation_id":"041610ed-f5e5-4402-bbb4-8719d5116c90","resolution":{"observed_at":"2026-08-11T18:40:29.094528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.661388Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.661388Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:43dd0ae3a987d3fd5094987280e361e61fab662ed5644e9ece5bf63cdbb25829","observation_id":"5ed338e7-4fed-45c1-8132-cb2f399d53d4","resolution":{"observed_at":"2026-08-11T18:40:28.661388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.062673Z","title":"[sks]” denoting the placeholder for subjects that might fit into the sentence. Prompts are created by replacing “[sks]","venue":null,"work_id":"b2dc7f32-58a3-4281-b764-a4468664c371","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.666224Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:06123254b474536baf72a110125fd5cb0e61050b94741fa047f53aa7b47c1920","observation_id":"70c85eb5-c59a-49d0-bf37-6a2b39ba0f7a","resolution":{"observed_at":"2026-08-11T18:40:29.067960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.046984Z","title":"stage pyrotechnics","venue":null,"work_id":"ca182681-12a7-42c3-a575-d9cbd4bf7ed7","year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.671798Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:84ffbf1d7349a298ac488fc432dc00093d0f39722495c9f2f4853b1e96b41a74","observation_id":"56324b7f-e934-4a48-8e70-a7b506e1b063","resolution":{"observed_at":"2026-08-11T18:40:29.051486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.031487Z","title":null,"venue":null,"work_id":"83747126-fa32-4dc2-bdd0-6bbe3ce2a57b","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.677687Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:67ce385827fdd2e42e389176e1d62c9badb16f153e0bb0f0e387929c182e9bf9","observation_id":"8294fc73-8938-49d1-9adb-debd7f9146bb","resolution":{"observed_at":"2026-08-11T18:40:29.036486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.682116Z","title":"(a) Did you state the full set of assumptions of all theoretical results? [N/A] (b) Did you include complete proofs of all theoretical results? [N/A]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.682116Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:cf3ee40defc9451592cb72a31d2194743c06df65847d5cf9c99aab2eedbc6fcc","observation_id":"9d513c26-c9e2-45d8-8d86-742407f48343","resolution":{"observed_at":"2026-08-11T18:40:28.682116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.003565Z","title":"for benchmarks)","venue":null,"work_id":"ef874ecb-b9ac-4ffb-aecc-7bd7bc6cb322","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.686288Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:bb34a7d061c0d67583531ee4e9a829aa7bc71ad88cabd36f2ef903322efe31a7","observation_id":"e54029d3-36a3-42db-9116-a33dccc2d946","resolution":{"observed_at":"2026-08-11T18:40:29.008646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.985387Z","title":"(a) If your work uses existing assets, did you cite the creators? [Yes] See reference","venue":null,"work_id":"8b3fb5f9-5866-46b7-a879-7809ec3fe278","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.690731Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:78e12488eb9cdec4174726e6c968f13a673e11631efb9bf507002876fdcda4bd","observation_id":"fe5b9adb-78f5-4ca2-8113-15d386a35bcb","resolution":{"observed_at":"2026-08-11T18:40:28.991422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.967054Z","title":null,"venue":null,"work_id":"e9cfab7e-5e9a-44a8-bcf7-52eca22ee50b","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.695737Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:95da4a7065d305c777fd85fb1ceffddc791aab75e597a4fd49eea8be10fb6ff5","observation_id":"39f542e4-a151-4afb-9ea6-13d56ebcf22d","resolution":{"observed_at":"2026-08-11T18:40:28.973554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:20:14.796882Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2412.07674."}