{"as_of":"2026-08-08T16:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28cf013ec46d681327c60e0c707fed8f3fcfc94b786bf3b3568e525c451d7b05","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:18:54.000846Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09045/citation-record","integrity":"/paper/2508.09045/integrity","json":"/paper/2508.09045/citation-record.json","paper":"/paper/2508.09045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:16.908123Z","title":"Alignit: Enhancing prompt alignment in cus- tomization of text-to-image models","venue":null,"work_id":"8897fe5c-7e5d-41f8-b47f-3d07e44883ca","year":2025},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:49.282809Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:b1d9b45813ab201c1cc212c7df8ea0f29c6a55abe4dc52b7ded15c54d19189a4","observation_id":"b600f876-5fcc-4c24-8107-a773cd1375a8","resolution":{"observed_at":"2026-08-05T21:19:17.060359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15391","last_updated":"2023-05-24T17:53:07Z","snapshot_observed_at":"2026-08-03T09:24:24.494606Z","submitted_at":"2023-05-24T17:53:07Z","title":"A Neural Space-Time Representation for Text-to-Image Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15391","snapshot_observed_at":"2026-08-05T21:18:49.405819Z","title":"A neural space-time representation for text-to- image personalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:49.405819Z"},"links":{"cited_paper":"/paper/2305.15391","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:5f0f09efd718ac7c4a97710db318bccab367c7bd2ec2689a9a234bae4dd8bd80","observation_id":"6b6bd397-e35e-491f-9a58-6dac766416e1","resolution":{"observed_at":"2026-08-05T21:18:49.405819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06105","last_updated":"2024-01-11T18:35:33Z","snapshot_observed_at":"2026-07-30T17:20:42.401995Z","submitted_at":"2024-01-11T18:35:33Z","title":"PALP: Prompt Aligned Personalization of Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06105","snapshot_observed_at":"2026-08-05T21:18:49.493940Z","title":"Palp: Prompt aligned personalization of text-to- image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:49.493940Z"},"links":{"cited_paper":"/paper/2401.06105","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:3728a1673c13824ee7baa79b20b359f9417750fb5623542ec2cf1e5f380097ee","observation_id":"cae7c478-67c4-446b-aac3-fdca7c8fd567","resolution":{"observed_at":"2026-08-05T21:18:49.493940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:49.614139Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:49.614139Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:019686425ed739897719e1ffe6a60e45e6fa9ab0c903e80f0009502320b5d870","observation_id":"df6d0f8f-e580-4c70-9558-304bbec9abe3","resolution":{"observed_at":"2026-08-05T21:18:49.614139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:16.565003Z","title":"Subject-driven text-to-image generation via apprenticeship learning","venue":null,"work_id":"61eace8e-c34b-480e-b5c9-e5d5eae4f459","year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:49.787201Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:650ea03dcba37c41b47df68bd71ed1ed2c30fe23478a5909996b0df9f066ddb8","observation_id":"9ac902e9-35e9-40d6-8b79-ac499906da9f","resolution":{"observed_at":"2026-08-05T21:19:16.678446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15779","last_updated":"2023-05-25T06:46:28Z","snapshot_observed_at":"2026-07-06T15:33:06.904026Z","submitted_at":"2023-05-25T06:46:28Z","title":"Custom-Edit: Text-Guided Image Editing with Customized Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15779","snapshot_observed_at":"2026-08-05T21:18:49.965824Z","title":"Custom-edit: Text-guided image edit- ing with customized diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:49.965824Z"},"links":{"cited_paper":"/paper/2305.15779","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:1dd33fc13546a2cba6c3bf7a1e9d4fc2b69cdbb3bd403e8b0a9b75e1fba3e203","observation_id":"12183a66-df21-4321-91f1-e9f04f95ccc6","resolution":{"observed_at":"2026-08-05T21:18:49.965824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:50.077627Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.077627Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:713e81daaf011824c3f5fd48b7c92c5ae6710fdb50dfe879db809ac70afcda64","observation_id":"8b176b2e-182e-419d-bf49-8480d865aa83","resolution":{"observed_at":"2026-08-05T21:18:50.077627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-05T21:18:50.187095Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.187095Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:74c3f84e5f3266c336198377a58bb050d2802a22a0e7ee36937a94a256b9b6ea","observation_id":"53e4713b-014e-4e50-bc68-1516840a822c","resolution":{"observed_at":"2026-08-05T21:18:50.187095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:16.214750Z","title":"Encoder-based domain tuning for fast personalization of text-to-image models.ACM Transactions on Graphics (TOG), 42(4):1–13, 2023","venue":null,"work_id":"d9b12dae-d7ec-4c51-86be-97eacb4984bf","year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.334752Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:d67f4b807e56efb9c93a5dfe7629ad212536b057dba3a4178257c69579635cb2","observation_id":"ff68719d-ec7e-425c-ae12-82d99f67b092","resolution":{"observed_at":"2026-08-05T21:19:16.293171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17532","last_updated":"2025-03-14T02:23:42Z","snapshot_observed_at":"2026-07-06T18:20:48.343830Z","submitted_at":"2024-05-27T17:50:10Z","title":"ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17532","snapshot_observed_at":"2026-08-05T21:18:50.456059Z","title":"Classdiffu- sion: More aligned personalization tuning with explicit class guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.456059Z"},"links":{"cited_paper":"/paper/2405.17532","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:c00b9136f36c5d8ed00b93e468376757b8450c04e38abaf7cf8d3b81e95d67ad","observation_id":"6ff0b0e3-d668-4d50-b97a-cebab1a74460","resolution":{"observed_at":"2026-08-05T21:18:50.456059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02642","last_updated":"2023-04-05T17:59:32Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:32Z","title":"Taming Encoder for Zero Fine-tuning Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02642","snapshot_observed_at":"2026-08-05T21:18:50.551651Z","title":"Taming encoder for zero fine-tuning image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.551651Z"},"links":{"cited_paper":"/paper/2304.02642","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:1e9d07e45060717766e835ddb2e6a5681cac1fccbc4b8c1e086220ac98881b36","observation_id":"d0cdf684-3332-43a2-a90f-7a0faaea50cc","resolution":{"observed_at":"2026-08-05T21:18:50.551651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:15.884915Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"c0259125-d6f1-4874-b4d1-d0beb1fe3473","year":1931},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.702039Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:9291fcb3cfcef0e36b93db80ea83107e2e78ed37298158f4b0815c5911ff3c31","observation_id":"6e6b087d-5619-4e4c-b7dd-aefe88d111b1","resolution":{"observed_at":"2026-08-05T21:19:16.005851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:50.815620Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.815620Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:90a61257767d0cfe2cd32348efb8ee3443c24763a54dcf7deb55e076f6937d62","observation_id":"8a0ffc2c-75e9-48ba-b26f-f0acbd2dfece","resolution":{"observed_at":"2026-08-05T21:18:50.815620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:14.969386Z","title":"Blip-diffusion: Pre- trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":"11e156f4-613b-4c22-ae97-45b0a29c0a54","year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.982741Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:88df3306ec23c603a5800190fdf667eba9f974cc99a8c01cf9f12e8d11d76f97","observation_id":"4e5ba9d5-d938-4d67-a42c-df748802fe17","resolution":{"observed_at":"2026-08-05T21:19:15.102160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T21:18:51.102575Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.102575Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:8025f046af2e3d0da805990568567ecae349be2acc7842a69f3012f108daa119","observation_id":"007a6380-8c15-4304-939c-2ff5926b4840","resolution":{"observed_at":"2026-08-05T21:18:51.102575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:14.691521Z","title":"Low-rank adaptation for fast text-to-image diffusion fine-tuning","venue":null,"work_id":"b5f2eddb-02d8-4169-a970-9ffb0b062bd4","year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.285559Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:ccc7131241ddf7fb5d7304497f057633a26d5a83f7281f0f9e5be08f9fc62777","observation_id":"558dfdbc-4843-44e3-af97-ed938a68fc12","resolution":{"observed_at":"2026-08-05T21:19:14.804824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09319","last_updated":"2023-03-16T13:50:20Z","snapshot_observed_at":"2026-08-06T14:41:32.039153Z","submitted_at":"2023-03-16T13:50:20Z","title":"Unified Multi-Modal Latent Diffusion for Joint Subject and Text Conditional Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09319","snapshot_observed_at":"2026-08-05T21:18:51.407931Z","title":"Unified multi-modal latent diffusion for joint subject and text conditional image generation.arXiv preprint arXiv:2303.09319, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.407931Z"},"links":{"cited_paper":"/paper/2303.09319","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:2d6cc148d2e816be8e089e623c536591aec2395b54c75c4b824a02357071c644","observation_id":"9fd020f2-265d-4aa5-8e34-447f3d42f4ff","resolution":{"observed_at":"2026-08-05T21:18:51.407931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:14.376625Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"59f90bd9-1462-46dc-9364-f32ac276ca2c","year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.504749Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:ed907c279d9fde399d026765c2dd639ab24cd0d1ba8efd936b0706517be97bd4","observation_id":"fef6d9d2-3825-4699-8560-32620471ffb3","resolution":{"observed_at":"2026-08-05T21:19:14.494860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:14.164744Z","title":"Attndreambooth: To- wards text-aligned personalized text-to-image generation","venue":null,"work_id":"25d97509-ce20-406c-b5a9-f77789a51ebb","year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.644320Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:aa4a8d2aa7487b6e105e77c3d24b53fc3f0bd9cb5c3fe5758aab77cce3ba10a8","observation_id":"dc51f67e-0376-4766-b7df-09f99549657b","resolution":{"observed_at":"2026-08-05T21:19:14.284022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T21:18:51.742349Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.742349Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:6690b228edd33ca5cc8b244e20d8da4c681a5940499382d15ca6ce50e51ce6a4","observation_id":"7f01ebc8-2401-4761-9f6e-a14fd2c68922","resolution":{"observed_at":"2026-08-05T21:18:51.742349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:51.886066Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:51.886066Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:9f0f6cb68948802f3d12fd05358aca1a2a8f4f87b5a18e30a8a4f46f499bdebc","observation_id":"ba3b467e-7931-405b-9323-4dc68a72dd92","resolution":{"observed_at":"2026-08-05T21:18:51.886066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:13.780192Z","title":"Dreamblend: Advancing person- alized fine-tuning of text-to-image diffusion models","venue":null,"work_id":"92419342-f4e6-4ea4-8399-0d9aff7d1fd2","year":2025},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.012238Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:875f39079f32af9ac796600dc08b0b112dbcdb7beb29c8da4980bc3749acb41e","observation_id":"a6b0dfe8-45a5-404b-8f4e-a3e0ee7706d5","resolution":{"observed_at":"2026-08-05T21:19:13.924805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:13.420634Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"e7b8f522-57a4-4aa0-8495-2be30922c8da","year":2021},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.169113Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:c87b58b5f93355cefdd345a8fcef2f24290af93a5502bd25dd10d7964008e58d","observation_id":"119e9095-c6e2-4ebf-bac2-cd06e2809837","resolution":{"observed_at":"2026-08-05T21:19:13.592290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T21:18:52.270993Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.270993Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:f3acf1282f453713c551589b66cc6af6b897b8ada6d4dcb1df1a5131cd7f7164","observation_id":"5ca61a2c-7303-41c8-9435-964d3c0b9a86","resolution":{"observed_at":"2026-08-05T21:18:52.270993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:13.200887Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"dfced7dd-916d-4859-90d8-37fe04c51a5e","year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.388711Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:d7a9453f3275be5a2f836af41f31d85e90d41d3d430d18076e7878a771ec461c","observation_id":"d3544090-1628-41a7-b8a1-56bd21cdcb08","resolution":{"observed_at":"2026-08-05T21:19:13.318954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:12.984934Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"575cc294-1c6e-4a5c-9c00-96d26fb14a24","year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.547811Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:394486f1ca9513e8a11d33080259937ad321118e42c5d1a0a76bc5a7c5ecf42f","observation_id":"5991865d-09c6-4d40-92f1-273b0908a574","resolution":{"observed_at":"2026-08-05T21:19:13.091041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:52.708760Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.708760Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:f105605ed2cac7e0085a1d6ed8c80605df7b41dd8b26fc42b719965aa22048d7","observation_id":"6e62030f-547a-4a1c-8873-d668a8ea8de1","resolution":{"observed_at":"2026-08-05T21:18:52.708760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:12.654973Z","title":"Where’s waldo: Diffusion features for person- alized segmentation and retrieval","venue":null,"work_id":"0761319a-7f7b-433e-a1c2-8ab653dd52d6","year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.810818Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:7074c1f1663b4382ca093815deb4c36174074094fbcf17b0345319fc44996680","observation_id":"e7cb52eb-c3f7-4cab-bde4-5151233c78ee","resolution":{"observed_at":"2026-08-05T21:19:12.754947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:12.414752Z","title":"In- stantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":"ce4a64a9-c4e1-4b00-a732-5e7a67299523","year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:52.919274Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:cee6ac04243686e6c96c42dee0a12e0bf10756924566a03de7ed8e86989da269","observation_id":"702e18fd-dae9-44bc-b007-ce91847744a1","resolution":{"observed_at":"2026-08-05T21:19:12.532647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-05T21:18:53.017729Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.017729Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:576eb8c9e2d0f6bcfe3a595b1510cadd726342a0061e76de978f8b070b42a9f0","observation_id":"fae550a1-9bc8-42cf-91d7-06fefa4c8180","resolution":{"observed_at":"2026-08-05T21:18:53.017729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:12.132176Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"79e8367a-bf4a-49bd-b0b3-b9e43d1c416a","year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.180948Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:9e7e851ff147c5d203f6cffc4ed0bda424e906e26f4bddef3998b437f6526ae6","observation_id":"d442070f-d690-49ba-8594-9221fc0e0e20","resolution":{"observed_at":"2026-08-05T21:19:12.225805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:11.893501Z","title":"Key-locked rank one editing for text-to-image personaliza- tion","venue":null,"work_id":"c55bf7aa-c316-4dde-a492-87bf72926bdf","year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.319805Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:e8eb7d2cf421a04fb85d4449138c7d4ce84ed2c9e9d041f0a5a30209f970c762","observation_id":"1c50c29c-4bc6-4137-88be-3eacf81d50f2","resolution":{"observed_at":"2026-08-05T21:19:12.004920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-08-06T13:58:29.349698Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-08-05T21:18:53.421539Z","title":"p+: Extended textual conditioning in text-to- image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.421539Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:f9a203c21ea48941a49827a6af51230e5f4a198badcecdc126562c0c8b625908","observation_id":"a9eef136-f256-43e5-bef0-804c0436359a","resolution":{"observed_at":"2026-08-05T21:18:53.421539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-05T21:18:53.556335Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.556335Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:c0a5f733811c04afb9855f0ac335ed6bb86805c18ed70ffb2014cf1b3ddf1cd2","observation_id":"04183b0b-f6d4-4780-b59f-fa310cfd28e2","resolution":{"observed_at":"2026-08-05T21:18:53.556335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:53.685741Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.685741Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:a78f940de2833193d8e38cb0fba03b7a4ae6cdc140f96d40013eb68a97571b26","observation_id":"c83fd7c6-d58d-43db-9c44-a5f15606ec65","resolution":{"observed_at":"2026-08-05T21:18:53.685741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T21:18:53.784755Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.784755Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:c65d248634bed26465b61cf2b0fc8eb45c861b907fc9e397f16bdf1588790de3","observation_id":"fb221ba0-8c41-4aab-b112-2b52d0f5059a","resolution":{"observed_at":"2026-08-05T21:18:53.784755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T21:18:53.874431Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.874431Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:9bd2596aeb96d3fda5da199d632946002826f0be33e087967dba0b5cd579f9f6","observation_id":"18cde8cf-8778-47db-b12c-1cf1955b78c1","resolution":{"observed_at":"2026-08-05T21:18:53.874431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:54.000846Z","title":"A survey on personalized content synthesis with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:54.000846Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:57e55742a410ae1860af6e69c36febc039ece6f85f0526954d930c449acd6a52","observation_id":"8b47ca9d-bfd7-4c25-ac1e-f832e183a6b1","resolution":{"observed_at":"2026-08-05T21:18:54.000846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:19:15.357926Z","title":null,"venue":null,"work_id":"ab0922eb-27e9-4800-8a60-8ffdc3d0cc9d","year":null},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:50.864177Z"},"links":{"citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:6d1a18ad9538c9db75f4e1523d296d0337535056b8f9f3e64f95cb01a96abd8a","observation_id":"1f745ed6-69a1-4498-8245-5ed0a6f5274b","resolution":{"observed_at":"2026-08-05T21:19:15.582195Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:54:24.594883Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2508.09045."}