{"as_of":"2026-08-11T04:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79c9ac009731968e2a1d4503478c59f86c9bb348e6bd0a9a85617db437e3bd54","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:25:19.066598Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21611/citation-record","integrity":"/paper/2605.21611/integrity","json":"/paper/2605.21611/citation-record.json","paper":"/paper/2605.21611"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:42c5194d2734ba989e077224ac6f7e1227a4a5e972a986a10520af5e7d472dc7","observation_id":"f9ee4736-29c4-4eb7-a044-59007715992e","resolution":{"observed_at":"2026-05-22T09:26:20.784211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":"2308.13418","doi":"10.48550/arxiv.2308.13418","metadata_source":"pith","pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nougat: Neural Optical Understanding for Academic Documents","venue":"cs.LG","work_id":"26c3b627-7e97-40d7-bab3-020936b8196b","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:290fdec50c45bdd6a75874b581015679885d6ffd0f0e3a582840928043eb8b55","observation_id":"b5095ec4-53ae-4cf5-945c-c4decadf84b6","resolution":{"observed_at":"2026-05-22T09:26:20.807752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":"2211.09800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-07-04T10:19:47.353241Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","venue":null,"work_id":"de9c4a95-36ff-4e97-a0c0-3cca39f60b1a","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:07b67ea4150ef6f5fec6cdd16e036047c056ede09e40853cf3faa17cb1fccf7d","observation_id":"8ce526d6-a5da-497b-a961-57b2ea8a45b8","resolution":{"observed_at":"2026-05-22T09:26:20.779221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"0b317ed3-fa9a-4888-b814-45353eb336d7","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:f4260b02d0cceb525426159724828fb41f3c7a8cdd44dfb3a63d1cefa780f97c","observation_id":"28a45d0d-6e1c-47ce-88c4-d9bff06cbdb3","resolution":{"observed_at":"2026-05-22T09:26:21.105030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anydoor: Zero- shot object-level image customization","venue":null,"work_id":"da8cddf3-54ee-4b73-afa3-301eea3527d2","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:2f418fff048ba3a2dcf45df8eb783cc7b677d7265cec4619c7489ef8b15ebaec","observation_id":"b7b9a8ed-a566-4ab9-9b41-df3fb1a561a9","resolution":{"observed_at":"2026-05-22T09:26:21.101857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:6031295fcdf0f92619779f83d4a9c663c787a89a386286ff1e86353fdba750f8","observation_id":"5d7c2be3-5219-4df0-a6e0-dd70cddb09a1","resolution":{"observed_at":"2026-05-22T09:26:20.789280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":"2105.05233","doi":"10.48550/arxiv.2105.05233","metadata_source":"pith","pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Beat GANs on Image Synthesis","venue":"cs.LG","work_id":"2eb944bb-93ba-462c-8111-4e8c915dd873","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:843777b37a1ff90ad72f875843851f95b8d5a28ce81af29f0fc9b26410ba9393","observation_id":"8524f1f3-0e75-474c-b4f6-398f929e8a88","resolution":{"observed_at":"2026-05-22T09:26:20.793708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09595","last_updated":"2025-07-13T11:51:53Z","snapshot_observed_at":"2026-08-09T20:32:50.950227Z","submitted_at":"2025-07-13T11:51:53Z","title":"Demystifying Flux Architecture","version":1},"cited_work":{"arxiv_id":"2507.09595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09595","snapshot_observed_at":"2026-07-02T11:36:55.456502Z","title":"Demystifying flux architecture","venue":null,"work_id":"6b0e2244-d426-43bb-9a34-323f3d8b0ab8","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2507.09595","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:1fafb7f91a5dadf38e25e1c2a06aaade6442367a4583786adfe826126f52ab51","observation_id":"83f599ec-a41a-4cfb-ac98-f26ecb5157bf","resolution":{"observed_at":"2026-05-22T09:26:20.803649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":"2208.01626","doi":"10.48500/arxiv.2208.01626","metadata_source":"pith","pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","venue":"cs.CV","work_id":"196f7eef-d65a-47e4-b815-9a188f6aedcf","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:65a3f686fd380f652eafe3a21f0bfdd4cbc5264aba8e602b7f1bb9f1024d7cf2","observation_id":"9488ac53-35bc-469f-a3b8-3201efc5f28c","resolution":{"observed_at":"2026-05-22T09:26:20.798428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":"2006.11239","doi":"10.48550/arxiv.2006.11239","metadata_source":"pith","pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Probabilistic Models","venue":"cs.LG","work_id":"dc023f4e-7c79-471c-b713-deeb559ba010","year":2020},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:fb3252777dd75fa97590eb13ffc0e481e4f9887eac14592cae31cff417d14148","observation_id":"e4866763-e7c6-4584-aac1-374522c0023a","resolution":{"observed_at":"2026-05-22T09:26:20.773573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brushnet: A plug-and-play image inpainting model with decomposed dual-branch diffusion","venue":null,"work_id":"26ed48dc-c108-432b-9803-0a1ede05367a","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:57e68a6649b1fa92e2a2b2144225ecd7b7ff3ebe046874df2db17e2ab8a92f3f","observation_id":"d7e8133b-e81c-4b8d-b985-1469f3022c78","resolution":{"observed_at":"2026-05-22T09:26:21.108241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A style-based generator architecture for generative adversar- ial networks","venue":null,"work_id":"e760873e-5bcc-47a6-ac6b-c6a957995d0e","year":2019},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:b1dfcac6acdc644b61869c72f491101ddcc0910ad1c5c900304ec6cc817c9462","observation_id":"bd08cfa4-afd8-4379-8129-51fe1fea28b8","resolution":{"observed_at":"2026-05-22T09:26:21.078006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:14:47.729548Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"d4028a91-9152-4f10-95b7-edb74a2f0e38","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:99955c8f8a5e12188c90a9a2811809a25b90da051f3f35728dc7f5c1cbcd29b2","observation_id":"2e377043-cd8f-49d2-9bab-2a21f7d1a85a","resolution":{"observed_at":"2026-05-22T09:26:21.091733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:d66c17984b04b8ecabe75e43a4f881bdd97febe68932c83cbb5297b779cd6d9c","observation_id":"9b53c889-ee76-4457-9a18-170b68a99b45","resolution":{"observed_at":"2026-05-22T09:26:20.727279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"3acd25f7-b49f-4a3d-b180-40484642c026","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:c6638730ee6a5284c188d36f3c88cd8947115d9f6bbf691c61aa0044180c340c","observation_id":"653956ce-3acc-4992-8711-f570c1e5b97a","resolution":{"observed_at":"2026-05-22T09:26:21.074980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:8ef2def2c4aec0b75eb27603f15978bf42da6f1b68d21b1d15ff46c794de1065","observation_id":"99ca2bf9-9662-4d98-8565-4c15972f8df9","resolution":{"observed_at":"2026-05-22T09:26:20.722625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":"e4449495-d6fb-47a0-97ed-c1f67aef948b","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:18ae317decaecd49fe5e7b583b47e63514c393ae09c649d9ace4012db3140d77","observation_id":"37d2f4f1-d39b-437b-a7c6-82ea543d0408","resolution":{"observed_at":"2026-05-22T09:26:21.081507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-10T12:28:15.079045Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2303.17870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-07-04T19:30:07.398512Z","title":"Glyphdraw: Seamlessly rendering text with intricate spatial structures in text-to-image generation","venue":null,"work_id":"25a92acb-7f31-40c0-85d4-cb2c16bfce7e","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:5e2261ae8a9c28b9511fdfa9e5030cfca7d106af08a524d878884ae053e07753","observation_id":"c62f74dd-006a-4a95-800c-4c0ba9772ca1","resolution":{"observed_at":"2026-05-22T09:26:20.712176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.052702Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"e7e67a5d-a26e-4214-bb44-12aac0bf71b1","year":2019},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:782a75a22e59a0af5ee0551d8a55b7170045e1ebbfd2238898c956be4f3fbd8b","observation_id":"9aa96945-010b-4485-a1d9-8efec66cfa4e","resolution":{"observed_at":"2026-05-22T09:26:21.064550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:0995cbd3cce3743e20aa889029179ca87f6dc22299c78d4ff34929b828527ff8","observation_id":"2f98f065-2389-4ab9-9e81-2186815c78df","resolution":{"observed_at":"2026-05-22T09:26:21.067867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:de1d44d6358bcabf56842334c765335e9c19799ee7e6feba092b3b3b33e5ae22","observation_id":"1c763e88-d7a7-4421-975b-499e995bb117","resolution":{"observed_at":"2026-05-22T09:26:20.751151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:51cdf561334c9245f9b1dad2898485365046435bc6af99ca3e2f1101f5030b50","observation_id":"d520d741-dfc8-46af-be69-95eb11f1ca9c","resolution":{"observed_at":"2026-05-22T09:26:20.759730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17189","last_updated":"2022-03-31T17:12:13Z","snapshot_observed_at":"2026-08-10T18:28:25.800458Z","submitted_at":"2022-03-31T17:12:13Z","title":"Scaling Up Models and Data with $\\texttt{t5x}$ and $\\texttt{seqio}$","version":1},"cited_work":{"arxiv_id":"2203.17189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17189","snapshot_observed_at":"2026-06-30T15:44:48.510903Z","title":"Alexey Romanov and Chaitanya Shivade","venue":null,"work_id":"b4ce3d71-9be2-4401-8618-528a87b188bd","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2203.17189","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:86752c2a6d5fda5a0277ded961bd46ce0914f02c98d637044c87da78221ab6af","observation_id":"42a2e913-e131-413e-a98e-a300fd8a95da","resolution":{"observed_at":"2026-05-22T09:26:20.769472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:60dd6fb7051deae7138e041fa2fc34ad190dccdb1e9c516d0ef9eeb24211295d","observation_id":"354ddd2e-350f-488f-88f1-7f3289730960","resolution":{"observed_at":"2026-05-22T09:26:20.755259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294","venue":null,"work_id":"25581cba-8e27-40a4-86eb-c560ee7d7bbd","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:fa55fcfc72fcd9397de379a07609a25d270ec11ece2d99ad82da339919d9025f","observation_id":"9c25e2c3-6a69-4367-af4b-7e84cb1db5a1","resolution":{"observed_at":"2026-05-22T09:26:21.071652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ominicontrol: Min- imal and universal control for diffusion transformer","venue":null,"work_id":"1e9c246f-726e-4929-827b-18784c439a27","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:b4d6332d23bdb03f2e730b79e78e8e896974d816c726fb4ea7af389b8fd20cfc","observation_id":"dc7f86de-d30c-4621-9a55-0870c79384f0","resolution":{"observed_at":"2026-05-22T09:26:21.088603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.06119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.547305Z","title":"Omni-video: Democra- tizing unified video understanding and generation","venue":null,"work_id":"ff3fdc36-7023-4bae-ae8b-c28ff8524967","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:5a644d5409e5c98a0f7beefba278f54c509af3b84574454c22532e18aa0d5869","observation_id":"d3e474c7-4cb7-4026-9265-8ff4885844b6","resolution":{"observed_at":"2026-05-22T09:26:20.764404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-10T22:25:54.325269Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":"2311.03054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-07-04T10:29:44.518677Z","title":"Anytext: Multilingual visual text generation and editing","venue":null,"work_id":"6ca52f26-db50-422e-86c6-89c334703122","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:5f9ba2ecb1919a980ad558b2579d597a1e9b73d126651d20c68d981d8a4e8269","observation_id":"c5fc9805-f99b-445c-814b-aba84d2adc10","resolution":{"observed_at":"2026-05-22T09:26:20.717505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":"2409.01704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-07-08T20:35:34.407064Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","venue":"cs.CV","work_id":"67b1592f-02b6-4056-b3fe-cc594e484192","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:db81334d309b9b9c238113758912ba899c4c00747d5b7b279925cdffe82e01fa","observation_id":"53fcbf81-7705-44f2-bdd4-9d5f88fa8717","resolution":{"observed_at":"2026-05-22T09:26:20.695715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":"2510.18234","doi":"10.48550/arxiv.2510.18234","metadata_source":"pith","pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-OCR: Contexts Optical Compression","venue":"cs.CV","work_id":"e85551be-f243-4764-886f-76a8813ccbb8","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:a94e749e3f1aaa6241e1f531b45a0793125bf9916d5d1d5507513d2a24ad06c7","observation_id":"d1d634a9-f8ad-49a2-a030-998f632dc134","resolution":{"observed_at":"2026-05-22T09:26:20.706394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.727485Z","title":"Deepseek-ocr 2: Visual causal flow","venue":null,"work_id":"9886dce9-776e-4ad6-b96c-fbf9037ca41c","year":2026},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:9718b35001c3176a838ce6e7db93aa166c08d8eafec6be48a6e3e05a54664c17","observation_id":"8c761652-e10c-45df-983f-fb3b13f4f356","resolution":{"observed_at":"2026-05-22T09:26:20.701364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:42517ccacaa6c7a26ec4eb3949705c2ff20fed1729d3225ae8c37c0e59815b20","observation_id":"b8705968-57a0-4b7e-b311-35719e7ce089","resolution":{"observed_at":"2026-05-22T09:26:20.737616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"44c4767d-e473-4f19-9c97-e1a4804dfa19","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:232223a2f46ffb9246ef20a327a3dde3d5cbfbea25e3ae40b64594e8cecb1462","observation_id":"8f3d3cf9-c942-44af-ad24-af88ed4a70f8","resolution":{"observed_at":"2026-05-22T09:26:21.085223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"bad159e9-ee83-4426-85c0-e40304a8a1d0","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:acb8255d8f52b6aec06a17535f28057ba5783af41b749e53a7affdafd3f6b936","observation_id":"ab611996-7029-4139-8fd1-d9aa9b7c8fdb","resolution":{"observed_at":"2026-05-22T09:26:21.095108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:106c44433d93cf2d87fbe4375bc61c455bf4d7abc5a8b11b48269aa8524141ed","observation_id":"fbfdd351-9b9c-4eae-a68f-3166f4fc26da","resolution":{"observed_at":"2026-05-22T09:26:20.741995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2302.05543","doi":"10.1145/3240323.3241729","metadata_source":"pith","pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"226c10cc-8cc0-4c01-9358-f23db6c470c7","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:cd579a36093c8cd8763dce4a84b7cd9fbe7f112c472fe7e71380c86d60ed2139","observation_id":"915eae3d-299d-4543-ab68-ea78f422d9ed","resolution":{"observed_at":"2026-05-22T09:26:20.746997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unpaired image-to-image translation using cycle-consistent adversarial networks","venue":null,"work_id":"cb542f67-bbc4-4121-abdb-152084166659","year":2017},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:22ef750a480b8b73e603c77f90319f30653ada3f5f0f1326ec23e3d521e679fd","observation_id":"0677353e-6415-4072-a3fe-cf3a01ae01dd","resolution":{"observed_at":"2026-05-22T09:26:21.098748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting","venue":null,"work_id":"f2bab21e-aeb1-4790-8ac8-02827e39ed75","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:66087c1a94fdf21f966c95ffd103d4c0103a621e957018545c0123bb0f6f6476","observation_id":"307974bf-dfd1-48a8-81d6-67dfa5595704","resolution":{"observed_at":"2026-05-22T09:26:21.061206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"96293e14-b951-473a-8cc6-984917d7ace5","year":null},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:630d578bfe60b8f1dd103daa15184a0d793c32e3e7287762280f2108ed6bed38","observation_id":"7bbe8cac-2642-4c61-a2d0-8a9a4f521ca5","resolution":{"observed_at":"2026-05-22T09:26:21.054117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65835cba-7eba-48b7-9a71-e4e34b194187","year":null},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:66368837969cf077808ea600300cd7aafff717c3be641d22ed08fd22c42faf0e","observation_id":"6ccd17de-a318-4717-b189-794b0442c827","resolution":{"observed_at":"2026-05-22T09:26:21.057550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4860.2872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"with CLIP semantic instruction","venue":null,"work_id":"2fec7839-bfd2-4e06-8258-41ff85d3bbe4","year":null},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:5000d4942914f723b584d6c35885c425a16c4a393154bef37999f0dce8b553e9","observation_id":"9726b270-0018-4994-b3af-627d55015f88","resolution":{"observed_at":"2026-05-22T09:26:20.732509Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T20:45:07.454387Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":23,"verified_fuzzy":15},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2605.21611."}