{"as_of":"2026-08-15T05:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:297ad183ade8a7969e524af2c706027f3000f867458854ea34db6057f0a86eaf","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:22:41.189820Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.20764/citation-record","integrity":"/paper/2606.20764/integrity","json":"/paper/2606.20764/citation-record.json","paper":"/paper/2606.20764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"One-shot gan: Learning to gen- erate samples from single images and videos,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:26b45722e2d47967018db299b2575875160a5b23dd65d02ff0406120e284e0d1","observation_id":"971ab894-c77f-4a63-8a20-be5ddc178ee0","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"Roadwork: A dataset and benchmark for learning to recognize, observe, analyze and drive through work zones,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:5733ba8fafb458d81c2edbaeb6297b8e7b6f63cd380080f7ea3791029a1b8a04","observation_id":"2c24b681-a9ea-45e8-92f6-67e6818d6003","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09618","last_updated":"2023-08-18T15:21:15Z","snapshot_observed_at":"2026-08-14T21:07:16.021877Z","submitted_at":"2023-08-18T15:21:15Z","title":"LaRS: A Diverse Panoptic Maritime Obstacle Detection Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2308.09618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09618","snapshot_observed_at":"2026-07-04T03:09:30.043421Z","title":"Lars: A diverse panoptic mar- itime obstacle detection dataset and benchmark,","venue":null,"work_id":"b77173df-a984-441d-af51-90850ff7e27d","year":2023},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2308.09618","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:b84384c816edb9d257e4b7b7e9a1aff860f8b06b089436055e8f328b60618e05","observation_id":"80e42bb9-c25b-44ff-97d5-f2ed659e8308","resolution":{"observed_at":"2026-07-04T03:09:30.046484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.356560","doi":"10.1109/tgrs.2025.3565600","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Srmf: A data augmentation and multimodal fusion approach for long-tail uhr satellite image segmentation,","venue":"IEEE Transactions on Geoscience and Remote Sensing","work_id":"2e105aee-f5f7-4a3d-815d-5fb2b54a83c6","year":2025},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:071c6056b06d6603706e1fa0b07a7a89c00afa875be252397a21e93a7d292562","observation_id":"0be012c0-84e1-4719-a1b6-69953c5f6c82","resolution":{"observed_at":"2026-06-26T18:29:41.375748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/rs15184539","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-tailed object detection for multimodal remote sensing images,","venue":"Remote Sensing","work_id":"a1181112-fd5f-460a-8a12-57181c4c86c1","year":2023},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:3101e3d463d5f50e5d075c34b9c70e56e38430c2ed67467986b3c4455017d438","observation_id":"aae15f54-5bdc-4ba9-beef-511a734d930b","resolution":{"observed_at":"2026-06-26T18:29:41.372959Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2600.2020","doi":"10.1109/cvpr42600.2020.000154","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer 25 Vision and Pattern Recognition, pp","venue":null,"work_id":"9da51225-b7bd-4032-b7db-ca577971dafe","year":2020},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:bb4d1967329561844dfce55ed96d8eadb3fd0fbabfc2d0bfeb1568a77f04bc69","observation_id":"ac6ac4ee-bfd1-4af6-8e22-bf42a745fd00","resolution":{"observed_at":"2026-06-26T18:29:41.378555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20074-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hyun Cho and P","venue":"Lecture notes in computer science","work_id":"6276be6f-d467-4e3a-b8c7-9e6f5533838b","year":2022},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:4d08351257eee9a2a25d9e834b3df07f697b9ef9a230429fc7dc2e7d0addba05","observation_id":"76b56d75-c241-4a17-b882-03e28022bc7b","resolution":{"observed_at":"2026-06-26T18:29:41.370630Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:09:30.074417Z","title":"Probabilistic contrastive learning for long-tailed visual recognition,","venue":null,"work_id":"eef8dd99-a8c5-4462-81a8-f8e975dfe6b5","year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:ff870f03e41a15cceebe8c4be2cd937cd5a3a905d349829984f0a6975fa8c6a5","observation_id":"bfc76c50-b774-4465-a9d3-7bb0e248f0be","resolution":{"observed_at":"2026-07-04T03:09:30.076435Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i2.27902","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled optimisation for long-tailed visual recognition,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"16445b00-f2e6-4e26-a1c2-265ef3886d05","year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:4b0e8db4c5d9cd0a95498a50b97d22b628c26f3f7a3e4b730ef798016c23fee5","observation_id":"a804ec5b-f13f-46db-a662-380ae5a06aa0","resolution":{"observed_at":"2026-06-26T18:29:41.380626Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:52:06.378685+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:52:06.378685+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:3888a1de195838602a9899fe6acf9c5eed39e201744ab87b72ec5eb1b6e5e8ec","observation_id":"be8c30c2-22c7-46a6-8cb4-8341c53b74eb","resolution":{"observed_at":"2026-07-04T03:09:30.079876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00637","last_updated":"2023-09-29T05:32:46Z","snapshot_observed_at":"2026-08-14T03:17:26.305151Z","submitted_at":"2023-06-01T13:00:53Z","title":"Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2306.00637","doi":"10.48550/arxiv.2306.00637","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.00637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"W¨urstchen: An efficient architecture for large-scale text-to-image diffusion models.arXiv preprint arXiv:2306.00637","venue":"arXiv (Cornell University)","work_id":"912235f7-a05e-4790-b99e-a7571f030e4f","year":2023},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2306.00637","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:09d4c7aa4303221b7c1c73f2447f64dafa0a5f98ffae19791b9823719ef0b877","observation_id":"20a27811-3f08-4254-a2c8-0816551f5c93","resolution":{"observed_at":"2026-07-04T03:09:30.089338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"Geodiffusion: Text-prompted geometric control for object detection data generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:c54ebb0ed3ed9fb89ad005e53197fb518e098f8c8c5187fe039c630796fd7e3f","observation_id":"b7670fc0-d199-432b-bb85-f706a002418a","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"Data augmentation for object detection via controllable diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:7211de8acaa00b1c4e459e974fcc4cd9d3cf67427dbc1d1858a9856435e341c1","observation_id":"81b76007-af42-4a58-95ba-56a193961444","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.363726","doi":"10.1109/tpami.2025.3637265","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"66be82e3-1510-49c8-8b1b-a43a2ff8b409","year":2026},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:4cc6ceac638fbb0c6ffedb6e49ddd1feed477dcc25ca8fcc253d5bf9ff72a031","observation_id":"3c8af3d5-b50c-4a0e-b497-e7d6a5a84b4c","resolution":{"observed_at":"2026-06-26T18:29:41.368543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:9633163afc3e4c501d381e8300ec996379485136449d2a1f3ccd10f73c94c836","observation_id":"a7bf10db-3965-469f-9212-8b0376aa8f1e","resolution":{"observed_at":"2026-07-04T03:09:30.076334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T04:54:45.415356Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":"2411.10440","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-07-04T16:59:58.575310Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","venue":"cs.CV","work_id":"a650e873-dbbf-4963-af68-3896dcd4975b","year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:cb41ca9e97fcc9a7b732b48b74c0d40deb6d9a303e136863deb685d19103cfd9","observation_id":"3b0c1a80-c527-431f-bf57-ae15519b9452","resolution":{"observed_at":"2026-07-04T03:09:30.080597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16500","last_updated":"2024-07-27T14:22:42Z","snapshot_observed_at":"2026-08-13T05:17:04.006853Z","submitted_at":"2023-11-27T13:37:26Z","title":"LLMGA: Multimodal Large Language Model based Generation Assistant","version":4},"cited_work":{"arxiv_id":"2311.16500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16500","snapshot_observed_at":"2026-07-04T03:09:30.053772Z","title":"Llmga: Multimodal large language model based generation assistant","venue":null,"work_id":"dbc28003-cd4a-4d8e-97c2-7efb302174dc","year":2023},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2311.16500","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:ffa0d6a70cec756e720d8fb277c042c03f267cc341bcb34bf5794d9665406137","observation_id":"0a55ebc3-dee9-46b8-b055-2a130ade9151","resolution":{"observed_at":"2026-07-04T03:09:30.056467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:09:30.069842Z","title":"Spatial chain-of-thought: Bridging understanding and generation models for spatial reasoning generation,","venue":null,"work_id":"cb44d613-c006-40c1-88e2-8009ba3637e6","year":null},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:79a75818e9d793e68b644fb066181531dd5996ca5815c7652ba7e6353eabc738","observation_id":"0c9ab60a-bee1-4891-ab69-5a7cc2753189","resolution":{"observed_at":"2026-07-04T03:09:30.072558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"Available: https://weichens.github.io/spatial chain of thought/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:f9e5b649faff60f6bafec782dcc3189422909fdf2911beeb80448d65e32cffbc","observation_id":"98e8b463-f5f5-4bff-a80e-9ffcfca3db71","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"From yolo v1 to yolo v11: comparative analysis of yolo algorithm,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:c2822fd8007d843dbc10054b5f5bd751cea8a47b2cbeee5dd82dde36b8606ec7","observation_id":"c3b08798-36fd-49f8-9dec-25f9d7daf527","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"Faster r-cnn: Towards real- time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:8cc6645b65640a763859c55a96faaef9a9a7e4018184b4ab900c620ea271e599","observation_id":"b2013627-a87f-4443-8243-1bb784ad43f6","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:996399690d0383766ff8709cc90a08a07b8da27068c5f31872eec0f7bdaa4d7e","observation_id":"31688ad0-6c4d-4802-a706-3ddbe872580b","resolution":{"observed_at":"2026-07-04T03:09:30.063735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:2946d5c26b13393e9d5b47287bd23e5d44ca0bf97165f216a327d079f9e710f4","observation_id":"e30dc27f-1a24-48a1-9ee8-bbe94d19a5df","resolution":{"observed_at":"2026-07-04T03:09:30.085409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:22:41.189820Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:91acfdebc343132f5600a7291994fb32a53b4f0f523f6d991f22976b9c3a7524","observation_id":"96b9b556-bfb7-41fc-b2c3-6bcba51f705e","resolution":{"observed_at":"2026-06-26T18:22:41.189820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2606.20764."}