{"as_of":"2026-08-07T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:325ba005154cd37d6b3c8594be715a99212cccfc1bf5b4829728cf2c6d7067bb","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:45:11.810244Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09949/citation-record","integrity":"/paper/2508.09949/integrity","json":"/paper/2508.09949/citation-record.json","paper":"/paper/2508.09949"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:19.160880Z","title":"Cross-image attention for zero- shot appearance transfer","venue":null,"work_id":"cf205bd9-178f-4365-b6a5-01a2f697822f","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.514302Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:bcd5e2f37a6e57c214228e076e9751fc489502e7ade26f7ae23593d349256fe4","observation_id":"ea0e9fe5-1447-49a4-81bf-e1c267cba23c","resolution":{"observed_at":"2026-08-05T20:45:19.260996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.983269Z","title":"Sequential modeling enables scalable learn- ing for large vision models","venue":null,"work_id":"bab00e38-a7a2-44c5-8ee0-7b152b0f12c9","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.596299Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:3336e0f6cd5ace0ec8509e3251e2e90a12eac56c3e1a1dabc544e19a0e3a3756","observation_id":"4ea1ad37-8362-43e2-b517-aca312ee46cb","resolution":{"observed_at":"2026-08-05T20:45:19.059029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.810807Z","title":"Visual prompting via image inpaint- ing","venue":null,"work_id":"eb6b303c-ba51-480c-a02f-b115f99e0f30","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.653433Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:91c9b326c718aaf4281f61103fd9501267b7b627f16e81e7c6acf9c14ad7d6d9","observation_id":"0c78c0da-cb8a-450d-9ceb-40e3db54a21e","resolution":{"observed_at":"2026-08-05T20:45:18.879570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.649696Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"ae2e9172-b516-4268-b520-540b81c60e0e","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.727032Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:c1e0b16161d4ca1d4dc1c1e017401b95cbe1dd3fe6ce855048e45740421c9728","observation_id":"279f86f4-f708-4a88-972a-89722b9a1430","resolution":{"observed_at":"2026-08-05T20:45:18.714494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.491517Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"7f03822b-62d9-4723-8fe4-0986bf095bde","year":1901},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.783552Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f19b8111db82f821915eea13084f1578837cf2b1f557a0f8218f24cac42af649","observation_id":"1e441169-98af-43af-926c-38ff8468b4f1","resolution":{"observed_at":"2026-08-05T20:45:18.540437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.294929Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"e3a2ee30-a2e7-4b22-bd72-aec5db427562","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.843136Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:0223122de6ea96ec7014b4b6dafa84d33413956fbed4409027cd512fac652d19","observation_id":"ab96f64c-7e4f-47b6-bbcb-ef99c54e959f","resolution":{"observed_at":"2026-08-05T20:45:18.392573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.117373Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"3db0e7c8-9958-4d55-a405-152946b09ea3","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.920859Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:ff7ec2db9b4e35dbe762275e5ab7e72851639233284374353aad67a5ffc7024b","observation_id":"20da4964-ea57-4fca-96e3-d14d20015449","resolution":{"observed_at":"2026-08-05T20:45:18.194866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.908874Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"a2c7060d-be43-449f-9628-210412e61958","year":2016},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.986102Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:1f27234520be35900c0318c838aca498b224539476a41f8b2894f929a678ab72","observation_id":"a6019d4b-ae55-475a-a205-e86bb6897692","resolution":{"observed_at":"2026-08-05T20:45:18.005280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.812579Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"ae02cbed-9880-4e0b-89fe-a43700299e60","year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.078082Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:1b79990a96b1dcfeaaf1159d37d4874bdbb488aef60f2ea6bba39b31093cfa6c","observation_id":"a37b9586-9823-497a-b435-ef0d4c998b6f","resolution":{"observed_at":"2026-08-05T20:45:17.840449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.609565Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"673aa0fc-fd1f-4502-9f02-70cf6b3e2d58","year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.157184Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:bbc11c5104f306927d8f08f5b0c4fc4bf5b46caa80cec435349bf41818d072c4","observation_id":"fe7acafe-8409-4c76-a38a-6fefa71c9c5c","resolution":{"observed_at":"2026-08-05T20:45:17.711926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.430092Z","title":"Explore in-context learning for 3d point cloud understanding","venue":null,"work_id":"b514b046-159d-4ad3-ac94-5a76855d939a","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.221200Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:d8e30407ec99d98be04bfcba3b50f082a79fdd35d27e528ac242d7c73570ade7","observation_id":"92968a93-2f4c-4d58-866e-094b743fbdac","resolution":{"observed_at":"2026-08-05T20:45:17.523814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.255520Z","title":"Openllama: An open reproduc- tion of llama, 2023","venue":null,"work_id":"b727a552-119d-4f3c-8972-7bae705520b0","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.272090Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:610f986cab6816d614223e6af2c08fd52654a6abc8501c95b0cdca76d70fe2aa","observation_id":"bdb00826-7da4-4ba0-9f21-afa5a1913ce3","resolution":{"observed_at":"2026-08-05T20:45:17.333844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06336","last_updated":"2022-06-13T17:34:22Z","snapshot_observed_at":"2026-07-06T13:20:17.627012Z","submitted_at":"2022-06-13T17:34:22Z","title":"Language Models are General-Purpose Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.06336","snapshot_observed_at":"2026-08-05T20:45:08.328312Z","title":"Lan- guage models are general-purpose interfaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.328312Z"},"links":{"cited_paper":"/paper/2206.06336","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:84ee1b3a2647342dfbf0de5d8aa749fb32086327d5fd0c7389ead7ee28118f5e","observation_id":"0a76cdf3-950e-41c2-86d4-2c52527f4881","resolution":{"observed_at":"2026-08-05T20:45:08.328312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.048526Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"e12c2429-400f-4c33-9c31-6da9d112e1ce","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.399731Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:077239c565317ff6c3270f653379bac498e4a1acaf653227cbf7084c09c59ebb","observation_id":"3f09f22a-d9ee-4c88-abfb-07858b1c03c5","resolution":{"observed_at":"2026-08-05T20:45:17.143042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.898763Z","title":"Unsupervised keypoints from pretrained diffusion models","venue":null,"work_id":"5cbaa59d-ebfc-4b6a-82b1-11cf0c5d198c","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.476205Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:03a885952413faf1f5f587e4db8f3ae5e407d94f482bae5563b8f436c13bb6ca","observation_id":"e22ed390-084b-44ea-91cb-b7913bfe02e1","resolution":{"observed_at":"2026-08-05T20:45:16.981249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.742732Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"db755ca5-f6ab-4575-aba7-0a8feb41d4ba","year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.585457Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:e37589c9399477ab62fbed7e5b7772d4c1940336f78ed622dcc388da42d2812a","observation_id":"e14efd6c-fdb3-4f5a-881e-5ddbcbf6248d","resolution":{"observed_at":"2026-08-05T20:45:16.797606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T20:45:08.698082Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.698082Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f0f3d9625bddabe4de3ccd47eceb492667b4a59284333b438a894f7cc584f809","observation_id":"21b0b5c6-4357-4d7c-87a8-2d63a06ef7dc","resolution":{"observed_at":"2026-08-05T20:45:08.698082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.629386Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"6815002e-4520-4166-99b8-d860e0fb07d0","year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.762078Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:ac25858b371484df624b077d361f938dce8dc2df7baecdf30c2c674d26926b07","observation_id":"f1032768-867f-4539-a491-87c2d55c1be7","resolution":{"observed_at":"2026-08-05T20:45:16.700582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.423435Z","title":"An edit friendly ddpm noise space: Inversion and manipulations","venue":null,"work_id":"34137bb1-95d4-4bdc-a8e0-b96c4c01b9ed","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.820187Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:3268bd2e5d4b2df4974c5df0eea53afd6c531b995d837fc183dec8448b61980e","observation_id":"097e27bf-7126-4538-8307-7a9c084f15fc","resolution":{"observed_at":"2026-08-05T20:45:16.517854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.275357Z","title":"Fss-1000: A 1000-class dataset for few- shot segmentation","venue":null,"work_id":"4139d0d3-0b39-49f2-a399-d30b94b8c81c","year":2020},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.873462Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:699bc48592f4489968aae825c52c088051d2751e8b447ca28c33ac6732e8b1c3","observation_id":"e65fa974-f178-4267-b48a-ee822bf7af11","resolution":{"observed_at":"2026-08-05T20:45:16.356034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.123448Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"f43a3fb3-cc27-4e26-87b4-c74f6bea3af9","year":2014},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.938454Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:e9a621c8794dbca21a6d29860e6dc18a81c74bf790caab6318d6ea576897160f","observation_id":"ff2ed0fe-3963-4cfa-acfc-fb9a47cfdbb5","resolution":{"observed_at":"2026-08-05T20:45:16.187764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.927097Z","title":"Explicit visual prompting for low-level structure segmenta- tions","venue":null,"work_id":"14f5a3cb-5e1c-4461-b9df-3ad95b5ee189","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.036719Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:624903cf2844836301073a43b47bc44d0296fa305e4d64dab3fb8a6857fbc0ff","observation_id":"2d64a71a-81f3-4847-83dd-4cf2f1126cd6","resolution":{"observed_at":"2026-08-05T20:45:16.037748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.736831Z","title":"Instaflow: One step is enough for high-quality diffusion- based text-to-image generation","venue":null,"work_id":"3c979518-efcf-4c11-bd63-d4fc6620f4e0","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.124066Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f684565c43401097d37ee3e734f8b5abc81bd59f8756f6efc766e6bafc0f3afe","observation_id":"616c6738-5689-4846-bde1-91441c31a463","resolution":{"observed_at":"2026-08-05T20:45:15.817633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.552040Z","title":"Deepfashion: Powering robust clothes recognition and retrieval with rich annotations","venue":null,"work_id":"28026821-667b-4b3c-b814-4ea9214fe34e","year":2016},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.199623Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:748cf69d5c17717d30c4a83908d1e871d3311473622ff3e1cd2b2239d452ab1c","observation_id":"49ae3865-0d90-47ca-8dd0-929f6ed843fa","resolution":{"observed_at":"2026-08-05T20:45:15.617910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.417502Z","title":"Localizing object-level shape variations with text-to-image diffusion models","venue":null,"work_id":"137929e5-0a78-4897-872b-fabecc614344","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.275040Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:d31e65ab8cdda07d0310f6fa321a0b04ff3483e2308ce02564fc1b13c70a1974","observation_id":"a7669b71-d91c-4ddb-b930-23a48fd25abb","resolution":{"observed_at":"2026-08-05T20:45:15.473594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:09.388248Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.388248Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:0f5d235d885fdef0873d6a04f016a0b53e26ec46add66fb44a2d1414de311028","observation_id":"26bb486c-c1c8-4cf1-870b-acb41d9279cc","resolution":{"observed_at":"2026-08-05T20:45:09.388248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T20:45:09.443522Z","title":"Scaling language models: Methods, analysis & insights from train- ing gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.443522Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:97a77c4f7422a5c5016243ee774429d44afd3aee205f08133244b55b71127010","observation_id":"971880ba-b9bd-4a29-8caf-3a2ec646574e","resolution":{"observed_at":"2026-08-05T20:45:09.443522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.218065Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a782daf0-647f-47fd-8f53-aad8fec6fd64","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.528641Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:cfc4651ee0a8a0b02e469cb479e3a0fe3faa4eb571de3b05edb3dd9fb8da7a54","observation_id":"241695fd-c785-4c00-8cc9-d96f30560e88","resolution":{"observed_at":"2026-08-05T20:45:15.284617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.070472Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"d7acd51b-47f0-41af-a127-2d04b45250a0","year":2015},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.586460Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:cfe9057919a4fa563b664ef4be5de6d1eb244e25273f4fa3dd1797451431ecc3","observation_id":"d3ca2731-a12e-4c2d-8967-8821137393a8","resolution":{"observed_at":"2026-08-05T20:45:15.132089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.914621Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"295028d8-3141-4511-b51e-e21934f278bc","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.630964Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:2b1d47c7f145b743488d0fe70dd423b1141267bac2b4d0ba6e1d1697f28cf370","observation_id":"fdc02c7e-29c3-4394-8e00-7d38d771fc7d","resolution":{"observed_at":"2026-08-05T20:45:14.965749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.03410","last_updated":"2017-09-11T14:34:58Z","snapshot_observed_at":"2026-07-06T05:59:03.911368Z","submitted_at":"2017-09-11T14:34:58Z","title":"One-Shot Learning for Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.03410","snapshot_observed_at":"2026-08-05T20:45:09.687821Z","title":"One-shot learning for semantic segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.687821Z"},"links":{"cited_paper":"/paper/1709.03410","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:d92929aa6a40f60841b5208a4dfd7703dc6138c4c7285f798b46d26f68a419e6","observation_id":"beb072df-3064-489d-a413-a39b42bd99bb","resolution":{"observed_at":"2026-08-05T20:45:09.687821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.770712Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"1b7df1f4-574c-491e-b9c8-a7641cc0dcfd","year":2012},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.772103Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:ae39f66ed0a01a3d1fb26e46d7f999ecdfbfab912275a6ec6417a94c262bb06f","observation_id":"c8f21ec4-1925-4b96-8948-9823c16e68d0","resolution":{"observed_at":"2026-08-05T20:45:14.831772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T20:45:09.834456Z","title":"Lamda: Language models for dialog applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.834456Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:5b1a6c278ff6bf087347188faf5e771079a3ece9bf725ddc27339ed4bc7598db","observation_id":"2347fc21-f0c2-432f-aaba-ee081af82a43","resolution":{"observed_at":"2026-08-05T20:45:09.834456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.584803Z","title":"Diffuse attend and segment: Un- supervised zero-shot segmentation using stable diffusion","venue":null,"work_id":"07b0a79c-ecd7-4152-ae40-e6524912d4b1","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.900414Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:ecada24dd6d3b30387631d85c948e3704e0aa343196dd7b2a1ff65806a2fb6fd","observation_id":"23bf833b-62e0-4108-a269-a7dd2ae6e9c3","resolution":{"observed_at":"2026-08-05T20:45:14.658644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:45:09.978506Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.978506Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:646b144cff56f8b2a985b15cdc9df44cce1d61c9421ba2bdc001925e3b6ec0d3","observation_id":"923b9bb1-eafc-4abe-b358-85ada635f178","resolution":{"observed_at":"2026-08-05T20:45:09.978506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:10.059580Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.059580Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:407e8b45d54c7c673192032d4f66f175529664c1a38526107b50935d55e710ee","observation_id":"cb9f60f3-d965-4aa2-bb28-8fcc1c32aabf","resolution":{"observed_at":"2026-08-05T20:45:10.059580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:10.129900Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.129900Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:099efba56351742da51a89d0517fa2d3b18dfd5843a4233dbf455bd56f4c2a02","observation_id":"a0d20d56-4c9f-4965-a019-5c9ec8260765","resolution":{"observed_at":"2026-08-05T20:45:10.129900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.362202Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"6f17517e-3dac-45f2-b12b-d34448f0b210","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.206858Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:543b82506872a479083b92a05907e42b9d79c11800ca9553656b6ae41823d194","observation_id":"9de3235e-7d0e-4f19-8c58-7bede78fabf1","resolution":{"observed_at":"2026-08-05T20:45:14.460737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-06T11:42:00.456001Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-05T20:45:10.267368Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.267368Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:fc2170369cafdd0629279d3f17c67e62847b59ec0388421077e251c75612d101","observation_id":"d6743e03-b4d1-4a9f-ad12-21eb31c0a679","resolution":{"observed_at":"2026-08-05T20:45:10.267368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.030884Z","title":"Skeleton-in-context: Unified skeleton sequence modeling with in-context learning","venue":null,"work_id":"b825569d-7141-40a2-882d-d1cda2632bb3","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.361851Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:8ff1af6ae754dea19661efed9588227322fe5fe5081825fcaa29876a28066d6b","observation_id":"ea9b798f-32c4-4a78-b75e-c0e1fd9b19cb","resolution":{"observed_at":"2026-08-05T20:45:14.185823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.825010Z","title":"In- context learning unlocked for diffusion models","venue":null,"work_id":"a9dff6dd-4693-4199-a6e3-35239824cd03","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.441571Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:739e2af202931c0665a100a9c2fb2a0e710eaa1617db58d85809060884ece9e0","observation_id":"e35bfc9e-0305-4407-a16f-21226894854e","resolution":{"observed_at":"2026-08-05T20:45:13.929754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.414841Z","title":"Emergent abilities of large language models","venue":null,"work_id":"43e61a90-394a-41d4-9d1b-20858508ccaf","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.625430Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:cc24a955cf9602b5e455343ad7291702b67b9f7d760009e97ba2d79ad431c045","observation_id":"01c703b2-bea8-4173-874e-c1ffd15056a0","resolution":{"observed_at":"2026-08-05T20:45:13.481069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.223705Z","title":"Holistically-nested edge de- tection","venue":null,"work_id":"c51d618b-774f-4d4a-a69a-b551ae521790","year":2015},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.743864Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:7a3f3f371c355962561482ebcdbb1e1c696ec1979608dbb4754b601b4dd1adaa","observation_id":"baa751ca-64cb-49a5-bd05-07d8de37512f","resolution":{"observed_at":"2026-08-05T20:45:13.288223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01771","last_updated":"2023-12-04T09:48:29Z","snapshot_observed_at":"2026-07-06T16:56:30.128278Z","submitted_at":"2023-12-04T09:48:29Z","title":"IMProv: Inpainting-based Multimodal Prompting for Computer Vision Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01771","snapshot_observed_at":"2026-08-05T20:45:10.874525Z","title":"Improv: Inpainting-based multimodal prompting for computer vision tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.874525Z"},"links":{"cited_paper":"/paper/2312.01771","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:45e7a4674f40380409729729e04917398c7d50afd7af60b22c5acd4af65e1e0b","observation_id":"f585997b-c4f4-4bff-a58f-7d6ab1a7d75f","resolution":{"observed_at":"2026-08-05T20:45:10.874525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14867","last_updated":"2024-05-24T17:08:32Z","snapshot_observed_at":"2026-08-05T03:51:41.162350Z","submitted_at":"2024-05-23T17:59:49Z","title":"Improved Distribution Matching Distillation for Fast Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14867","snapshot_observed_at":"2026-08-05T20:45:11.013444Z","title":"Im- proved distribution matching distillation for fast image syn- thesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.013444Z"},"links":{"cited_paper":"/paper/2405.14867","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:994838ee1c8dacc7f3d8747c17a99881a41735026b4f17285317c9bafd61d95c","observation_id":"d8c56f9a-ba14-4fde-8add-e172b04bc932","resolution":{"observed_at":"2026-08-05T20:45:11.013444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.041615Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"061e357a-cbd9-4dde-b96f-0e67fc4b89c8","year":2018},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.193266Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:1eef2c8cdc89250c6d6bfe23c5f4e578560c115f238037f6315f529547c26eb5","observation_id":"46c9168b-3274-4100-ab56-7067f4fc9e32","resolution":{"observed_at":"2026-08-05T20:45:13.143015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.923033Z","title":"What makes good examples for visual in-context learning? Advances in Neural Information Processing Systems, 36:17773–17794,","venue":null,"work_id":"1ae1772e-757a-4ecc-a912-0ae2d48572a5","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.248935Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:fb59aa00df58fe797e85c11b62abffac836ac49cdffcbb7bff760e98a9f49f82","observation_id":"8a303289-20e1-4d0a-b51c-1dc3719dbed8","resolution":{"observed_at":"2026-08-05T20:45:12.966932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.772390Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"24f065d0-e08a-4411-b196-7a2c9e940c0f","year":2019},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.402783Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:aded35d623ae4af4aed5f0c17bc58c6521e64bd88291ef3bf065c571da86b5dc","observation_id":"bf780141-304e-4389-9986-410db0428342","resolution":{"observed_at":"2026-08-05T20:45:12.841015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.680860Z","title":"To accommo- date the different spatial scales, we apply Gaussians with smaller variance for facial keypoints, which are relatively finer, and larger variance for body keypoints","venue":null,"work_id":"97843a1e-5050-4127-a58d-9457b8950232","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.506721Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:09d97a16c439a6a0983750703ad86829addc3e0335097a0102a7c5c519c6198c","observation_id":"1a9829e6-0b1f-4825-9430-44fad156dbf2","resolution":{"observed_at":"2026-08-05T20:45:12.718357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.365538Z","title":"We compute the LPIPS loss and the FID score [16] between the original colored image and the colorized prediction to evaluate the perceptual simi- larity","venue":null,"work_id":"127bc7a8-01b6-4f09-affa-061f1d5580d3","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.654332Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:98087abec7b8d58ec6a17209d78ca13e75be235aa66085f2ac7f61513ea2a47e","observation_id":"d4e52e8c-3d23-41ad-9ca7-58450e1771b1","resolution":{"observed_at":"2026-08-05T20:45:12.512074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.165357Z","title":"LAION5B [30]) that span annotated, unannotated, and sequence images","venue":null,"work_id":"f66d42ed-ec7c-4999-b06e-10369c4771d7","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.810244Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:4d1eb42cb707bf32e0c72009ede89498f85c90432a8da1ad156e844c65d92bb9","observation_id":"405de464-d3f0-4a4b-aa9b-a4de4ef4bbe3","resolution":{"observed_at":"2026-08-05T20:45:12.222950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.602884Z","title":null,"venue":null,"work_id":"829843d5-6110-48cc-8efb-1de2bd9bce8f","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.502447Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f42674725365cc3640f8b6dbcbac287f6d26b1d89791d9364dde6dcfca9437e3","observation_id":"baf02844-f133-45ce-9239-b9f829f1ea4e","resolution":{"observed_at":"2026-08-05T20:45:13.707769Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T20:45:03.193345Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":12,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2508.09949."}