{"as_of":"2026-08-12T12:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c38a4bbfdf6a8b713017a3ccf6deb5f185b7ab655eb519965974a09a86e542c","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:50:49.398206Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.01027/citation-record","integrity":"/paper/2412.01027/integrity","json":"/paper/2412.01027/citation-record.json","paper":"/paper/2412.01027"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T04:50:48.985145Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:48.985145Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:76ea833e52b8287503b93c04662a90e642a612bf091f1a8b3b9b53a44509b3d0","observation_id":"7e69f455-c992-483b-ab46-be8f0595c4d8","resolution":{"observed_at":"2026-08-12T04:50:48.985145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:48.990814Z","title":"Sequential modeling enables scalable learn- ing for large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:48.990814Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e67afd749b19a1fa9fb124a40d78b3c1c3159f8ad6ac37b5c863e44f9bfecea3","observation_id":"9d2f5915-d586-40de-a0e7-a41625d08de3","resolution":{"observed_at":"2026-08-12T04:50:48.990814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-12T04:50:48.995942Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:48.995942Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b2f7a61a8488d57ba3cba12b49214007d5b4ebff06079b4872989b46147d46f4","observation_id":"ae4f521c-72e1-4ffc-b918-45150b077c5d","resolution":{"observed_at":"2026-08-12T04:50:48.995942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.001081Z","title":"Towards in-context scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.001081Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:4a1850a9a46050fcdb6949d801a88af985c800cb6fa0d91db1e294bfb903ad9b","observation_id":"95e91657-7daf-4258-b0a4-c75ccbd95d39","resolution":{"observed_at":"2026-08-12T04:50:49.001081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.005923Z","title":"Visual prompting via image inpaint- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.005923Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3532287d93dffabb2e7fe1586541dbc1c6d80ac3a75faf59daf092e9bdffe34d","observation_id":"42e6cb1a-a23f-46b5-baca-f4b41ff54c40","resolution":{"observed_at":"2026-08-12T04:50:49.005923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.010710Z","title":"Ledits++: Limitless image editing using text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.010710Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:16464f86a46964aab8833afb453c60b6811e2dc2947e01a77b4d17c966fda460","observation_id":"d22faafb-1358-4135-8902-d8cf788066fb","resolution":{"observed_at":"2026-08-12T04:50:49.010710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.015800Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.015800Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:bfa873f8d9167196a0fe6a03af6da27b701ebf5bdbe31b676ead05371ed910d0","observation_id":"7a49f04f-0979-45c2-97aa-c8cc16113704","resolution":{"observed_at":"2026-08-12T04:50:49.015800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.020532Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.020532Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3f52635ad0d1e83d3aee07f59730b988a17c6b086825955b9a3c1174e73e085d","observation_id":"8130c734-becc-4001-bd83-1af3670e7756","resolution":{"observed_at":"2026-08-12T04:50:49.020532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.025163Z","title":"Enhancing diffu- sion models with text-encoder reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.025163Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:43016b19fe84cf22fed759ce8433d8d7a6b99ab68ed8925e58622f54961bda8d","observation_id":"1e7c3b91-4bd3-47f7-8d94-840bdca509e8","resolution":{"observed_at":"2026-08-12T04:50:49.025163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.029662Z","title":"Gentron: Diffusion trans- formers for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.029662Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:282e1839fceb4d174501add544ad5af5f512fed042058323d8fdf6786ae204da","observation_id":"1e27c92e-222a-4859-8811-1fca3d2f5128","resolution":{"observed_at":"2026-08-12T04:50:49.029662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.034521Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.034521Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c54ab4e37e62e35e0a6219bf868da7c444ec5dd315b36113e19202a50d3ae5b4","observation_id":"c69ae28e-a9a7-4e93-8545-cc077f0b27bc","resolution":{"observed_at":"2026-08-12T04:50:49.034521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.610439Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":"5d22106c-84ae-40f8-ac2d-44f09454ece2","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.039271Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c41f4fcdaf3b8a7adf8d20f05f9101c4a158a7a25023745bf355aeb0ad7acfdf","observation_id":"efc84018-8926-49cf-8f07-46fa309446c8","resolution":{"observed_at":"2026-08-12T04:50:50.615935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-12T04:50:49.043738Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.043738Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:9725c236622931d08bad5a517fab151cbb5f5aaa24daa7314fcdea99f766f96a","observation_id":"550ceb1b-35c7-4783-9eaa-5108a325a2e8","resolution":{"observed_at":"2026-08-12T04:50:49.043738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.593838Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":"aebb4153-1639-4981-af17-02e58b1bb9f3","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.048789Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d3a90027042f4c4b0f6f06370c4ef408fcdf3a8e3c0a68d4e1df4c41472e4e02","observation_id":"7c932f14-a5b3-4d0d-b046-20c3371e2a7a","resolution":{"observed_at":"2026-08-12T04:50:50.598952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.577851Z","title":"Diffusion self-guidance for control- lable image generation","venue":null,"work_id":"f510a143-1033-4939-a51b-70ed5ba8e373","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.053140Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:7d07b6ebd3c9797ceb546ee10c3f5a48a526dd554ca129c953e21b9f10cefb3b","observation_id":"da5df7ea-fe07-4d7d-8070-74cd828dd806","resolution":{"observed_at":"2026-08-12T04:50:50.582913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-10T18:55:01.793769Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-12T04:50:49.057722Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.057722Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:88e0151d0b293d70964247fd86980e3503d057e8b5690cb7df99f1f647c466dc","observation_id":"b22b22d0-667a-4dff-addf-8933ab823dab","resolution":{"observed_at":"2026-08-12T04:50:49.057722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13861","last_updated":"2024-10-21T15:42:46Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:57Z","title":"PUMA: Empowering Unified MLLM with Multi-granular Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13861","snapshot_observed_at":"2026-08-12T04:50:49.062861Z","title":"Puma: Empowering unified mllm with multi-granular visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.062861Z"},"links":{"cited_paper":"/paper/2410.13861","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:dcaa20904e7add3f44a3705be6b63ba0f311b6d3bc65d30e352169e69f94f0e6","observation_id":"e4aca15d-b16a-413f-9639-fba6578f3de1","resolution":{"observed_at":"2026-08-12T04:50:49.062861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.562632Z","title":"Explore in-context learning for 3d point cloud understanding","venue":null,"work_id":"19dd9f1d-ca61-428f-b69e-dd6adba551ed","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.067781Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d8394f9278fc33d17816947c0bd102ea8466b352ef2e3b660105228ce4d9fb8e","observation_id":"0978e7e5-8336-472e-ba08-de109ae41151","resolution":{"observed_at":"2026-08-12T04:50:50.567490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.546850Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":"42ee4e0d-4e53-4257-8702-ef50675719c7","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.072661Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:90ca865344cca5481dfab533dec6a8a2b9dddbeb53871f0e6f2ed1c07af427d5","observation_id":"02febbd3-042a-4d92-bd48-dc8c8dbdb870","resolution":{"observed_at":"2026-08-12T04:50:50.552297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-12T04:50:49.077160Z","title":"Seed-x: Mul- 9 timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.077160Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:6a4c502df452b102e3214e2d7cfa36e75841c59bf7a0f95fc468fc78250cb92c","observation_id":"16045736-77d1-47c0-ad8a-fc08cf5b5d08","resolution":{"observed_at":"2026-08-12T04:50:49.077160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.531010Z","title":"Analogist: Out-of-the-box visual in-context learning with image diffusion model","venue":null,"work_id":"348c5305-1949-4d87-bfb0-f9d67d521fa6","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.081903Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3e9325c2ad86cc957c23e68f02da9c5a0527d2bac0165b0b52f437f18dc5a9e3","observation_id":"22026619-52d2-4db6-b391-26cfe5f34d3d","resolution":{"observed_at":"2026-08-12T04:50:50.536033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11262","last_updated":"2024-10-02T22:33:08Z","snapshot_observed_at":"2026-07-06T18:31:57.866202Z","submitted_at":"2024-06-17T07:06:58Z","title":"Generative Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11262","snapshot_observed_at":"2026-08-12T04:50:49.086350Z","title":"Generative visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.086350Z"},"links":{"cited_paper":"/paper/2406.11262","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b22fee633d17154c04ada4c311d024cada58953fa8ff009d7c9a4079d0e279ae","observation_id":"2b57f07d-d7d7-415b-80c9-3d7dcee161b4","resolution":{"observed_at":"2026-08-12T04:50:49.086350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.091059Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.091059Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:91ddbc259637e713b2bbc84082b706cc414159cefe3f78a1474220884c19f63d","observation_id":"e5f45ef6-bc05-4496-9aa7-e15d5c82bc5d","resolution":{"observed_at":"2026-08-12T04:50:49.091059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.095686Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.095686Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:afc2741bca5a69c9b8124eb09191a7d95ebcb9e836b5f21b87b079b86a20a169","observation_id":"be9aea8b-b3e5-4294-b858-41363877f6b8","resolution":{"observed_at":"2026-08-12T04:50:49.095686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-11T16:52:37.936776Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-12T04:50:49.099961Z","title":"Multimodal task vectors enable many-shot multimodal in-context learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.099961Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f2d12c971328be2192adc5ec28cbfed501de21211f55dabdbfc998cae4894d7f","observation_id":"e06625a7-57d5-468d-8939-a0636341a180","resolution":{"observed_at":"2026-08-12T04:50:49.099961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01536","last_updated":"2024-10-28T17:02:28Z","snapshot_observed_at":"2026-08-11T21:02:38.493112Z","submitted_at":"2024-05-02T17:59:52Z","title":"Customizing Text-to-Image Models with a Single Image Pair","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01536","snapshot_observed_at":"2026-08-12T04:50:49.104649Z","title":"Customizing text-to-image models with a single image pair","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.104649Z"},"links":{"cited_paper":"/paper/2405.01536","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:5c4f4d23e3295c2808f9b9c1c88706926e11df1a67df00d75e0d343395b779e5","observation_id":"782fb5de-b79b-4345-9bcb-0a8a3b6f57dd","resolution":{"observed_at":"2026-08-12T04:50:49.104649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.496209Z","title":"Chameleon: A data-efficient gener- alist for dense visual prediction in the wild","venue":null,"work_id":"dfe04bb8-c475-41c9-8b01-170070e98d34","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.109457Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:7b76bcb962e1c104d8073879ef82c46bbacd4c6f50dfde35a4adb263f570055f","observation_id":"c42bbc05-7e5b-4236-9798-4f63002fa3af","resolution":{"observed_at":"2026-08-12T04:50:50.501147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.481018Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":"63f9b939-fb9a-4d41-a538-33b6b402fb72","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.113675Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c7ac8ed217ce1d1c36aa0570e385ba47dd8ca663d28e4c5c10b21a4ce5e8bfd2","observation_id":"b479fb83-eae8-4815-88a2-d4ab8d328711","resolution":{"observed_at":"2026-08-12T04:50:50.485953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.466075Z","title":"Lego: Learning egocentric action frame generation via visual instruction tuning","venue":null,"work_id":"c6852b08-3779-43bc-9509-28cb5fc88e7d","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.117972Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:ed68812dc11858a02b5742ae025099eea954f2b90e3930eaae0a72888184e481","observation_id":"7fd27ea1-e316-4195-bbd3-ef813be05d1e","resolution":{"observed_at":"2026-08-12T04:50:50.470763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.450744Z","title":"Blip-diffusion: pre-trained subject representation for controllable text-to- image generation and editing","venue":null,"work_id":"c2ab5bc1-d9d8-45bc-9900-f144ef345622","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.122498Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:349f2fe5bc3e2f27597a63c18a95a5a471628c7dd0590b7ce1ede5682b599a17","observation_id":"8e1baba4-8a6c-4157-8c46-199fd945edae","resolution":{"observed_at":"2026-08-12T04:50:50.455767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.435636Z","title":"Visual in-context prompting","venue":null,"work_id":"432d8827-279b-4231-89cf-e3a08ab30a87","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.126956Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:9d46206618bb521342421c0af92d6ad309fb73a11e95abf3c0e5c894aa5556de","observation_id":"6680440f-6d9f-436b-b973-f0161e47a795","resolution":{"observed_at":"2026-08-12T04:50:50.440485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.419737Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":"5597070f-ab33-4169-aeb4-991a8ef15d3b","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.131506Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d72c25ebbe868ffed719d4ffab8293149dfc8b8c40ff8b7f23c643b44332eef7","observation_id":"6de807b2-8fa7-47a7-ab82-3ec1cfa9b05a","resolution":{"observed_at":"2026-08-12T04:50:50.424744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.404378Z","title":"Visual atribute transfer through deep image analogy","venue":null,"work_id":"1db62425-686a-4383-8b43-61a3daf41386","year":2017},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.136146Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d479c25e46a378ee93119a2fd1082a28044a72fef608e3ff5d50cedb4c6ae09a","observation_id":"dbc1076f-ff8f-4905-a479-35d3bbbdacdf","resolution":{"observed_at":"2026-08-12T04:50:50.409154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.387865Z","title":"Text-driven image editing via learn- able regions","venue":null,"work_id":"b80f78de-b911-4627-9b14-93a202deb9af","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.140731Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:40fb2a58ded111b9a209f1753c1ad73713ae8ea823e88f623f3b3a40fa366749","observation_id":"341e4589-69d9-4d11-87f9-214e4e0fdfec","resolution":{"observed_at":"2026-08-12T04:50:50.393548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-12T04:50:49.145289Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.145289Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:bf5d8807743ed9fd68517ad68ff512502a9d75dad7acd6716a7f5066cbba14b1","observation_id":"3ca134d0-1df1-47ed-b85b-00d74882ee49","resolution":{"observed_at":"2026-08-12T04:50:49.145289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.371642Z","title":"Glid: Pre-training a generalist encoder-decoder vision model","venue":null,"work_id":"de6d2595-5ec3-495d-a9c7-c4d98cd4e249","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.150110Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:0265df3e0b3b1839bb5d48770f39b759edc84df3ac6063f1e5392389f7bf8776","observation_id":"1d50a909-574e-4428-bcc9-dbf2571601a7","resolution":{"observed_at":"2026-08-12T04:50:50.376543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.355857Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"ff335d00-5122-43f5-84d9-054a4a4f4084","year":2017},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.154472Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c72afa8779917ceb3fc379abc91315f9d9fa9853d6797925a9d2d522572057cd","observation_id":"990b57ef-10a4-4c2a-94c4-fcc155dc971c","resolution":{"observed_at":"2026-08-12T04:50:50.360890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.340356Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"b0abd553-781d-478a-9d02-0c236f2ef093","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.159126Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:fa8de765a44806c1845fa2cb8af965129bbd8da35de7aebe891f37a6e57189db","observation_id":"d04cfc0d-8b61-4f46-8337-7be81cf38622","resolution":{"observed_at":"2026-08-12T04:50:50.345267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-12T04:50:49.164789Z","title":"Star: Scale-wise text-to- image generation via auto-regressive representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.164789Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:2710190f0e567ded8f71c4292bf4d6a064923af6d73877f62c46e5a65b64b070","observation_id":"5a2dbbc2-3bf4-42ed-a432-57ed16b64da5","resolution":{"observed_at":"2026-08-12T04:50:49.164789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.324998Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"ae698091-8c09-4731-84aa-d0a7f5a6552a","year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.169597Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:18bfac9e0e6a1b0edfedf9e385b9d0b2cd83ca3c6a3eee6c267dd604228701c8","observation_id":"94eba859-1dda-4caa-81f4-cecbf18da7ae","resolution":{"observed_at":"2026-08-12T04:50:50.329938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.309278Z","title":"Watch your steps: Local image and scene editing by text instructions","venue":null,"work_id":"950001e0-9cb4-4a38-b1a8-61bf3b4c542a","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.174342Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:01c90f6478b853f333634b1b7faee1a722ab25d815ed12922079912a66424241","observation_id":"4d7e444b-6c78-4263-bf1c-57d946bbedc4","resolution":{"observed_at":"2026-08-12T04:50:50.314971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.178909Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.178909Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3ba97465ffd11c7f67cf07cd0e7be91e1ead32eda27074353f88522b869cddaa","observation_id":"6c227a90-fd98-4521-8a7a-606aad5a5a62","resolution":{"observed_at":"2026-08-12T04:50:49.178909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.283440Z","title":"Visual instruction inversion: image editing via visual prompting","venue":null,"work_id":"e71e3200-b693-498e-af2e-933ac266ebb6","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.183702Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:38571418956c82a2e854cfb20d5fbc5e2ff069d10788e04ef4300d7b808f04d7","observation_id":"ccb5e8b5-db28-4486-919e-66f675d78a5a","resolution":{"observed_at":"2026-08-12T04:50:50.288670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.188120Z","title":"Swiftbrush: One-step text-to-image diffusion model with variational score distilla- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.188120Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:34099b0a0d498e41d889de67c526cfc40f42d93e23b14af4e8a91dea59b4db62","observation_id":"77e8225d-7c1d-4ba5-b992-fbc5bbb713b4","resolution":{"observed_at":"2026-08-12T04:50:49.188120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-12T04:50:49.192908Z","title":"In- context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.192908Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:0e380f1ecba9717417896618cde2f399cb9aa588850643093ea9307509fbf194","observation_id":"5dc0784b-50d1-486c-acb5-ac55f5d3facf","resolution":{"observed_at":"2026-08-12T04:50:49.192908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.255596Z","title":"Editing implicit assumptions in text-to-image diffusion models","venue":null,"work_id":"de938b8d-5ab2-4f94-baec-06c654975ec2","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.197556Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:5d14cb605f372e09056dc4b21156d8d54c86a1499ca2a8f672685ddd5c372679","observation_id":"6f38064d-7310-4111-a58d-0d1f9968d45f","resolution":{"observed_at":"2026-08-12T04:50:50.260748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.239764Z","title":"Effective real image editing with accelerated iter- ative diffusion inversion","venue":null,"work_id":"01ea2105-b2b6-4e5a-af2f-b20dbe9fe104","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.202106Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:46f4b5b5b1364004e28afbadf4626bba10cb312049f7ee990e914eae55386697","observation_id":"c1c4d7f9-2ec4-40e2-b938-2aa0045c72af","resolution":{"observed_at":"2026-08-12T04:50:50.244675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.223432Z","title":"Precisecontrol: En- hancing text-to-image diffusion models with fine-grained at- tribute control","venue":null,"work_id":"52f30ebc-51ae-4572-8f06-aae23930be9c","year":2025},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.206707Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cb43009ffd9a3fe9942607dadebdf54a34d885e1dccd5cbf0e3eda722808037d","observation_id":"61b9e750-79d9-442d-ab5b-15f9306eeb80","resolution":{"observed_at":"2026-08-12T04:50:50.228279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.208020Z","title":"True few- shot learning with language models","venue":null,"work_id":"0250ef2f-ca6c-4b2f-b99f-25e8ce1e5336","year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.211022Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:7082cb821605c2014ba144ecdead78abbab3931215a8516a963a9b5ddd6950fe","observation_id":"6f51dc45-e4e1-46f9-be90-46257cbfcb66","resolution":{"observed_at":"2026-08-12T04:50:50.212993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.192064Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"eb449cab-4c55-4fff-bf71-47f22dc7e1db","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.215637Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:5d010488ae79f9356d421255a19193a36401783203da64827a4270c9d7313852","observation_id":"d09ed24f-437c-4b2a-bb06-4cbe5fa00ce2","resolution":{"observed_at":"2026-08-12T04:50:50.197379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.220494Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.220494Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3c74a917aa39c756bf915f10538ff2d566637daa374f7176657382daab9e1bdf","observation_id":"5f95d10b-3589-4797-817a-56ad676ca7e0","resolution":{"observed_at":"2026-08-12T04:50:49.220494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.225121Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.225121Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:13969097324abccab607d28ff1664e175756cdf8584e5e0a3c403ef44f51677d","observation_id":"f2811d2f-f15d-4fdf-9682-c18b7ecaf352","resolution":{"observed_at":"2026-08-12T04:50:49.225121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T04:50:49.229740Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.229740Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cf3d594799800081afe89444e747e6cac33e9eeb968fa981052f9200960bc994","observation_id":"dff739f4-a601-4e43-8cba-790e15407c08","resolution":{"observed_at":"2026-08-12T04:50:49.229740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.234585Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.234585Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:384e2a80875ef38bf335e2dacc4dfd25f56abbcbe6db1b19dc29b9b184e54ec6","observation_id":"1d16b7d2-e0b5-42c5-9c07-e62aec1fb9c7","resolution":{"observed_at":"2026-08-12T04:50:49.234585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.239163Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.239163Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c02da02553a9db614fbb92a7b7136ab66e257acd4e72908ea9fca8448c4b669c","observation_id":"ed47628d-45e0-4c27-9934-2039ed92315f","resolution":{"observed_at":"2026-08-12T04:50:49.239163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.137062Z","title":"Towards more unified in-context visual un- derstanding","venue":null,"work_id":"36aa2429-bdf5-43c4-a1c1-d46995965d24","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.243734Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:57d791be7164f0c628a744bd5023aec02eeb8d6394614588d7c0529c945c4b3a","observation_id":"b029c63b-4561-4006-9a52-1c8300393e3b","resolution":{"observed_at":"2026-08-12T04:50:50.141887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.121585Z","title":"Emu edit: Precise image editing via recognition and gen- eration tasks","venue":null,"work_id":"3bda2601-7e60-47cc-ab8f-e0241887a2a3","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.248312Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:5c9002930235236454e1bad1dddd08e9a52eb01524fa6c594611ccda1ae7fd93","observation_id":"bed095a8-98d4-401c-a9ea-37c7e6087eeb","resolution":{"observed_at":"2026-08-12T04:50:50.126573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.106794Z","title":"Diffusion image analo- gies","venue":null,"work_id":"9fcdeff9-96f4-4955-bf16-31898f944c82","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.252807Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:1378f14c9c6832f811dde9db9c1229be4e663d98c8b2fb0ee50d3f8ecf891de1","observation_id":"c5eba021-39b3-46fa-a73a-2238c59c071e","resolution":{"observed_at":"2026-08-12T04:50:50.111422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-12T04:50:49.257448Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.257448Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e1681788341a8ea20f0f6ec72bc9e20959e3f8230c454b1240f06bda7f3628a2","observation_id":"cc3b2b50-102f-47c8-8c2d-aebe6a17deb0","resolution":{"observed_at":"2026-08-12T04:50:49.257448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.091831Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"b5660b6a-4b84-46a6-8e25-70eb6f1ec2c5","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.262189Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:0213589abe85d6f48784991a52f5a3b2a6f27b10ca6cff7dcf74ae02675da34a","observation_id":"5aef0648-b7cb-447d-b6b1-6cae5e0746f9","resolution":{"observed_at":"2026-08-12T04:50:50.096723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.075541Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"0e3123d1-7f18-4aa3-9b47-aec247def0a1","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.266610Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:32f82077c6feadc4d3832594f524f9f73cb01284ebed7293153770c817c7a1b2","observation_id":"dc8e0ac2-4975-4b76-8973-798f14f1054c","resolution":{"observed_at":"2026-08-12T04:50:50.080487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.060423Z","title":"Imagebrush: learning visual in-context instructions for exemplar-based image manipulation","venue":null,"work_id":"70893f9b-73a3-42a9-8f7a-fbf5e8a45ef7","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.271112Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:513a08402c6d9aaf37b683434688fab6bd03b033cfa70934c65489ec035a2049","observation_id":"f09ff6ce-4aba-4aa8-b7c7-a14a61329b2d","resolution":{"observed_at":"2026-08-12T04:50:50.065599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.044774Z","title":"Rethinking and improving visual prompt selection for in-context learning segmentation","venue":null,"work_id":"25b5e235-90f8-44b3-a3ef-eebf20b732b6","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.275744Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cd4d32c86fc8381f08f22f9aaf89c3c23a39cf458a6523e07c14987f03152913","observation_id":"2cd2823c-4bb5-486f-8f16-e4e0ba6f4c13","resolution":{"observed_at":"2026-08-12T04:50:50.050054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.028506Z","title":"Cognitive load during problem solving: Ef- fects on learning","venue":null,"work_id":"1f030d05-9a61-4ab5-9504-bf652af84d63","year":1988},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.280195Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3f1f6339f3b098709f0c808e3de288c0707d2826f1134618fed0e49e0cbc1b15","observation_id":"9d92ecdb-2ea9-4f87-ae6d-f81c3459b945","resolution":{"observed_at":"2026-08-12T04:50:50.033456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.013033Z","title":"Codi-2: In-context inter- leaved and interactive any-to-any generation","venue":null,"work_id":"b13346ea-0f3f-4d8c-a348-eafd7b30d3f0","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.284699Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cbfc8842d13e3ef5c562eed39840f946ba9c7ab6339fbce89774439649172469","observation_id":"1f9602eb-e4d2-4d8a-b9d5-c1c61eaac87b","resolution":{"observed_at":"2026-08-12T04:50:50.017976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T04:50:49.289474Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.289474Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8aef52027a76f85837909817bbaa10dfc5c6eb7415e67154eb3ccfd59052469d","observation_id":"1957869c-cf8d-4da1-b66c-63aa5d54a2cb","resolution":{"observed_at":"2026-08-12T04:50:49.289474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.996942Z","title":"How to grow a mind: Statistics, structure, and abstraction","venue":null,"work_id":"6a946fc5-b68e-4c55-a0fa-a42066848349","year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.294581Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8ad0233f8ed71fdc2877d347d298418fdd6ab5049d7e643c275fa46160785188","observation_id":"b9d81c44-c1b1-422c-ac07-1ce507fa7d5d","resolution":{"observed_at":"2026-08-12T04:50:50.001965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.981048Z","title":"Visual autoregressive modeling: Scalable image gen- eration via next-scale prediction","venue":null,"work_id":"f0a2596e-6c5e-4d44-b9b2-123d19cfe8d5","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.299257Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:a947deab9fcb5c0c2809561c6dff302fa992d27c514d155c5b849f181f647820","observation_id":"2e155071-68fc-4fc6-9c3c-0fb851ccc12d","resolution":{"observed_at":"2026-08-12T04:50:49.985962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T04:50:49.303712Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.303712Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:2298cd25f95ceb5d0c4c5310518af58f0b35c2efd2332e1ff5d2c7a43b4d7a9e","observation_id":"7c8a8970-2b8f-4d8b-8592-aa571bb076a8","resolution":{"observed_at":"2026-08-12T04:50:49.303712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.966053Z","title":"Edict: Exact diffusion inversion via coupled transformations","venue":null,"work_id":"41e3b5aa-1f39-4cb8-ac16-c05ff3a32e49","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.308288Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f434b9594de5d019ffce210d3e974b2f1c778160a2bef859901de0c634e82182","observation_id":"b9840747-8159-45c9-b350-76927afe851f","resolution":{"observed_at":"2026-08-12T04:50:49.970856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09616","last_updated":"2025-03-09T11:58:01Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:52:31Z","title":"Explore In-Context Segmentation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09616","snapshot_observed_at":"2026-08-12T04:50:49.312831Z","title":"Explore in-context segmentation via latent diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.312831Z"},"links":{"cited_paper":"/paper/2403.09616","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cb5200ee4743d30ed8e0254a5d149e3b2d05e751167ca9bc4700fb3473db81ac","observation_id":"7fb96bbf-4a92-49ee-a45e-24395db5a77a","resolution":{"observed_at":"2026-08-12T04:50:49.312831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.317769Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.317769Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c6b22461e80f53cbb00fcb3612962f1b189bb8e7d8ea96e37bd7ed0d2899e5ac","observation_id":"c3e57cf5-eebc-4bb1-a4c6-e553d7fa561f","resolution":{"observed_at":"2026-08-12T04:50:49.317769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.940807Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":"3d83d9c3-d980-4dd5-8d7f-8c36a12d7c55","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.322422Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c4ba44af8b972bea4db0a65aaf12c2b9e696c977d8c2d9ce68426e4fe7fc4a04","observation_id":"33a61fbc-7a86-473b-a7ac-a61bddb8f924","resolution":{"observed_at":"2026-08-12T04:50:49.945690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-12T04:50:49.327105Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.327105Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:4f99beaf68df374442af8b5499e502ebf36ba4ce3bcc8edadb00cbf199be06da","observation_id":"2c0cfb8f-7b2a-4747-ad94-f0d3891f471d","resolution":{"observed_at":"2026-08-12T04:50:49.327105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.923963Z","title":"In-context learning unlocked for diffu- sion models","venue":null,"work_id":"f6eb1efb-119d-4b1f-80c8-47564a8afbd5","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.332100Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:db0e2b230005211eebf6fd18934ec2449441f67d374976d8f3d3aba8b763b429","observation_id":"3999a648-31b7-4ea8-8165-4f370addb7fd","resolution":{"observed_at":"2026-08-12T04:50:49.929550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.908166Z","title":"The learn- ability of in-context learning","venue":null,"work_id":"6d55f262-1c63-45dd-857e-37b1470b79b3","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.336569Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d3f03ada5afd343d01a9379efac5c5cc494c23868dbafe9b518f519da76b13d1","observation_id":"8dd952f5-0926-4001-a046-19c665053bf9","resolution":{"observed_at":"2026-08-12T04:50:49.912859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-10T11:21:08.205918Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-12T04:50:49.341022Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.341022Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e5a22852815410f6b6752aac8226ea7a32af74f1da819d34c899f978913e30b9","observation_id":"5566c6a6-e839-49b2-853b-3f927c3c0fa1","resolution":{"observed_at":"2026-08-12T04:50:49.341022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-12T04:50:49.345818Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.345818Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:bca43fe15ec2eac6a9fc2f35923c44c7efbbc0d8fb0f565dc24c3dc7866cbaf7","observation_id":"d7961126-1edb-46f5-88ce-2ef177b4b95b","resolution":{"observed_at":"2026-08-12T04:50:49.345818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.892839Z","title":"To- wards global optimal visual in-context learning prompt se- lection","venue":null,"work_id":"a1431709-a294-4842-91de-b624241a55cc","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.350813Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:58e95e47020555642084c6a12ba04502adc7c64884d4d94b0ef53a46ccac5e33","observation_id":"1e10c7fc-137b-467a-aea1-660224a9b7f0","resolution":{"observed_at":"2026-08-12T04:50:49.897644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.877238Z","title":"Improv: Inpainting-based multimodal prompting for computer vision tasks","venue":null,"work_id":"97c2d6d1-fc53-4659-824d-0b189aeb163a","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.355291Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:2e5825f20c09000524f1e3b4c97e0469da722e9ee5658e47eaadcdac5ba33af0","observation_id":"a35469e6-92ec-4cb9-9e69-aa868b5fec94","resolution":{"observed_at":"2026-08-12T04:50:49.882072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.861693Z","title":"Prompt-free diffusion: Taking” text” out of text-to-image diffusion models","venue":null,"work_id":"6ec0d2ae-5f21-4952-be29-155ffc6ceaa3","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.359799Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8f6010012540a2d8ea354dd41d0fe224d24ffee39157baef30a9b6c5a4b940a0","observation_id":"34e43b7a-a490-4f44-87bb-17f9d9b94885","resolution":{"observed_at":"2026-08-12T04:50:49.866525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-12T04:50:49.364318Z","title":"Anygpt: Unified multimodal llm with dis- crete sequence modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.364318Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:012bd2f0f3b0800f350942fd03911d04d1d0c1d21323bf42075592b41ee4dd4b","observation_id":"d883f07f-3acf-4ee2-83ae-83f1320fcc67","resolution":{"observed_at":"2026-08-12T04:50:49.364318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.846440Z","title":"Magicbrush: a manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"3d2e634b-c7b6-41c3-9958-aa2a52ff0eb9","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.369597Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d66b1deb5c39a1792fb04c69bbca7481eb79c25fe21b96041422bfb501791155","observation_id":"409eb0b5-e82f-4c9b-91aa-d84bfe430e23","resolution":{"observed_at":"2026-08-12T04:50:49.851446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.374025Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.374025Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:057d3f7c6bb5e7bf26afc1b89ea8e975b059e5400fda25748a847cf6335e29cc","observation_id":"9b9caa51-1566-411b-a6cb-ca3cfa8ee9af","resolution":{"observed_at":"2026-08-12T04:50:49.374025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.820569Z","title":"What makes good examples for visual in-context learning? In Proceed- ings of the 37th International Conference on Neural Infor- mation Processing Systems, pages 17773–17794, 2023","venue":null,"work_id":"1928f0d7-ebe3-4820-ae94-a80325e67a79","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.378517Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f0b16a194c31b47d2ebd2e0c9e622b6c330bfc28d67bd70e6e31bec536f74dae","observation_id":"338b89d5-f98c-44bf-8b3f-3f69f603271a","resolution":{"observed_at":"2026-08-12T04:50:49.825502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18660","last_updated":"2024-03-27T15:03:38Z","snapshot_observed_at":"2026-07-06T17:52:00.714976Z","submitted_at":"2024-03-27T15:03:38Z","title":"InstructBrush: Learning Attention-based Instruction Optimization for Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18660","snapshot_observed_at":"2026-08-12T04:50:49.383104Z","title":"Instructbrush: Learning attention-based in- struction optimization for image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.383104Z"},"links":{"cited_paper":"/paper/2403.18660","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:054ca6844fe40a1b92a52ddef627622e21c7cbf4fd993b38ae58ff9a7e748e5c","observation_id":"cc003e2c-a4eb-4b79-81de-68521e201cc2","resolution":{"observed_at":"2026-08-12T04:50:49.383104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.804612Z","title":"Calibrate before use: Improving few-shot perfor- mance of language models","venue":null,"work_id":"f452659d-2a76-4ccb-bf43-584b81385d3d","year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.387913Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f2c0d4c6d56c173c43bbd85ff412e47bd9e09eae2ded4d86267c4d16226ddee8","observation_id":"6e70062c-9bd1-4171-859c-82d4f202e702","resolution":{"observed_at":"2026-08-12T04:50:49.809961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-12T04:50:49.392554Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.392554Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c5687b9a21c0a6ce032660c9f3752a315778be16095eea991ec8109158366e6a","observation_id":"af8c770f-4c1f-4ab4-9229-7a16fef69820","resolution":{"observed_at":"2026-08-12T04:50:49.392554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.786788Z","title":"As a baseline of text-guided image editing model, InstructPix2Pix is trained only with textual instructions","venue":null,"work_id":"387a2a78-7fbe-4604-8102-41fe01f09a30","year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.398206Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f6744bb4c0a7a4a1ce300ff4c2b1de99844983aaf1e04b5d34350ee51ba77d8a","observation_id":"63076f3f-b888-4aae-8263-6352e5166f4c","resolution":{"observed_at":"2026-08-12T04:50:49.793577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:43:31.620540Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2412.01027."}