{"as_of":"2026-08-05T23:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0384ed39e879701aa996cb67f2b10dc72c45580a8ab4fc5617a57d7c64d16f76","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:15:48.046423Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.16107/citation-record","integrity":"/paper/2511.16107/integrity","json":"/paper/2511.16107/citation-record.json","paper":"/paper/2511.16107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:43.561379Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:43.561379Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3f643ab578cf1369350f1ac9c9fd01f2a205dc32e7e169860a0e51ed8867a267","observation_id":"28cc01dc-8820-46e3-915b-38811a7d9e54","resolution":{"observed_at":"2026-08-03T21:15:43.561379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:43.632692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:43.632692Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3bad4dd01a5473014504010c052261ebbbc3a4ba89d564c6e863b491399d919d","observation_id":"e05665d2-dedb-4bcd-96a9-4d3dcf824644","resolution":{"observed_at":"2026-08-03T21:15:43.632692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:43.740549Z","title":"Fowlkes, Ste- fano Soatto, and Pietro Perona","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:43.740549Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:d454ba1d9d74d63355dd66304de31063879824354949e76a0507b775e8b1efda","observation_id":"ad298996-07d7-4aad-a32f-45c0197d4585","resolution":{"observed_at":"2026-08-03T21:15:43.740549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:43.789703Z","title":"NTIRE 2017 chal- lenge on single image super-resolution: Dataset and study","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:43.789703Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:9534dd8944fde940697d07bfb67908212d6963b9b1a7cf2ae59c79181ebfd032","observation_id":"cbc73e69-be17-4c88-987d-235fbe38c222","resolution":{"observed_at":"2026-08-03T21:15:43.789703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:43.845221Z","title":"Ancuti, and Christophe De Vleeschouwer","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:43.845221Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:e90d24e4c3b414ff4d7f6270dfa282a7dd47075023834b7b05fae5d547292fcf","observation_id":"7bf6fd37-55b3-406c-9817-51df7aef5cd6","resolution":{"observed_at":"2026-08-03T21:15:43.845221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:43.932541Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:43.932541Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:b1c48b38bcd92a93c9d2d72f2d85e9f80746305d82434bdb15cd3114cd9d6f2f","observation_id":"eb5b3e28-8234-47b6-81fd-3c4a806dea1e","resolution":{"observed_at":"2026-08-03T21:15:43.932541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.004358Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.004358Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:92adf3eafe3be88b90f70fe6e10f1f4e6fba32f0fca0bf71ae2ff6875a77dc82","observation_id":"b8c0e265-fee8-4971-ad9f-fac7562bc3af","resolution":{"observed_at":"2026-08-03T21:15:44.004358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.056904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.056904Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:d255695f0f59f427c550944d8cf544514daefd80d7a1d2875e0bbe6fe40be064","observation_id":"30f2fecd-ae61-46ca-b295-fe4bf9ed72d9","resolution":{"observed_at":"2026-08-03T21:15:44.056904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.151771Z","title":"Fleet, and Geoffrey E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.151771Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:e9f478ce0926f7915ffe22db03c9c6cd65549a8c3f7f12549012c5e440d25a83","observation_id":"02c556d1-acba-4d79-89dc-27849733a6c6","resolution":{"observed_at":"2026-08-03T21:15:44.151771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.220036Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.220036Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3595a65875bf814809cc2ceebaad458cf78429cc1b3eb665270bb6db5539c529","observation_id":"f48c2da2-5215-4fb5-a9b8-216c79953cd9","resolution":{"observed_at":"2026-08-03T21:15:44.220036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.267141Z","title":"Conde, Gregor Geigle, and Radu Timofte","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.267141Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:5792451bae85b49bbd350134a382fe7d01a971d5da8965a09c83a9c86e856cfc","observation_id":"1fda4edb-a382-4d55-90c9-9e7289bbc99c","resolution":{"observed_at":"2026-08-03T21:15:44.267141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10526","last_updated":"2020-03-20T12:36:30Z","snapshot_observed_at":"2026-07-06T08:17:20.450438Z","submitted_at":"2019-08-28T02:44:13Z","title":"Image Harmonization Dataset iHarmony4: HCOCO, HAdobe5k, HFlickr, and Hday2night","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10526","snapshot_observed_at":"2026-08-03T21:15:44.327675Z","title":"Image harmonization dataset iharmony4: Hcoco, hadobe5k, hflickr, and hday2night","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.327675Z"},"links":{"cited_paper":"/paper/1908.10526","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:af5e51967544b7b7baf2d495fb612dc3212eef1e770b0b69f613cd32ca15c424","observation_id":"dedd65a9-3cb9-4b54-80ec-392d16977c99","resolution":{"observed_at":"2026-08-03T21:15:44.327675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.379544Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.379544Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:768632be0935ba95e5a530b993e25612de6e5153a7e4c5f1905bfa79190a4c9e","observation_id":"bafd3f54-ebf3-4ae8-9b83-14d5250f73f3","resolution":{"observed_at":"2026-08-03T21:15:44.379544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.432405Z","title":"Representation similar- ity analysis for efficient task taxonomy & transfer learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.432405Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:4d5255a6e7e4529ab6f1a17ba094c5bb4dd03fcfea0c96f700bdecd50498a3ff","observation_id":"3397c0f9-b21f-4a9f-9c94-ef1a9ada6b65","resolution":{"observed_at":"2026-08-03T21:15:44.432405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.508829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.508829Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:ae8fe7a284850ec00064187e55535c640543c2be6437d44cea9210d9e2a4b8d9","observation_id":"72661d17-18a1-4816-8091-3798fdb59900","resolution":{"observed_at":"2026-08-03T21:15:44.508829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.596562Z","title":"Instructdiffusion: A generalist modeling interface for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.596562Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3f6eed29611e20f80fbc6259f758bb9a80753c60da85b39f317e32cf3b8217b3","observation_id":"ac818eb8-3eea-4060-986f-c7476f267631","resolution":{"observed_at":"2026-08-03T21:15:44.596562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.645302Z","title":"In-context learning in large language mod- els: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.645302Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:c13d913fb3a59b934ae526db1192428de93ccd2847c109c12a58635f9c60ffc3","observation_id":"aa9f8100-31d0-405a-9489-09ccdd5f34df","resolution":{"observed_at":"2026-08-03T21:15:44.645302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.736003Z","title":"Depth-attentional features for single-image rain removal","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.736003Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:4ac12ba2499a2f74b792fc4c12d27d3ca4393290f1c83e0726f0b40cbcd1fd44","observation_id":"1977744a-8b8e-4478-97e3-c93019014b04","resolution":{"observed_at":"2026-08-03T21:15:44.736003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.804254Z","title":"Belongie, Bharath Hariharan, and Ser-Nam Lim","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.804254Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:037da81bd95b69fee641a094f5edb3b23acbc0190476850f12730e16eaa02403","observation_id":"5e4da351-d396-4a80-898c-94053d21f4cd","resolution":{"observed_at":"2026-08-03T21:15:44.804254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.862806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.862806Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:36e39ec81f42b85169af2379ca803c964b6a407a8b75fd840c1555f37223b629","observation_id":"47959791-ac2d-43ea-b410-8b12081eb1c3","resolution":{"observed_at":"2026-08-03T21:15:44.862806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:44.959526Z","title":"Uvim: A unified modeling approach for vision with learned guid- ing codes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:44.959526Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3409b8d5241973c89ffc72751c60ccc559ceae1545e34aa92b4026e930a86607","observation_id":"7197528e-8865-4c55-a962-cea153970c09","resolution":{"observed_at":"2026-08-03T21:15:44.959526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.018624Z","title":"Viescore: Towards explainable metrics for condi- tional image synthesis evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.018624Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:6c202cf24ccd228c0daa0de89b6d926404dbc7877d5acf0f42a255f82c0d259f","observation_id":"c10bcbfa-7062-4328-8372-ae8fd975ed1e","resolution":{"observed_at":"2026-08-03T21:15:45.018624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.074204Z","title":"Transient attributes for high-level under- standing and editing of outdoor scenes.ACM Transactions on Graphics (TOG), 33(4):149:1–149:11, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.074204Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:1d00e13ea407e8f84c919327b6f39b14184ad06a328923570c200381123a1149","observation_id":"4297a91d-dec2-4dfb-ab27-109907b2221a","resolution":{"observed_at":"2026-08-03T21:15:45.074204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.148597Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.148597Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:5d3c1186de0d6e388e2769727e7214f919a4c1ea6e8c3d76e780a319de9d51b8","observation_id":"6654e740-bde6-4ed1-8771-c07b88371e69","resolution":{"observed_at":"2026-08-03T21:15:45.148597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.245867Z","title":"Large lan- guage model-aware in-context learning for code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.245867Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:45f250ad8ac4381065973daf256bfbe045817b73b6a9961bfe554fd07d0cd7cd","observation_id":"eb9aae68-33fd-4f0c-a762-5a757f05efcb","resolution":{"observed_at":"2026-08-03T21:15:45.245867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.319044Z","title":"Unifying image processing as visual prompting question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.319044Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3713ee507ed4a69dadf8fb0a97658a9f3059c84c14e7c10637df86a8ce88497d","observation_id":"0179b96d-1bae-4b4e-9b7f-0114cfeaa83f","resolution":{"observed_at":"2026-08-03T21:15:45.319044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.387266Z","title":"UNIFIED-IO: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.387266Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:f0ba83c577776e15c4b40e8cd23b58771591fdff9d926554840c76c0373dbb32","observation_id":"e5da5647-e731-4f53-ac1b-4c3a95dcc400","resolution":{"observed_at":"2026-08-03T21:15:45.387266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.461712Z","title":"Vi- sion language models are in-context value learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.461712Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:90ab0264b36dd7872bb2ff3f225668f9fb1c84a2512fa19787da1743eafabcc4","observation_id":"a0d16ea5-200b-45fb-acc8-003ba827f9b5","resolution":{"observed_at":"2026-08-03T21:15:45.461712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.510210Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.510210Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:73495e5e29b6cad96173fdcaccffa19a98cb5a34ca3c33fb358081860b8d6f06","observation_id":"cb23f0a2-d01f-46a5-a70e-71b911273863","resolution":{"observed_at":"2026-08-03T21:15:45.510210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.583626Z","title":"Deep multi-scale convolutional neural network for dynamic scene deblurring","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.583626Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:406e8379e821bfdbe7aa97ea0c72f1a5f022a64d7edc885b3a3330ca55278192","observation_id":"3cfc4889-8bfc-4c39-9965-172efbe9c667","resolution":{"observed_at":"2026-08-03T21:15:45.583626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18043","last_updated":"2026-07-10T01:02:09Z","snapshot_observed_at":"2026-07-15T23:17:32.409386Z","submitted_at":"2025-07-24T02:34:13Z","title":"GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18043","snapshot_observed_at":"2026-08-03T21:15:45.641226Z","title":"Grains: Gradient-based attribution for inference- time steering of llms and vlms.CoRR, abs/2507.18043,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.641226Z"},"links":{"cited_paper":"/paper/2507.18043","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:8836202d0c0c9e322cda513d65c2535974964dc0c1d90c69840a6e3a8a85a5dd","observation_id":"678ca0c8-c38f-4fe7-bc54-6f713fff697f","resolution":{"observed_at":"2026-08-03T21:15:45.641226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.725184Z","title":"Balasubramanian","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.725184Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:e13f82dcedbec0198be5bfe4904b4bc80788ab9988d9aad584df263577ac4b02","observation_id":"fa748d22-7bf6-42df-a122-31476a660873","resolution":{"observed_at":"2026-08-03T21:15:45.725184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.785859Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.785859Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:458ea59093777e046d7447f4c0f7d1f2371acbdf733d37af51afbfccf0be0e1e","observation_id":"8c3b158a-2492-401b-af83-b11e09f39a3e","resolution":{"observed_at":"2026-08-03T21:15:45.785859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:45.864189Z","title":"SPIRE: semantic prompt-driven image restoration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.864189Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:703bfd3c460ef6ddfe04005d28367db2a0f39da12862cb14dcbf070491fe8f0d","observation_id":"ba005813-f78a-48e0-ba8d-c53019c4f659","resolution":{"observed_at":"2026-08-03T21:15:45.864189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03082","last_updated":"2024-02-05T15:13:20Z","snapshot_observed_at":"2026-07-06T17:25:31.223077Z","submitted_at":"2024-02-05T15:13:20Z","title":"Visual Text Meets Low-level Vision: A Comprehensive Survey on Visual Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03082","snapshot_observed_at":"2026-08-03T21:15:45.940245Z","title":"Visual text meets low-level vision: A comprehensive survey on visual text processing.CoRR, abs/2402.03082, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:45.940245Z"},"links":{"cited_paper":"/paper/2402.03082","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:c2cde3507ff86d24d6fd0d569a7bf11a73c80a2bdc8de362bfec44b6568c37d7","observation_id":"a07499ed-7e28-4423-9e9d-7d43d9c3e33a","resolution":{"observed_at":"2026-08-03T21:15:45.940245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.011936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.011936Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:5d20aa0e8bb1b2c6164da7ff6a5bef09f99fde8fb734abb90969d554630ebf65","observation_id":"207b2e47-9340-48b7-8767-11b854b4681a","resolution":{"observed_at":"2026-08-03T21:15:46.011936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.079384Z","title":"Guibas, Jitendra Malik, and Silvio Savarese","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.079384Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:33e7f031ce2f767baf0a14cf3e52cff9defe5382b9543a2b9c485a6405a73b2d","observation_id":"cf765669-a146-415a-8ac7-bf6338b4576f","resolution":{"observed_at":"2026-08-03T21:15:46.079384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.155658Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.155658Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:c15c310fc8e25428a82bd1984824fa64c7d07a2cc3b251ce55ddbf4b1bbe1cde","observation_id":"8ea03b61-530b-4012-bfa5-3d966b8f53f3","resolution":{"observed_at":"2026-08-03T21:15:46.155658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-07-06T20:00:28.112838Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01824","snapshot_observed_at":"2026-08-03T21:15:46.208071Z","title":"X-prompt: Towards universal in-context image generation in auto-regressive vision language foundation models.CoRR, abs/2412.01824, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.208071Z"},"links":{"cited_paper":"/paper/2412.01824","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:47a5c3b7c01b7345d7f2640af398ae14fb9644e97055467a498e21af4af56588","observation_id":"bf4091d7-c1f8-4a74-b56b-357c74f87fa0","resolution":{"observed_at":"2026-08-03T21:15:46.208071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.256952Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.256952Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:2e9682ce02fa2d9276d368e786f0fae8b42ef797075340eaf10896b229adf75b","observation_id":"0dc6d36e-b72d-405a-b2fc-d2f5b7163455","resolution":{"observed_at":"2026-08-03T21:15:46.256952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-03T21:15:46.316714Z","title":"Chameleon: Mixed-modal early-fusion foundation models.CoRR, abs/2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.316714Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:01f14f72a525c45e07d43b80100d4e82e85d5b5572ee07eeb23f9c0424407b80","observation_id":"90eeabf9-f3db-4aa1-89bd-c17285ba073b","resolution":{"observed_at":"2026-08-03T21:15:46.316714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.388924Z","title":"A comprehensive survey of deep learning approaches in image processing.Sensors, 25 (2):531, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.388924Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:abf377ef099365d306b7d8ffd5f9c6a3ef654fbae84757bfdc112335b5208b1d","observation_id":"4b85c6e3-a3a1-46ad-bdeb-1df327130680","resolution":{"observed_at":"2026-08-03T21:15:46.388924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.453165Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.453165Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:4fa160f202dfd4605fca998a17996756c32f9a7a8babb5e2fb9e4ff0e048c2d4","observation_id":"229b67db-c76b-46d6-a19a-a3cf267ee381","resolution":{"observed_at":"2026-08-03T21:15:46.453165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.529451Z","title":"Stacked conditional generative adversarial networks for jointly learning shadow detection and shadow removal","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.529451Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:0c4effb7f0a845afd00a04428c9348627b12cbe79dde039b39510e46eeb844fc","observation_id":"ecc30141-159b-48d8-b24b-7de26501ea61","resolution":{"observed_at":"2026-08-03T21:15:46.529451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.579921Z","title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.579921Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:cc4ae2360cecb91454fd90ef9a8fb7dcfc345cfd2330be766a410e908ba81cf6","observation_id":"27b1c682-db7e-4ad9-9d35-8824d86c81b8","resolution":{"observed_at":"2026-08-03T21:15:46.579921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.634753Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.634753Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:834f0fb35d254a09f96cb9f449fc354d2df571d7859d8e7675addb429618bea0","observation_id":"34f364e2-02df-4a36-b3ad-8a792821a7d8","resolution":{"observed_at":"2026-08-03T21:15:46.634753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.689960Z","title":"Large language models are latent variable models: Explaining and finding good demonstra- tions for in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.689960Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:e3a9a030341ab2d853e0fb03ef34bb52ac85dfee8657e1f4a68e6561eba47955","observation_id":"820d4cc0-7a52-4178-91d8-4ae6e38852f2","resolution":{"observed_at":"2026-08-03T21:15:46.689960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-03T21:15:46.744566Z","title":"Emu3: Next-token prediction is all you need.CoRR, abs/2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.744566Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:3265d5eed65ea854abf895e3ec7a29974c071544eebda4f08673f351243e7104","observation_id":"9c86a16e-fa58-4310-847c-cef2c6081df0","resolution":{"observed_at":"2026-08-03T21:15:46.744566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.793661Z","title":"In-context learning unlocked for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.793661Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:380d5d25301d0041c42757cf80c5fefdb6932d0683048f5d597876d4672a96b9","observation_id":"ce5e4c5a-dabd-4d72-aac5-5342361ba74a","resolution":{"observed_at":"2026-08-03T21:15:46.793661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.844948Z","title":"Deep retinex decomposition for low-light enhancement","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.844948Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:b0c5c64d2cdaa0cd10a3c5acfde3b4baab2a0e79bc20ea0c95e825ab464885c9","observation_id":"01eb31f2-3bd1-41f6-a5a8-b9a5db72465f","resolution":{"observed_at":"2026-08-03T21:15:46.844948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.957592Z","title":"Florence-2: Advancing a unified representation for a vari- ety of vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.957592Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:e46d2b3c3978ebc2ad29f74d4c895e33170cb154b28fd37f677a128259140286","observation_id":"fe972cb7-c539-45b3-980a-ee39da3cef36","resolution":{"observed_at":"2026-08-03T21:15:46.957592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.015077Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.015077Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:fabd10fba694f0e41d68d19e9f1a4df32ae6296c5880219eed3d4fae9145d420","observation_id":"b4ab59c7-bf54-4621-a769-df361d11dcca","resolution":{"observed_at":"2026-08-03T21:15:47.015077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.085316Z","title":"Towards efficient and scale-robust ultra-high-definition image demoir ´eing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.085316Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:b74a31d2e3c7665644c2e84e9ffd9e6b29b1fb21c2759f268d61d3c7e641fd0a","observation_id":"b4b0403c-385d-4e5c-b232-bb8bb58551c5","resolution":{"observed_at":"2026-08-03T21:15:47.085316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.178044Z","title":"Promptfix: You prompt and we fix the photo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.178044Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:114b5e0d6f110a10e425a829ff35ecad1b2ba5ac7c84fddcf1b0ca4b665365e9","observation_id":"13c4481e-41f8-4bd2-b327-0c3cb4bf9bfc","resolution":{"observed_at":"2026-08-03T21:15:47.178044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.279237Z","title":"Zamir, Alexander Sax, William B","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.279237Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:45be41ede39e3cf14fa4e761251e44a7707edad8087954872d00cd43addd9da6","observation_id":"f026a556-cb9a-431c-9e74-ac672192f7f0","resolution":{"observed_at":"2026-08-03T21:15:47.279237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.389513Z","title":"A comprehensive evaluation of full reference image quality as- sessment algorithms","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.389513Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:ac1161596366767941d6399cd1cbe342ae2cedb6f440c3e362eca27a50432015","observation_id":"58cded30-3857-4cf6-8aef-1e96315c1b84","resolution":{"observed_at":"2026-08-03T21:15:47.389513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.491890Z","title":"Perceive-ir: Learning to perceive degrada- tion better for all-in-one image restoration.IEEE Transac- tions on Image Processing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.491890Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:64f342959eea34d49d501aebb723acf42f7d6911673954c66e6659502c5fbefe","observation_id":"298a173f-4222-4a55-b2d3-3cf425b47cd2","resolution":{"observed_at":"2026-08-03T21:15:47.491890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.600267Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi- modal model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.600267Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:e001200b98722440342d5731a7b9d6ba88f009e42d3130b25f3d67a203d3f5da","observation_id":"21f9beef-f07c-4655-abed-0bd42d236740","resolution":{"observed_at":"2026-08-03T21:15:47.600267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.707533Z","title":"Learning to prompt for vision-language models.In- ternational Journal of Computer Vision, 130(9):2337–2348,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.707533Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:c82068d67d79d44e16c2a20725669ae5c4d35471efd2e677f3ee49dacfdc3b07","observation_id":"49631359-3237-468b-8fa6-b2d38e3fb04f","resolution":{"observed_at":"2026-08-03T21:15:47.707533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.778161Z","title":"Seeing the unseen: A fre- quency prompt guided transformer for image restoration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.778161Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:10b6433b74e6a7c45fed492109b266d4cabca52fcdb4a9305b3a534a88640936","observation_id":"0f1bdd2c-17de-42f7-9ea8-7f98346f5fb8","resolution":{"observed_at":"2026-08-03T21:15:47.778161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:47.892191Z","title":"Visual in-context learning for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:47.892191Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:b164d708df9dfa15589425656b40f33d134e28a4e8761a6a124a061aa736eec4","observation_id":"b3dfca24-33d9-4f43-a878-d7c309e98f60","resolution":{"observed_at":"2026-08-03T21:15:47.892191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:48.046423Z","title":"Uni-perceiver: Pre- training unified architecture for generic perception for zero- shot and few-shot tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:48.046423Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:d20720d761de33f2e902c4803f270b165f6661269000a98fe0f8a4209965ad03","observation_id":"2d099f1f-78f2-4100-8599-1ec84cc60fc9","resolution":{"observed_at":"2026-08-03T21:15:48.046423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:15:46.877076Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.877076Z"},"links":{"citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:bae6521dff59ac5776baff25313d72675aa57494c17c9428ef66895c6c4f05b9","observation_id":"51033315-3767-4c82-bb7d-eed2d1292d07","resolution":{"observed_at":"2026-08-03T21:15:46.877076Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T21:15:42.824977Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2511.16107."}