{"as_of":"2026-08-06T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70f0b9b2a0bf6d732a9455c50404032d80f026b3f3d53dd9bc637cc3a15eb094","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T22:50:24.053411Z","state":"measured"},{"denominator":138,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":138,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":80,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:23:35.324565Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":188,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T01:17:58.678036Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2303.11381"},"observation_digest":"sha256:7c2a58d14aee1f0e5069b3e307a8c8c35d7c1231b574bf84599b1e85a47663f9","observation_id":"5c680498-cd2e-449b-a239-52f49807e8f9","resolution":{"observed_at":"2026-05-14T01:17:58.826194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T13:20:25.535603Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:fc2db074e042ce27493d9877f90c4f45fc3ff458a22db81d9c9555b788058bb7","observation_id":"31e91514-1fa1-4803-9b41-9ad3b1123be6","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:8454df7e75ff9717f9ea6a240c1c125c3b27a1e5ec7aa99bdec678055a0c5e42","observation_id":"8d468bce-53a2-40b5-a63e-720b491db788","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T20:37:01.617345Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2304.10592"},"observation_digest":"sha256:7fa22bcefb158acf1440e2cc4795c50ce9f4ecd4b29d24d439843b7f91f034ad","observation_id":"d35ff2ac-d4c7-4a1f-9534-8e9292a49e7d","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T08:41:04.743886Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2304.15010"},"observation_digest":"sha256:15a802fcf9a1416db45f9c843795f6d8548e83e4b12b041ce03fabfb88ad76cc","observation_id":"e7c36291-f5cd-41e0-a187-d197b380e0b7","resolution":{"observed_at":"2026-05-15T08:41:04.849759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:ef4852eaf749225a9c6f9f531ef6047d41731c1a8e5c0c34c6451101e0e523ba","observation_id":"71cca06b-0916-4d52-a063-8629de8e0e6c","resolution":{"observed_at":"2026-05-13T23:30:00.663677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2305.18323","last_updated":"2023-05-23T00:16:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T00:16:48Z","title":"ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T18:15:55.525596Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2305.18323"},"observation_digest":"sha256:03eb12692bfe1c659d14d57a1a799fc1256a3d8d9ff0343e10b42261af3c1bf3","observation_id":"3b82b836-23d2-42e9-b7b9-e5b2083f42e2","resolution":{"observed_at":"2026-05-15T18:15:55.711045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:df8f487169524589f30e34dbe0d683244cd8805b3ce48eb3e760da87217aefc0","observation_id":"cb64f6e6-214d-4d3a-89dc-b5cec4a84416","resolution":{"observed_at":"2026-05-16T02:56:42.180990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":289,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:47e19cb453b43fcfe1a2ecebbf5176a5b072fe0d2259e5d5626cc4ef94d2a546","observation_id":"17df00cd-8389-4405-9147-d8a400f4c766","resolution":{"observed_at":"2026-05-19T20:28:39.272777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:ebd652a8fd021ad1f16fd9a246a9dd368878e09415d5ef80a2f275dd9c5ec9bb","observation_id":"b6ca3b5d-d479-4254-8eb8-4388c5c98b86","resolution":{"observed_at":"2026-05-15T23:26:06.435149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T14:01:49.854238Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2310.11441"},"observation_digest":"sha256:c4ed9a4515f6241bec863e6dae9a3c1c35660165f5fd02104f0d5029e0abda91","observation_id":"637c4a68-9021-401d-afb6-e9bf10c27473","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T03:03:26.723464Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2311.07575"},"observation_digest":"sha256:d74e8c132cdeb88df7d54d78f3457568440edf4fcd175b2a329135e27ca81528","observation_id":"a537c30e-4c9c-4876-80ad-a12fab1c960c","resolution":{"observed_at":"2026-05-17T03:03:27.012613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-14T18:08:01.166072Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2311.10122"},"observation_digest":"sha256:27b1e77e119fda38fc6983bb277ed6423f62891a3f651d9bdd1262d0ed581e1c","observation_id":"02ef4b95-ed54-4784-a2bd-5d92a1e68b0c","resolution":{"observed_at":"2026-05-14T18:08:01.311610Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-12T15:46:03.247029Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2311.12983"},"observation_digest":"sha256:2c67034c1b16582258ae4a7916dd1cf833cf9aad2d66ade05096e44f06ded499","observation_id":"e44ea933-e0f3-481b-90aa-2e7a407cb552","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:82b999030228eac5ff0bda9c232f240df01db355132972c01a9adf90c6b452c5","observation_id":"588a3070-2ebf-4c2e-8552-060c1c9f93ae","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T06:20:15.656356Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2401.14159"},"observation_digest":"sha256:fd6f8d30fead27154d2ce3992a854c86c3b805dd06b4066e9df0fb35993fa74a","observation_id":"5ff7fa79-856a-47f9-a33e-6eb4bc6ac663","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:e1ea171080c83386cdc5e63252dbc897b63add43a04f6e1387763213ec8b8483","observation_id":"cb41746b-bf36-4cc3-98f8-808cc13902aa","resolution":{"observed_at":"2026-05-17T00:19:27.991850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2402.02716","last_updated":"2024-02-05T04:25:24Z","snapshot_observed_at":"2026-07-06T17:25:14.115360Z","submitted_at":"2024-02-05T04:25:24Z","title":"Understanding the planning of LLM agents: A survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T18:12:57.568144Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2402.02716"},"observation_digest":"sha256:6f2ee46307e1c140714c210132af9876fcd84a41758de050163ae9c0ba605c7d","observation_id":"c5746d66-b271-4125-8f6b-326bb46f19d4","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:4dfec14f3202c22efd00c90b8539a4260609b44d9cc2d1f89d6a66d390b7ed25","observation_id":"d6708187-c820-4266-b1ba-c76f8e460ba5","resolution":{"observed_at":"2026-05-17T02:46:16.841199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:05d808165b04ada8075391b73629fea664f69f4513c02c32ef5476cfb175329b","observation_id":"5372a0fe-d33d-45eb-85ea-329c7bd4ca35","resolution":{"observed_at":"2026-05-17T07:44:47.575767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2409.07825","last_updated":"2026-02-04T04:12:12Z","snapshot_observed_at":"2026-08-02T14:14:17.863359Z","submitted_at":"2024-09-12T08:15:39Z","title":"Deep Multimodal Learning with Missing Modality: A Survey","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T22:26:03.706725Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2409.07825"},"observation_digest":"sha256:cb73f7d1d095ac09935fd05e6509194aeac45fa61bfb91bbe22dd153cc8e2330","observation_id":"9ea42463-204d-41b5-a3fe-b656a6c561c3","resolution":{"observed_at":"2026-05-17T22:26:03.946063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2504.02181","last_updated":"2026-04-22T01:49:17Z","snapshot_observed_at":"2026-07-30T09:24:14.725185Z","submitted_at":"2025-04-02T23:51:27Z","title":"A Survey of Scaling in Large Language Model Reasoning","version":2},"reference_index":222,"source":"pdf_text","source_observed_at":"2026-05-22T21:20:07.238992Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2504.02181"},"observation_digest":"sha256:c5184f09dae9f6f4f12c9547f6de7d6869f5d192b0519dafb23b646d38539ec3","observation_id":"1dcfaa93-cc33-451e-85f3-1b4a45868699","resolution":{"observed_at":"2026-05-22T21:22:09.012108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:de4659e7c90c6e52c5760e5b469a9be2ac0071754772063fd9a610a4e5e2d992","observation_id":"f66e0d49-ae06-40ab-afc5-544496faad49","resolution":{"observed_at":"2026-05-22T01:05:52.185645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2506.05442","last_updated":"2026-05-16T07:36:33Z","snapshot_observed_at":"2026-08-04T06:43:04.817496Z","submitted_at":"2025-06-05T12:59:35Z","title":"Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T00:16:35.823270Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2506.05442"},"observation_digest":"sha256:b538514374b4615d97291f298f3b73dfae0bc6579bfe188b5f67ece292a80325","observation_id":"240c4979-dee3-40d1-bab1-6639fdf6266f","resolution":{"observed_at":"2026-05-22T00:20:50.495942Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2506.11989","last_updated":"2026-05-01T04:52:44Z","snapshot_observed_at":"2026-07-06T21:41:52.859699Z","submitted_at":"2025-06-13T17:46:14Z","title":"Thought Graph Traversal for Test-time Scaling in Chest X-ray VLLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T09:15:46.135084Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2506.11989"},"observation_digest":"sha256:83075a151a8c5cf8e8188f4bcc1751056b4ab2e464d1967e1899e22c40415515","observation_id":"fa55aacc-a30f-4dad-bec8-8cb5b7d95ad5","resolution":{"observed_at":"2026-05-19T09:17:13.990834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2506.20911","last_updated":"2026-05-06T17:42:17Z","snapshot_observed_at":"2026-07-06T21:47:49.078141Z","submitted_at":"2025-06-26T00:33:43Z","title":"FaSTA$^*$: Fast-Slow Toolpath Agent with Subroutine Mining for Efficient Multi-turn Image Editing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T08:17:08.223736Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2506.20911"},"observation_digest":"sha256:34026b792cd4bd4026a75a28c5a95b8bd34995577b0688a887d8fb5510acf873","observation_id":"9783126e-1221-4d01-b0e4-57aaf7e617de","resolution":{"observed_at":"2026-05-19T08:17:10.725881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T13:23:35.324565Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-06T13:23:26.672791Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:35.324565Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:438320635c9accacf41c8f23740869d6df9f8f0f0cbff465a42c5fb43606502f","observation_id":"cd928144-2c61-4efd-9d9b-646af949f168","resolution":{"observed_at":"2026-08-06T13:23:35.324565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T12:18:39.399123Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-06T12:18:30.309429Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.399123Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c0d05672f8ac2137f6f246014eb18a8e95e85530cd171641879c958a2324c1a8","observation_id":"b2630173-c5e9-4b66-b4b2-b531121a1309","resolution":{"observed_at":"2026-08-06T12:18:39.399123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T00:03:33.590502Z","title":"Visual chatgpt: Talking, draw- ing and editing with visual foundation models.arXiv preprint arXiv:2303.04671, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-06T00:03:14.607794Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:33.590502Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:86062c1ecaf74f2ac0a4dad903fd65d938151cc274003fcdfe435cf663c7aac9","observation_id":"96a13c92-cf07-433b-82ee-4ac419c8b115","resolution":{"observed_at":"2026-08-06T00:03:33.590502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T22:21:39.627240Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07141","last_updated":"2025-08-10T02:06:51Z","snapshot_observed_at":"2026-08-05T22:21:38.835017Z","submitted_at":"2025-08-10T02:06:51Z","title":"SketchConcept: Sketching-based Concept Recomposition for Product Design using Generative AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T22:21:39.627240Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2508.07141"},"observation_digest":"sha256:2e58f4924c1484e42080d442c4d0a07e2c3b13c3771605afacc1a9264f6f46da","observation_id":"7853432a-773d-4f7e-8780-8574435f3070","resolution":{"observed_at":"2026-08-05T22:21:39.627240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T20:29:08.632796Z","title":"Wu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":256,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:08.632796Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:6f99e9eb156fa92f7b352e327cb1929d203268b894ec874650ed1d7220e83b62","observation_id":"8d3c5c47-b591-4072-bc94-2368ae0cee4d","resolution":{"observed_at":"2026-08-05T20:29:08.632796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T19:03:23.360014Z","title":"arXiv preprint arXiv:2303.04671","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13602","last_updated":"2025-08-30T04:28:46Z","snapshot_observed_at":"2026-08-05T19:03:10.630169Z","submitted_at":"2025-08-19T08:10:43Z","title":"PersonaVlog: Personalized Multimodal Vlog Generation with Multi-Agent Collaboration and Iterative Self-Correction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:23.360014Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2508.13602"},"observation_digest":"sha256:9c50978d11c5a8f3abe52d5b6568640ee6209c42fde53299b5f51561e0801aae","observation_id":"d81b29ff-cb3d-46a0-b410-15db89530d33","resolution":{"observed_at":"2026-08-05T19:03:23.360014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T17:12:47.124406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16926","last_updated":"2025-08-23T07:17:02Z","snapshot_observed_at":"2026-08-05T17:12:46.143492Z","submitted_at":"2025-08-23T07:17:02Z","title":"TextOnly: A Unified Function Portal for Text-Related Functions on Smartphones","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:12:47.124406Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2508.16926"},"observation_digest":"sha256:4af44965e702ac1a9b76e32dfe952cc2921666746df2852711142cde17934249","observation_id":"4da4bc1a-4721-49b9-bb78-3fc4ff8826fc","resolution":{"observed_at":"2026-08-05T17:12:47.124406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-04T17:56:57.832286Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10327","last_updated":"2025-09-12T15:08:22Z","snapshot_observed_at":"2026-08-04T17:56:56.651700Z","submitted_at":"2025-09-12T15:08:22Z","title":"MusicScaffold: Bridging Machine Efficiency and Human Growth in Adolescent Creative Education through Generative AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T17:56:57.832286Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2509.10327"},"observation_digest":"sha256:859aa7108d4f506a2886e332777d470e27e3d4d0f44d0c785570482e85d3f883","observation_id":"afa17747-8fb6-4b42-af11-ed13b8fff6fc","resolution":{"observed_at":"2026-08-04T17:56:57.832286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-04T17:37:43.500195Z","title":"arXiv preprint arXiv:2303.04671 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10748","last_updated":"2025-09-12T23:36:52Z","snapshot_observed_at":"2026-08-04T17:37:42.798846Z","submitted_at":"2025-09-12T23:36:52Z","title":"SCOPE: Speech-guided COllaborative PErception Framework for Surgical Scene Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:37:43.500195Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2509.10748"},"observation_digest":"sha256:c7c0bfe65cab4394f3ed4d917141f8d0021440732cc5025fffb66050fa1c8c72","observation_id":"fbcb9983-f344-4ba0-bfcc-b59c2c067f3e","resolution":{"observed_at":"2026-08-04T17:37:43.500195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-04T11:32:14.983970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.983970Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:f1be614953062e3254ce2bcf3c4cd6fc2277a3224dbdc2cc9f49570e75fb10de","observation_id":"fcee366a-7990-4787-8542-9bed575f0004","resolution":{"observed_at":"2026-08-04T11:32:14.983970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-03T18:25:06.728321Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models.arXiv preprint arXiv:2303.04671, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.05530","last_updated":"2026-06-02T03:33:30Z","snapshot_observed_at":"2026-08-03T18:24:59.046054Z","submitted_at":"2025-12-05T08:41:44Z","title":"MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T18:25:06.728321Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2512.05530"},"observation_digest":"sha256:b441085945ad2f781b292f2f3305db8e793f6eb8609122a8bda3a878fd7b4a14","observation_id":"a36f0762-3aa6-4720-8c67-71e1d37608bc","resolution":{"observed_at":"2026-08-03T18:25:06.728321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2602.22683","last_updated":"2026-04-09T08:16:21Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T06:55:48Z","title":"SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T19:18:36.314029Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2602.22683"},"observation_digest":"sha256:8a4d300709a9303e22e16c0b059f073eef54158e73aec7f9673b20b387b17983","observation_id":"8f955a90-b0ed-4e0d-8c2d-55e0ff89a1b0","resolution":{"observed_at":"2026-05-15T19:20:16.374629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:90aba130649058d15900f6d65e47a69564fcc31e60c5e24a483ba6adf33f6cad","observation_id":"0233a267-69d2-4fe4-8eb5-4edf7cdeec25","resolution":{"observed_at":"2026-05-15T18:26:26.964302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-13T16:50:50.552104Z","title":"arXiv preprint arXiv:2303.04671 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.27742","last_updated":"2026-07-08T11:45:48Z","snapshot_observed_at":"2026-08-06T10:25:58.064750Z","submitted_at":"2026-03-29T15:50:36Z","title":"TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:50.552104Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2603.27742"},"observation_digest":"sha256:8c52eddab12d267bb90fd4bbb447580d171046aeadbaea9df7d5ce4802df57f3","observation_id":"8d326644-677d-4c24-a555-7035e0c475fe","resolution":{"observed_at":"2026-07-13T16:50:50.552104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.03156","last_updated":"2026-06-17T05:47:04Z","snapshot_observed_at":"2026-08-02T19:28:53.956947Z","submitted_at":"2026-04-03T16:27:02Z","title":"CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T20:58:59.346867Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.03156"},"observation_digest":"sha256:180ad3591d410b018f7ad3ebfec00a2cca6f1da817168c7a3f9dca893e9a600c","observation_id":"bec383b2-7a51-4fe5-ad44-c57c78f4272c","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-13T09:40:35.631188Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models.arXiv preprint arXiv:2303.04671, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T09:40:35.631188Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:a546d5addba0593136df827d7678a03556400a87c6f7fdf1f5c274140659dcd7","observation_id":"93620732-c587-4df6-97d2-b31213b1739d","resolution":{"observed_at":"2026-07-13T09:40:35.631188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.04838","last_updated":"2026-04-07T10:14:44Z","snapshot_observed_at":"2026-07-06T22:53:41.734429Z","submitted_at":"2026-04-06T16:41:19Z","title":"Less Detail, Better Answers: Degradation-Driven Prompting for VQA","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T20:17:01.867903Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.04838"},"observation_digest":"sha256:25414c1a42fcfdc1e52e9d686666d8a40d18b19d9d0a24276033ee6b4b04d226","observation_id":"9a0a8960-44a2-4592-89a0-737cca64748d","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.07753","last_updated":"2026-06-27T04:43:13Z","snapshot_observed_at":"2026-07-13T00:15:55.253944Z","submitted_at":"2026-04-09T03:19:26Z","title":"Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:17.872120Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.07753"},"observation_digest":"sha256:4e65d13629261fdc194290b7f5290ad06d5163fa466d39b2f2c0c3cdc80cc828","observation_id":"b9549798-c9e6-40e5-958b-faa815936aa4","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:40:32.137708Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.12890"},"observation_digest":"sha256:6d4f06e6720094f481309cbcadbca332f5c3f860fab4137144fc00e7f78f1475","observation_id":"d55c2a41-761a-4b5d-9f1e-be321f79cde9","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.13787","last_updated":"2026-04-15T12:26:10Z","snapshot_observed_at":"2026-08-02T06:04:16.647019Z","submitted_at":"2026-04-15T12:26:10Z","title":"ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:05:34.931798Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.13787"},"observation_digest":"sha256:f2bcdf3d31d5d1e2522b5ddb81ceeaa29c19817a81d852c6f26b4ef3b0c81379","observation_id":"6bac073c-46c9-48d0-8713-d9648a418789","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.14951","last_updated":"2026-04-16T12:47:09Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T12:47:09Z","title":"RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T11:24:18.061622Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.14951"},"observation_digest":"sha256:a283f85393992e1daa5fae76073488970fe15e6ec67440b733a8a103fc8c6e4d","observation_id":"b48e7828-e1eb-46eb-927a-74877dbba0f5","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.16958","last_updated":"2026-04-18T10:40:31Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T10:40:31Z","title":"Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T06:40:02.167172Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.16958"},"observation_digest":"sha256:0d61817c6980a66f22a3a4136ca9b62991f051112a07538b01da2ddbffb7ee22","observation_id":"9af972ec-a509-40bc-9efc-c37fd6d4d2f7","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:a3427ad70b56abcea5b3a82589e22a4294920bfd3836e212a1780f110f565d7f","observation_id":"5333e4c7-cf75-4294-91b8-c41f85b06de2","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.22868","last_updated":"2026-04-23T19:00:31Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-23T19:00:31Z","title":"Probing Visual Planning in Image Editing Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-09T21:40:23.460129Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.22868"},"observation_digest":"sha256:9e8b37f87938b17cf5cdb99810f2d497e4ea692062eba0daa29fb26fe15bedca","observation_id":"fb9bcde2-a995-45dc-a4e9-24d807f8df49","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2604.23788","last_updated":"2026-04-26T16:25:30Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T16:25:30Z","title":"MIRAGE: A Micro-Interaction Relational Architecture for Grounded Exploration in Multi-Figure Artworks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T06:32:57.198044Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2604.23788"},"observation_digest":"sha256:c7fba34d96c370d6a9ade0887f31cc947108071b525e430da6f1212ff440be7e","observation_id":"b88000a1-03dc-45b6-a838-4e416a9da89c","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:f463613edd492496def1b9f543bd823ca0028d624b768fd2028fab888756a31c","observation_id":"71a0f833-70ce-4b10-9deb-24d3cd697249","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.03950","last_updated":"2026-05-05T16:36:58Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:36:58Z","title":"UnAC: Adaptive Visual Prompting with Abstraction and Stepwise Checking for Complex Multimodal Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-07T17:35:28.050906Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.03950"},"observation_digest":"sha256:57d3212954a76ddede4e2856f5206052ce9022c95144d7cb7eb6e02db399e34a","observation_id":"070e3e39-0ccd-460d-8301-9131cb5e2681","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.04304","last_updated":"2026-05-05T21:12:01Z","snapshot_observed_at":"2026-07-06T23:17:04.200299Z","submitted_at":"2026-05-05T21:12:01Z","title":"Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T17:07:53.418355Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.04304"},"observation_digest":"sha256:4586103515e96568c97c67dbce3736f9862166350730871610b80b48d35cc042","observation_id":"2f09e039-bc02-48ec-b76b-0fdc2df0d3ff","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.07490","last_updated":"2026-05-08T09:29:50Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:29:50Z","title":"Cross-Modal Backdoors in Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:11.432424Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.07490"},"observation_digest":"sha256:07a3c640e942985a3208f8ecb2ec80d169613fbcdab21e1166f6adb004ac0ff4","observation_id":"84bdb04d-756b-44da-8c7b-0343ba5d244a","resolution":{"observed_at":"2026-05-13T22:50:24.368060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.16409","last_updated":"2026-05-13T14:16:39Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T14:16:39Z","title":"Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T21:21:11.388050Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.16409"},"observation_digest":"sha256:e21585f5a76e84e453dd0867bb33f664fec67317a2e1fd97efc2def3f3334c85","observation_id":"6bb15c0c-50a4-4060-92f4-0177f37ff98e","resolution":{"observed_at":"2026-05-20T21:23:44.409801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-05T22:32:42.411847Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:1c331070118964ec6d1c14f92f736cb69e240fa69019bd63179f25193cb16e39","observation_id":"9cbe3419-19ab-4ab9-a1b2-2551a758edba","resolution":{"observed_at":"2026-05-20T06:33:05.707113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.22177","last_updated":"2026-05-21T08:47:49Z","snapshot_observed_at":"2026-08-02T13:10:19.838403Z","submitted_at":"2026-05-21T08:47:49Z","title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T07:51:13.362986Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.22177"},"observation_digest":"sha256:fbe046ea18f350044d2253dc14ce80a71573863081a3f03c0b0d2b81a9082f2e","observation_id":"7086640a-515a-44d9-a468-7e0cb20f1cb1","resolution":{"observed_at":"2026-05-22T07:51:15.303382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.25009","last_updated":"2026-05-24T11:26:15Z","snapshot_observed_at":"2026-08-02T17:52:39.937684Z","submitted_at":"2026-05-24T11:26:15Z","title":"ClueAegis: Heuristic-to-Reasoning Cognitive-skill Learning for Unified Evidence-based Synthetic Image Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T12:31:43.052626Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.25009"},"observation_digest":"sha256:b2b6100578d6de9d50aacd817c2f6a0967239ef0854f8ffab5a025fbddae1250","observation_id":"bb0be874-7acb-4933-9f37-f223acfd1d38","resolution":{"observed_at":"2026-06-30T12:34:38.624208Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.26520","last_updated":"2026-05-26T04:07:49Z","snapshot_observed_at":"2026-07-06T23:36:20.072253Z","submitted_at":"2026-05-26T04:07:49Z","title":"InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T17:52:48.888733Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.26520"},"observation_digest":"sha256:d9a860daf7c042f41a25a39b15478af54a2ddc40bbb84ccb871467b32917abfe","observation_id":"6d07799a-5982-4daa-9e4a-375099e6c8a5","resolution":{"observed_at":"2026-06-29T17:53:46.830016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.26691","last_updated":"2026-05-26T08:29:38Z","snapshot_observed_at":"2026-08-02T06:12:03.711761Z","submitted_at":"2026-05-26T08:29:38Z","title":"Mind the Tool Failures: Achieving Synergistic Tool Gains for Medical Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T18:05:59.091231Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.26691"},"observation_digest":"sha256:714ca1676cdbed2a661a96e6c563e77f145218b1c7b88d900e09102361945032","observation_id":"a325792f-d5d8-472b-93eb-4df0f6719350","resolution":{"observed_at":"2026-06-29T18:13:49.077016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.27932","last_updated":"2026-05-27T04:04:42Z","snapshot_observed_at":"2026-08-02T11:49:59.067913Z","submitted_at":"2026-05-27T04:04:42Z","title":"When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:57:21.387438Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.27932"},"observation_digest":"sha256:7782e260be95b0a34980ea0e8a81b2a7ad7de69e855a384f92db792ba629e181","observation_id":"1ad6ab5f-f1fe-4ee9-8edc-5450c5242b17","resolution":{"observed_at":"2026-06-29T14:03:29.601869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.00384","last_updated":"2026-06-07T19:48:24Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:57:37Z","title":"VESTA: Visual Exploration with Statistical Tool Agents","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T21:58:11.339217Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.00384"},"observation_digest":"sha256:827a27f6ef005f9b93b4461045d4dc63ab0dcf03a414480587561f7b7dce0b9b","observation_id":"23b5c24f-801a-498d-aae8-fd343aa2b41b","resolution":{"observed_at":"2026-07-01T19:56:10.485302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.01803","last_updated":"2026-06-01T07:21:01Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:21:01Z","title":"OctoT2I: A Self-Evolving Agentic Text-to-Image Router","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T14:22:57.822123Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.01803"},"observation_digest":"sha256:ad61dfadcea0cf02f8c7f196c7d14c77055e3bd4d853caa22ab016878bce7e7d","observation_id":"0a06fe68-43f6-494b-ae43-ffa45e125e5b","resolution":{"observed_at":"2026-07-01T23:26:22.446985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.03005","last_updated":"2026-06-02T01:24:30Z","snapshot_observed_at":"2026-08-04T20:14:57.624898Z","submitted_at":"2026-06-02T01:24:30Z","title":"MUSE: A Unified Agentic Harness for MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T11:14:31.395762Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.03005"},"observation_digest":"sha256:6cc1ad349f701443226bdf48b49feaa2428baf7392118ae2139d6d78b06bdbc8","observation_id":"9bd144f5-639f-4bdd-9a82-d455d9930287","resolution":{"observed_at":"2026-07-02T02:06:26.849039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.03054","last_updated":"2026-06-02T02:44:27Z","snapshot_observed_at":"2026-08-02T04:55:02.222478Z","submitted_at":"2026-06-02T02:44:27Z","title":"ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T10:38:41.735204Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.03054"},"observation_digest":"sha256:b7bd664232c2e0bd5d4133c4d6a9f2b0ac7f9b2ee5949caf15e0463d33a1c7e6","observation_id":"b31f5033-83f0-4800-9973-fe50287098ab","resolution":{"observed_at":"2026-07-02T02:46:28.929685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.07436","last_updated":"2026-06-11T06:13:05Z","snapshot_observed_at":"2026-08-02T20:16:40.209289Z","submitted_at":"2026-06-05T16:33:44Z","title":"Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T21:56:19.901930Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.07436"},"observation_digest":"sha256:2fe006f010b9856acb287fb66277dc9d32768e96b2909773fce600889c1b5b16","observation_id":"2a8ad26d-e57d-4328-bf0b-078d57464678","resolution":{"observed_at":"2026-07-02T17:37:14.745432Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.09110","last_updated":"2026-06-08T07:00:56Z","snapshot_observed_at":"2026-08-02T19:16:30.955489Z","submitted_at":"2026-06-08T07:00:56Z","title":"HDRAgent: An Agentic Framework for Multi-Exposure HDR Imaging","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T17:24:18.764625Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.09110"},"observation_digest":"sha256:a4c381df05fed78c1c63f8c893f47286bafbff8e8490214cf258ccb027bdbf67","observation_id":"1a940d70-a0b0-4545-88e3-d5a6aa23bf05","resolution":{"observed_at":"2026-07-03T00:17:28.657216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.11702","last_updated":"2026-06-10T06:26:52Z","snapshot_observed_at":"2026-08-04T03:07:16.453384Z","submitted_at":"2026-06-10T06:26:52Z","title":"MedCTA: A Benchmark for Clinical Tool Agents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T10:32:01.387453Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.11702"},"observation_digest":"sha256:44699220395820d5873c10ab96ec948f4e9c7fedc84d74c7b20ee2f23856f2d9","observation_id":"dbf10217-2ab0-46b5-aeda-1c94becce6db","resolution":{"observed_at":"2026-07-03T09:07:47.988823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.13148","last_updated":"2026-07-01T17:31:23Z","snapshot_observed_at":"2026-07-06T23:51:59.619032Z","submitted_at":"2026-06-11T10:26:03Z","title":"TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T07:17:43.188693Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.13148"},"observation_digest":"sha256:29b9884edd637bed6c936672cfdf9d3fba4749b529da9f7baa5c716f92b6033d","observation_id":"d747a8cf-3e61-4166-8f96-04c3b539c7d7","resolution":{"observed_at":"2026-07-03T13:58:22.234578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.13148","last_updated":"2026-07-01T17:31:23Z","snapshot_observed_at":"2026-07-06T23:51:59.619032Z","submitted_at":"2026-06-11T10:26:03Z","title":"TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-02T22:29:58.492918Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.13148"},"observation_digest":"sha256:11b5d705ec966fb228c784576d5f12c573e5211eb3458a5d34f57b0c06879a65","observation_id":"a296de52-98f5-48cc-8c75-fbd9a6c11ee5","resolution":{"observed_at":"2026-07-02T22:37:25.466494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.20515","last_updated":"2026-06-28T15:54:03Z","snapshot_observed_at":"2026-08-02T07:26:05.359571Z","submitted_at":"2026-06-18T17:34:55Z","title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T17:56:07.864580Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.20515"},"observation_digest":"sha256:4e56e1ec984a1a9d4e50bc506e5f00825765bae69204abf17eaf25f4e925e00b","observation_id":"23338d62-8378-4b75-a614-716c34dab6f4","resolution":{"observed_at":"2026-07-04T03:29:31.594823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2606.20515","last_updated":"2026-06-28T15:54:03Z","snapshot_observed_at":"2026-08-02T07:26:05.359571Z","submitted_at":"2026-06-18T17:34:55Z","title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T10:22:08.535453Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2606.20515"},"observation_digest":"sha256:8423b3da2208d4b19feaec7c225301826908a19aa932ba1b25d8f690b9f7123c","observation_id":"f2dad7be-97fc-4bc7-9dd1-c5e14cb39a8e","resolution":{"observed_at":"2026-06-30T11:54:39.022751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:214d24b2754dec52fe00cb30843941cec4ed906405f8a17312ab0cb7a1a347ed","observation_id":"746377dd-ed62-4931-93ce-2d2f922096ca","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Visual ChatGPT: Talking, drawing and editing with visual foundation models.arXiv preprint arXiv:2303.04671, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-02T18:49:18.288546Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:1fc8765e7e0697092aedb1b3f951c858b6f99c752184946cfbdc4e81980f0195","observation_id":"0058b84e-3db6-4097-8ba6-ec4ad83f4553","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-02T03:36:00.317683Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models.arXiv preprint arXiv:2303.04671, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13854","last_updated":"2026-07-15T14:01:48Z","snapshot_observed_at":"2026-08-05T18:43:26.546712Z","submitted_at":"2026-07-15T14:01:48Z","title":"SPyCE: Skill-Policy Co-evolution for Multimodal Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:36:00.317683Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.13854"},"observation_digest":"sha256:fb51e4abc70f68cc59a11e4f21d7bd8c77133171aff6766e147c9bf9a529c15b","observation_id":"0881aa9a-4249-46de-aed8-3c1b32aec5eb","resolution":{"observed_at":"2026-08-02T03:36:00.317683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-01T22:12:55.547636Z","title":"arXiv preprint arXiv:2303.04671 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15845","last_updated":"2026-07-27T13:53:28Z","snapshot_observed_at":"2026-08-03T13:36:34.032557Z","submitted_at":"2026-07-17T11:03:01Z","title":"Knowledge-Centric Agents for Workflow Generation in ComfyUI","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T22:12:55.547636Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.15845"},"observation_digest":"sha256:a1d693edefd601d73d347dbacd16b4f91766bf4f813ad946fc4f8c734fc6ac26","observation_id":"ea0ae2a3-a447-437f-835a-d59bbc8a5a1f","resolution":{"observed_at":"2026-08-01T22:12:55.547636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-01T06:08:22.141248Z","title":"Visual chat- gpt: Talking, drawing and editing with visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-05T11:02:37.998810Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.141248Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:03b5a58380147192de30fdd57eb23aaf50ad2e913d62b86255dc0df09bf82b06","observation_id":"bd4a26c1-2b41-499d-88cb-640293d72da2","resolution":{"observed_at":"2026-08-01T06:08:22.141248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-02T10:20:51.524195Z","title":"arXiv preprint arXiv:2303.04671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-04T13:06:48.299222Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:51.524195Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:f2003e518030fb842dfa278fae12316af479d693f6eb9d14e514aca2e2ff061d","observation_id":"dfc8a1db-ba66-494e-a5c3-c8de96e31970","resolution":{"observed_at":"2026-08-02T10:20:51.524195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-31T07:56:28.755281Z","title":"arXiv preprint arXiv:2303.04671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28421","last_updated":"2026-07-30T16:01:17Z","snapshot_observed_at":"2026-08-06T01:00:23.448415Z","submitted_at":"2026-07-30T16:01:17Z","title":"When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T07:56:28.755281Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.28421"},"observation_digest":"sha256:4d7e1f6d6a6ef94c00069caa2659facc1855c0ab3b1c43cc8b6bb31e7e25db68","observation_id":"6569cc84-a17c-4ab0-a829-05809cf166ef","resolution":{"observed_at":"2026-07-31T07:56:28.755281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.04671/citation-record","integrity":"/paper/2303.04671/integrity","json":"/paper/2303.04671/citation-record.json","paper":"/paper/2303.04671"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"059e2edb-7251-4c10-907e-c021375c785d","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:aa5176a1ec84917bcbcdb90be0718e0115af1bde07870212ccbecae73d08aec7","observation_id":"c77ebbf0-4fe9-423a-bccb-50552a95133b","resolution":{"observed_at":"2026-05-13T22:50:24.302267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqa: Visual question answering","venue":null,"work_id":"cbdd1a33-3045-4f80-9a99-f0866c9fa2ac","year":2015},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:cb7dda081a813d29fa4bc33023ee4887aba47f56f2412bd7f13521bbe4f6f4ca","observation_id":"6fea55b8-019c-4578-b072-bd339dac97c9","resolution":{"observed_at":"2026-05-13T22:50:24.318107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02358","last_updated":"2022-05-27T15:44:26Z","snapshot_observed_at":"2026-07-06T12:05:07.980255Z","submitted_at":"2021-11-03T17:20:36Z","title":"VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts","version":2},"cited_work":{"arxiv_id":"2111.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02358","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":"bbdebaac-4da3-44ee-92f1-4125efdfe5d8","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2111.02358","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:ca06dc7d6f5dcb113eb60db5216b88aaafbfc70ec80a352f16014f90bf1b4606","observation_id":"c65f590e-691d-406d-a694-e0775b53ccea","resolution":{"observed_at":"2026-05-13T22:50:24.137129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":"2211.09800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-07-04T10:19:47.353241Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","venue":null,"work_id":"de9c4a95-36ff-4e97-a0c0-3cca39f60b1a","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:c313bd861b2a472b3dbad4c4dae15541ad1f949df47f31c397d4107590aedbae","observation_id":"fa1e7c72-3bf2-44cf-afa8-309a3a5c3638","resolution":{"observed_at":"2026-05-13T22:50:24.120824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"586b225f-281e-4de8-8c7c-dd02e7091ca8","year":1901},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:30edf0b95573fd4e3c671bbf117d7bbc0a9f1116070f1b0cac238daf661a18c1","observation_id":"4929d6d5-c397-488d-8ecf-d0cab6b38bca","resolution":{"observed_at":"2026-05-13T22:50:24.321634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realtime multi-person 2d pose estimation using part afﬁnity ﬁelds","venue":null,"work_id":"b6f8ef35-74cc-43f8-8bf8-8e0aeac9c633","year":2017},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:13e80f609282421d16d863a7c0e9b91d01f335d5c90c883283f0e578311ea385","observation_id":"5b18d774-46e8-4e83-85b3-d6ece233d377","resolution":{"observed_at":"2026-05-13T22:50:24.325478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LangChain, 10 2022","venue":null,"work_id":"a8bc0f4c-b3e7-4282-ab06-93c5307198a3","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:7dfb6349d8be085c0ec46a14fbeb7bbfdf65d983ecb03352bd33ca17e796a247","observation_id":"1b80f66e-0e81-4333-bc5d-0a3737e728ee","resolution":{"observed_at":"2026-05-13T22:50:24.329029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualgpt: Data-efﬁcient adaptation of pretrained language models for image captioning","venue":null,"work_id":"5bca3a5b-4c96-4e9e-bc1e-669c7c77ac4e","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:8b79922b9797117efcdf2eb5c9102157223fbdbd6496ea09d5fb0389fb709424","observation_id":"b1e9f1e8-ef46-464b-8cbe-9a1d6d7a3e89","resolution":{"observed_at":"2026-05-13T22:50:24.333169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"aa34a505-3552-40f6-b4cd-8d2fbb1520b4","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:ef18b339c9a7068ebe781b540de14b15d9787a7637cb6569b46216dac19fc70e","observation_id":"1b632c2c-9858-42a8-8523-5439223a85f0","resolution":{"observed_at":"2026-05-13T22:50:24.336794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Per- pixel classiﬁcation is not all you need for semantic segmen- tation","venue":null,"work_id":"dc882362-b81f-439d-b7e7-fb7bd2f35510","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:36736648ffb2398d720b3204fe9d8ae5ed25743d89701bac85c0b13ee6fc69f2","observation_id":"f54fcd22-9f4e-4868-bf4e-7429323decb2","resolution":{"observed_at":"2026-05-13T22:50:24.340753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Commonsense reasoning and commonsense knowledge in artiﬁcial intelligence.Com- munications of the ACM, 58(9):92–103","venue":null,"work_id":"87bffee4-b801-40e6-839d-238cd25b9a1b","year":2015},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:8de2d2654e6ef6542235ccc4b29a946fdab1f6c19e79cfea55832d55c47b6111","observation_id":"3214a427-3809-45e9-a35e-9e6c26bfa80c","resolution":{"observed_at":"2026-05-13T22:50:24.344620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05253","last_updated":"2022-10-24T21:35:42Z","snapshot_observed_at":"2026-07-06T12:17:10.684873Z","submitted_at":"2021-12-09T23:58:45Z","title":"MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning","version":2},"cited_work":{"arxiv_id":"2112.05253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05253","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2112.05253 , eprint =","venue":null,"work_id":"9707198b-280e-43c9-81bd-675e68a13ebc","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2112.05253","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:b8fce71eac88120c4834462c6b5aa68868b4c4eaaad5163592b809c855abe6e2","observation_id":"5f24adfb-0b84-4b76-bb85-8fe937d36df2","resolution":{"observed_at":"2026-05-13T22:50:24.154851Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":"2111.12681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-07-03T00:57:30.204945Z","title":"Violet: End-to-end video-language transformers with masked visual-token modeling","venue":null,"work_id":"c7602525-8155-4a61-bd4e-abf06c26e6e7","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:258e47af26588d1b98cdf70963adff57c2acd62825fc2ac29d53e79ddcf2618b","observation_id":"d54d0cf7-6a98-4114-9471-058a461bb26f","resolution":{"observed_at":"2026-05-13T22:50:24.171526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale adversarial training for vision- and-language representation learning","venue":null,"work_id":"7512d161-4056-456e-a4a6-41672558e9aa","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:8f653461d5377c57bbeaa028dc16d01c08bbcbdd2482555ddac4a8354360f55d","observation_id":"dd4a9cd9-1ad5-4b73-97cd-794981d1c823","resolution":{"observed_at":"2026-05-13T22:50:24.348615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic compositional networks for visual captioning","venue":null,"work_id":"b158497f-1b66-4a3b-adec-ccf1033ee69f","year":2017},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:87d3bf0f4bc71f34372aaecea82e13b74b044693880d10ecbadeae17b0b26b24","observation_id":"e400680a-bccc-48f6-9f1c-b639df85f16e","resolution":{"observed_at":"2026-05-13T22:50:24.352654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards light-weight and real-time line segment detection","venue":null,"work_id":"0e2e6ed1-9ffd-4df7-8a77-b127bdc65533","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:c73b1564d90a7457af4028d4281ab1d5feb7354c361e3c578865bfd847688973","observation_id":"0c540a3a-740a-4bcd-8f05-9d5a82a54aa7","resolution":{"observed_at":"2026-05-13T22:50:24.356233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parameter-efﬁcient transfer learning for nlp","venue":null,"work_id":"2abc4240-3e84-4109-bd66-3adef72ea841","year":2019},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:a9a750606041685b4452d78519a8cdc3fd4cebd900ededa5cfa00c490a1ef018","observation_id":"c61453ba-7dfe-4b02-b3d3-afc3c5198760","resolution":{"observed_at":"2026-05-13T22:50:24.359469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":"352f2627-4798-477c-beed-c4d40c52b5bd","year":2017},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:17d477e8584576c9341c65d4acc5d277cda14ffbf4db5c899e824c187f4bf599","observation_id":"a1ee5456-2ed4-4b13-badc-843e8e542b14","resolution":{"observed_at":"2026-05-13T22:50:24.362923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"97012126-8af8-4010-b9ec-d0a89d5d7d80","year":2019},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:f73250d4d9271c9f0be7f7a1b433cfc2e526d5b31087e2ee57aeffd3af8faa85","observation_id":"97e19545-13fb-4656-96a8-24ff494b9133","resolution":{"observed_at":"2026-05-13T22:50:24.366640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"0c1e1383-c567-4ec5-a231-cbb27f85e54b","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:143e58e703c2868f2751af7fdb0350670a2df1b5d281c2c81d66150b9d7a241d","observation_id":"cbaf85ba-e755-416f-8cec-81a2447c4bf3","resolution":{"observed_at":"2026-05-13T22:50:24.194209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manigan: Text-guided image manipulation","venue":null,"work_id":"d92f958d-35b7-4785-851a-9a5361ba994d","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:4bd26468408c59105fcd5bd3f50a05d7371981e3548705a6dfb89a6f5a301e19","observation_id":"220664ce-1f90-4751-8746-5f3373f5f5b2","resolution":{"observed_at":"2026-05-13T22:50:24.198026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:0a8b41d12357cfbfbb50ee796d2afdf03a99366fa57392240ea898ba085bea76","observation_id":"f317e750-6e96-41ed-a8dc-7fbd94286ff5","resolution":{"observed_at":"2026-05-13T22:50:24.097649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for uni- ﬁed vision-language understanding and generation","venue":null,"work_id":"7f97ed25-e1ee-43d6-875f-1ee8cb4c5156","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:5d2fac7ef0d4e2762a55322798c2871de748bf67385228c289f47e66ffe1ec8b","observation_id":"8178b679-9458-46d7-9bc3-b567ccc10edb","resolution":{"observed_at":"2026-05-13T22:50:24.202190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09450","last_updated":"2023-05-31T09:19:23Z","snapshot_observed_at":"2026-07-06T12:30:31.297884Z","submitted_at":"2022-01-24T04:39:39Z","title":"UniFormer: Unifying Convolution and Self-attention for Visual Recognition","version":3},"cited_work":{"arxiv_id":"2201.09450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.09450","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniformer: Uni- fying convolution and self-attention for visual recognition","venue":null,"work_id":"ff2f6708-5a77-4504-b1c7-ad55771fe15f","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2201.09450","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:67a671f5914b454431ea98f2f27f21e6aeec6b6c750aea47880e8167a16a94b3","observation_id":"90de9b61-0200-4d79-b066-406a1964ff37","resolution":{"observed_at":"2026-05-13T22:50:24.130337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"ddb69489-5c30-4384-96fc-fbdb32fb1387","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:f3bad1ca9558554832a85ea06166e531b9e1b1ed52d9ee71776a2fdcdc32bfac","observation_id":"14cf1848-40d9-41c5-9897-88ae2056fcee","resolution":{"observed_at":"2026-05-13T22:50:24.205549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Su- pervision exists everywhere: A data efﬁcient contrastive language-image pre-training paradigm","venue":null,"work_id":"a82a9a20-e709-4986-ada2-ef809a2ab051","year":null},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:97290fc87f25b16b4422d59355d7dd5e86c7e0d76275e5893d7ad8b96664d198","observation_id":"295940ec-0f2d-464f-9e15-298014b8c0ba","resolution":{"observed_at":"2026-05-13T22:50:24.209143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"c01f21b2-760d-4258-8b29-60f6eebcbd8c","year":2014},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:c76d58d9e88d83a80bf8b56cefb656638a749bd2ba7596ffc7a58e03d6c9b7a6","observation_id":"a17744c3-8461-44ea-812b-4bae9ff52aba","resolution":{"observed_at":"2026-05-13T22:50:24.214184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"5f43a39c-e852-433a-854a-f200ba82480c","year":2023},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:f8a1ed8c86f3dab9cb5976c217814193e3580e255d1b1987c6d67f1e1b81dd4e","observation_id":"1fd2fc12-4eeb-4d12-98a4-57c4fd1a9026","resolution":{"observed_at":"2026-05-13T22:50:24.221357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:2d48c89a7c0eb40a33ab6e3c2b3d6845a776567534fb65aeedb7d8bdac7c7b28","observation_id":"3900d762-1960-4828-80b9-f4fdc1be9539","resolution":{"observed_at":"2026-05-13T22:50:24.114173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"2c6bcebe-0c50-40cc-af08-1319179ed95b","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:0fdf43ee3e4db61a36410dd2fac38d8ddcf506d3e7b10c1446d2310c905673a5","observation_id":"1f50a76e-e794-4ae1-85a0-159aa9316784","resolution":{"observed_at":"2026-05-13T22:50:24.227091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"db729907-d8c3-4bb4-9044-77b726352831","year":null},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:9aad53dd3cc04853d9fb8a46cc09249f1fbb6271d31c74af7e71d787d7a4a58a","observation_id":"f1495288-8c3b-46f3-877d-78af38119dbf","resolution":{"observed_at":"2026-05-13T22:50:24.230761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a uniﬁed text-to-text transformer","venue":null,"work_id":"8342752c-4638-480c-8993-29fabfd006fe","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:6004f24f624263b252e45853d4be49efb8796ca4e9d295b4e2c2d70298f7d84e","observation_id":"9f8ca77d-ecb1-4cf1-a285-7e314105311e","resolution":{"observed_at":"2026-05-13T22:50:24.235144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"abc74462-26ca-4c7d-b49a-d37f3136705f","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:746af2e6f85ba1dea51ac89923ff93a6947b18065e109516fce32ee4f6747d9f","observation_id":"d9f87b83-ee88-4a33-857d-0e002093c422","resolution":{"observed_at":"2026-05-13T22:50:24.243412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"40f8f7d0-4f65-4e6b-b020-63efeb76e372","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:546cb3400c295136b25c7148e242d3f67b3cf678f1aa3998b0f49be09748889a","observation_id":"84cba0ae-38e4-40cb-b7d9-d8dbe3afdc3d","resolution":{"observed_at":"2026-05-13T22:50:24.247197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"f4e1616b-ccb3-463c-9281-1ec126ac6443","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:70aa382130f0dd56c62cc1cfde7a0db1131a9c0467e99793e282db7c91e8ee7e","observation_id":"817465d6-ccb1-4b26-acb3-754a558b4565","resolution":{"observed_at":"2026-05-13T22:50:24.251417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":"2211.05100","doi":"10.48550/arxiv.2211.05100","metadata_source":"pith","pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","venue":"cs.CL","work_id":"337ba690-f35d-4154-9450-8edf4bc9f488","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:c2711d5dd02e2049d8964c93e6375cc5057330dadb1140990486a4b17d8446f4","observation_id":"b2cd8133-0cdc-49c4-85c5-8c7ce45ce085","resolution":{"observed_at":"2026-05-13T22:50:24.107337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to summarize with human feed- back","venue":null,"work_id":"b76d4510-eeb7-42bf-9735-e9407be73d4a","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:1ebc57e90bc55dd37188a7cdc6571a12b47435c714091ce798cb42d2f56baf75","observation_id":"e47eb0e5-7664-42a2-9606-03bbdc1ee1cb","resolution":{"observed_at":"2026-05-13T22:50:24.256488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":"2c84ccb3-2bd6-411e-99e4-d0490c1541a1","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:f4b649855df858ce715267fce5d24ac07419176995f5708097baf7fe02bd9fa0","observation_id":"7be9af3d-5212-42c4-a288-24a351ce6ab4","resolution":{"observed_at":"2026-05-13T22:50:24.260118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"7be9e116-1ff7-4321-817d-aabe4c03cb93","year":2017},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:aeadea823c7718380f5a98cabd39d1dce4ba637a8a2e0c61aa9816c36013241e","observation_id":"5a804739-3f9b-48ab-bb9d-5f4fd1af431b","resolution":{"observed_at":"2026-05-13T22:50:24.266273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"b44cd62d-98f6-4c33-aed6-fb88780c1759","year":2015},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:d64e5d174cff8df2789cc823a359e007e04dfffc3820a2461992d17800501231","observation_id":"829ab7f8-c1f7-4016-9503-3500f33b456a","resolution":{"observed_at":"2026-05-13T22:50:24.269985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:95f046084847ff14f94629c47ff43b27c7f02c004ba53f14c41297d02cc5d77a","observation_id":"ac2a14dd-4320-4516-a414-ec492b26edb4","resolution":{"observed_at":"2026-05-13T22:50:24.148645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":"f2444933-40a9-4e7c-951d-9d5ee67264a2","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:308e830fe350910dfbedc80766b8a408b4cf3518f3e8ff989dd75e4aff9d40d9","observation_id":"54132017-1509-423c-b4d5-bc91d9b32119","resolution":{"observed_at":"2026-05-13T22:50:24.274754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0d44cf8a-fe26-4d68-81ad-d7ecfc5b6fec","year":2020},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:53adfc5a7334a0e91843883888ccf07724090421b5c02e1f30e006ffb5ac2c45","observation_id":"6e9fe70d-8324-431b-a019-2624fd180394","resolution":{"observed_at":"2026-05-13T22:50:24.277687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistically-nested edge de- tection","venue":null,"work_id":"14c8bfc2-a61e-4c73-8648-54bc13280bfd","year":2015},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:af862817cc577b9ad9e18f53d5d65f52a318b6ac68db17560f53624c6633e2a4","observation_id":"5aa7a6c0-ce5d-43ee-afc7-c2f52ae3754a","resolution":{"observed_at":"2026-05-13T22:50:24.281135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Canny edge detection based on open cv","venue":null,"work_id":"5d86207f-0dfe-4e7c-90df-f18a945aab6d","year":2017},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:1776d7d8945f4e21b82b9dd5cf8fbfcc0a5810e4382dbbcdb2838addd2317076","observation_id":"bd0811a2-e2db-40f1-9d23-484580cf2c13","resolution":{"observed_at":"2026-05-13T22:50:24.284175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":"7d9ce1cc-0519-43a8-bb33-0b0188f8db3f","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:b4b314b399e8b10ef14995615518c61a190976f953f4ee6349ab47796306e5ac","observation_id":"b4069334-9df1-4d95-9bdc-3e70fc8c8a11","resolution":{"observed_at":"2026-05-13T22:50:24.289407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"740ba24f-078d-49f3-b93f-5e8364546483","year":null},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:ce72f5be38050fe417283ee61cbe00451115ffeadb64acb1928d687428be101a","observation_id":"fda2cde2-ed85-4635-8610-fe15f8bdb458","resolution":{"observed_at":"2026-05-13T22:50:24.292535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From recognition to cognition: Visual commonsense rea- soning","venue":null,"work_id":"4d108a82-56cb-4468-b3f6-298048c92e79","year":2019},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:1aa499a89c143c9f7a4ef6bc194ecdfa2d215487a71ff81e19af373201851346","observation_id":"e2b683e9-989c-401f-a02c-3c759d189e32","resolution":{"observed_at":"2026-05-13T22:50:24.295501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlot reserve: Neu- ral script knowledge through vision and language and sound","venue":null,"work_id":"0c314773-ada9-473d-b530-908b11b2add1","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:0701622362b9b95b08a77e7fbbcd44e4756d786a799c13dff411195637e341a0","observation_id":"bde057b6-c6c3-4594-bc85-0cbdf86da67e","resolution":{"observed_at":"2026-05-13T22:50:24.298644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":"2204.00598","doi":"10.48550/arxiv.2204.00598","metadata_source":"pith","pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","venue":"cs.CV","work_id":"6c2a6dd5-9b0f-4d86-a291-b605ebdfde6c","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:71035abbe0eb6b4210636b05f24af21f230c445f4b82ca02f4926193f9c43541","observation_id":"415f539b-35d0-4f5a-a7ab-b0f3fef1ad1a","resolution":{"observed_at":"2026-05-16T09:50:01.041344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision transformers","venue":null,"work_id":"a116eee5-9426-49c2-9c6d-8397c1543179","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:ee78e4a70f81124bd9b70d630b7256596d0391d4b1dcfad6d17d9e271b5c4e4f","observation_id":"3f9af3c9-6088-4524-80d3-d0f9ed8e4714","resolution":{"observed_at":"2026-05-13T22:50:24.315058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"3244043d-0e22-4621-8ee0-6ed77c5231aa","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:680d66d16606f92b450627b4bacae0f89d1a8413746833703dee6133a170edb9","observation_id":"6fade32f-a965-4bc5-90ae-6d7b7f3e0496","resolution":{"observed_at":"2026-05-13T22:50:24.307416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2302.05543","doi":"10.1145/3240323.3241729","metadata_source":"pith","pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"226c10cc-8cc0-4c01-9358-f23db6c470c7","year":2023},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:2651420a8e044e1e6813f8f3a78bce3a6ec99bd8bee28b652824945093d53c4c","observation_id":"bd083eea-4380-47bf-8fc6-bf7329b40a3b","resolution":{"observed_at":"2026-05-16T22:43:11.169114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00529","last_updated":"2021-03-10T01:27:16Z","snapshot_observed_at":"2026-08-03T19:27:03.174412Z","submitted_at":"2021-01-02T23:35:27Z","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2101.00529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vinvl: Making visual representations matter in vision- language models","venue":null,"work_id":"2f59e6f7-72b3-4d38-a09a-9741b23db712","year":2021},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2101.00529","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:55c79106ef206faf36163c878c0b400956be96f8e26a3ff2c88e0474594dc0bc","observation_id":"b495ffd3-6e09-4754-82ff-957c6e732d25","resolution":{"observed_at":"2026-05-13T22:50:24.165819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text as neural operator: Image manipulation by text instruction","venue":null,"work_id":"2dd83fa9-6796-40b3-8748-43a7b982e071","year":1902},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:38a36500c04c68e8f4c7c7342e05e524407a3c2217df8112a5d4b1fd1fcfd8fe","observation_id":"1465b4a4-8254-47cf-b102-b03d6dc4151a","resolution":{"observed_at":"2026-05-13T22:50:24.311758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":"2210.03493","doi":"10.48550/arxiv.2210.03493","metadata_source":"pith","pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatic Chain of Thought Prompting in Large Language Models","venue":"cs.CL","work_id":"c3739d30-4ba4-47ca-a8c7-41daf3b51e71","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:488a9a9e9e5975bb71bfc9407b8ac831a756b57bdde322c2aacff4de3e11ce07","observation_id":"f9cbf5cd-57c8-4020-93be-59669aa174cc","resolution":{"observed_at":"2026-05-16T10:39:17.100641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:b1bc98618d50d1f6b97a327ca3f5cad29a978c841b6ae2ac4d41402353e2f9d0","observation_id":"7c9d7d79-955e-4dd1-b16d-b5ff256b9116","resolution":{"observed_at":"2026-05-13T22:50:24.184228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":"2205.10625","doi":"10.48550/arxiv.2205.10625","metadata_source":"pith","pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","venue":"cs.AI","work_id":"7e58c111-4666-4996-b5ad-1c8efd433083","year":2022},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:b659fbeb2083d809fae284eea483c8cb37ad6361ca9d6696732a4db670dc7b0b","observation_id":"6bb86c84-499c-42eb-b25a-3625162a46d7","resolution":{"observed_at":"2026-05-13T22:50:24.189906Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":13,"verified_fuzzy":42},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 80 inbound Pith citation observations for arXiv:2303.04671."}