{"as_of":"2026-08-12T07:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:558a6f7f7b1c09aca9011e180c257172a5c262b1fc1a9a34d3ad36b9a7a2ba23","coverage":[{"denominator":165,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:22:30.008355Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":166,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:34:47.025995Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1244,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:99e531dacc98ed57002187cea4735751eafc41bb828efaa9701f52771649826f","observation_id":"ceaa511f-c208-41ba-a69d-9cc06cca3cf5","resolution":{"observed_at":"2026-05-13T06:24:49.870511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T20:54:07.572136Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2205.14100"},"observation_digest":"sha256:c4c656a3d25d9a1c189bd54a18f3a032e0d84fa89421dfd2a1a69c37b1cbf36a","observation_id":"023dd40f-411f-4039-a98b-9996e60f3fd3","resolution":{"observed_at":"2026-05-16T20:54:07.617255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T07:38:37.734402Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2206.07682"},"observation_digest":"sha256:37db16b9b3150f3e7f1cc05df6363b9717d637474ca99ac8c482c41f3fed72c3","observation_id":"0bba0898-1685-4359-ae1d-b0edafcdd314","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-05-10T15:42:47.274448Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2207.05221"},"observation_digest":"sha256:2f9d5ce1ece5af0a7e864c238b1d4359bf31aa93e3c18084ddfa84acc5e1cffe","observation_id":"003da045-1e68-451d-8f6a-74272615c8d9","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-11T20:10:43.912935Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2207.05608"},"observation_digest":"sha256:009de01f20952be6d37298a9f8a310673235025f6bc6b6207566e61b8d234faa","observation_id":"d421aa9f-bb12-4a5e-8317-8e1d01ad052f","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2208.14649","last_updated":"2026-04-22T00:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-31T06:18:10Z","title":"DetailCLIP: Injecting Image Details into CLIP's Feature Space","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T11:08:20.298043Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2208.14649"},"observation_digest":"sha256:ed5326398449511a3d99e94cd803bcf10710dec9faa9ac7eb0a892745b0f3e85","observation_id":"f7ea1a89-21fc-4c73-993e-ee22d25cab11","resolution":{"observed_at":"2026-05-24T11:09:22.385769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:70604ed0d58f5c0a7d42435ec07b1180baced5c0cc221000fec2a39436dd9f77","observation_id":"fb4224aa-f985-475c-81dc-3de7d3d78a29","resolution":{"observed_at":"2026-05-16T09:29:06.199377Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:7a5211b777918be5df054f90ca0875d2450c86fb488a154dae3c711afd535e77","observation_id":"d68a3a7f-7a8e-4d40-8baa-1530aabb2bab","resolution":{"observed_at":"2026-05-13T14:22:17.143757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:fe8d56b9edea8b10b67f1f7f8fc6def872d0f6d5429509f45cb4e3dd1f5ea8d2","observation_id":"d2049dda-3ef6-4bac-969b-013080f9c875","resolution":{"observed_at":"2026-05-13T05:53:22.023486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:e95f2aa0e263a670dbfacefc4e3f706f7c95b869d24da59477973a9c050970f5","observation_id":"a5fdc50e-d18c-40f3-a275-45883e0e1775","resolution":{"observed_at":"2026-05-13T05:53:22.086217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6a5f2c34f24ef5df8022b8e7ee807182c25914d1bbb6519bebf8f03bdfabfb49","observation_id":"49c0baeb-7464-4264-972c-23a6bdcbc89b","resolution":{"observed_at":"2026-05-17T00:36:53.325661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T08:09:12.716163Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2212.04089"},"observation_digest":"sha256:3f9d5a83b70660667ea076e2428d12fc9fb60def1d3a6179c2da8bf9028018ff","observation_id":"01787d4e-e25d-4691-845d-50fd19f16128","resolution":{"observed_at":"2026-05-13T08:09:12.887999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T00:10:48.610351Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2301.12597"},"observation_digest":"sha256:e2b7e105924bc8da83546bd2f9a6e6d0f0840efa36e492a5d10e7e090b3137f3","observation_id":"fdc8c461-3412-4c4d-900c-f3fd96a9ad4f","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:40.524895Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2302.01560"},"observation_digest":"sha256:945327d973594b03d0d2d0d1b0c54d2abc9d2452b6bff88410d1120678315aa3","observation_id":"c5a07d5d-ce5f-4116-89dd-2a3ae99ee3bb","resolution":{"observed_at":"2026-05-16T03:27:40.765974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-11T09:48:55.827823Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T18:59:10.352342Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2302.11550"},"observation_digest":"sha256:07af5343ffff0f615ac790718cc4ce9f82776a3c0f878d5f32f358268f280be5","observation_id":"2acc12f0-f8ff-46b8-b57c-a1068ea79606","resolution":{"observed_at":"2026-05-17T18:59:10.403564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:1c251c3ab35a4584617e6d81f5bd62b743588588504b65c5395559a9921aaad7","observation_id":"02f15836-2537-456b-b3bf-1d45accaf8a4","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T01:17:58.678036Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2303.11381"},"observation_digest":"sha256:ebf8dbef0ae85142039cf6aa23e63088be075265bb74765be7dd032abf4c4c10","observation_id":"a2de8743-c579-4899-93b5-ad66d1f37fb1","resolution":{"observed_at":"2026-05-14T01:17:58.725804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:ad0e80dc181cf39ac69bb452fa28bd45842894b942bdf730fb2acddb2a6107b5","observation_id":"b753f1ca-d525-48a2-b9c6-4cba71bdd8aa","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T09:02:31.211260Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2304.14178"},"observation_digest":"sha256:bfa0a4cdddede808de8f691490aa4dc49eaf7886fd65bb8c2f8adae1d3859344","observation_id":"c966cff0-1189-4175-b608-21e0d3cb2f22","resolution":{"observed_at":"2026-05-24T09:04:15.076622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:01:45.164412Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2305.14325"},"observation_digest":"sha256:ab401cf306123b0dd438d72abd49d39a48a08981b24a2647996b5f460499e688","observation_id":"d0a9af47-fe4a-4aea-bbe6-a3a1611f838a","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-09T05:57:33.635614Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"reference_index":286,"source":"arxiv_source","source_observed_at":"2026-05-18T06:54:31.175090Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2305.15717"},"observation_digest":"sha256:6b4632dfa6dc3a2c1d3e8b22ab568028c018d04dd5cfa2961a7c469448bca0dc","observation_id":"2a38ea08-2339-4521-8dc1-6d55a11228b2","resolution":{"observed_at":"2026-05-18T06:54:31.425210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:e8a3ab508752b11b79d5666ac2960ba994911f4b0fe9dd036422afe0b49af33b","observation_id":"c1f02b5c-6bb4-47f6-9628-33cb6967eb42","resolution":{"observed_at":"2026-05-15T06:30:22.494018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:64d3ddbbaee35b935071fa77253b6c7b24c7ff46c3dfaf6e794e18e9745f1dc2","observation_id":"507f4628-57f0-4c6e-be51-69e72b93555e","resolution":{"observed_at":"2026-05-20T13:03:57.983622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":264,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:2c12c8a12d83332c80f4d2fba2729f330968841e74fe7dad48305f5c16cef225","observation_id":"e9a6250f-adb2-4b9d-8485-354dd1714aaf","resolution":{"observed_at":"2026-05-13T09:41:38.181572Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:71dd3d7d8286786b9ecfe6f510ffb708d55bdfdba8c117282828f0d55f2b5041","observation_id":"091873d3-ecd3-4905-9638-1e72546fe89c","resolution":{"observed_at":"2026-05-16T09:20:20.278429Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:f2da5df45a1442a2617b7cabce8a5184df5231eb06f45da79f53e06091ef276f","observation_id":"b70f5547-fd25-462f-a089-27a04a67daaf","resolution":{"observed_at":"2026-05-16T08:12:31.245786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T19:11:33.783746Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2310.03744"},"observation_digest":"sha256:9952f6eb19eb7cdd707f091baa277755a83ebd267ec53c1a1e85f083055f26bc","observation_id":"20a9a1d6-8938-4b6c-932b-0fa46ddf4b97","resolution":{"observed_at":"2026-05-12T19:11:33.831931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:8ee600949b02d540d4badc0931fcd3e0c0f61fec57de6e89a216a0775db3683f","observation_id":"47b0421e-9227-4d52-b309-3a812e2031e0","resolution":{"observed_at":"2026-05-17T20:22:35.111518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T19:40:13.816153Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2401.01614"},"observation_digest":"sha256:7a7bf6aade081bf127291b93c649b6d42c845ab55d2fd8e9637d90dabb736ae1","observation_id":"f1fca3cd-e7a3-4f40-ad64-1d6790b80043","resolution":{"observed_at":"2026-05-15T19:40:13.885466Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:870c8e81a933a90dd086bb644d6f7168ef1304428a59029ebdbdb66641d19bc4","observation_id":"a41e88da-fa86-44f2-95de-921cc11b02fd","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:f245176c47ddcded8a019e08b03345251a7d75b6bfa064397b403c3f277fd4d8","observation_id":"90723d26-e518-4bec-bcb4-51b9e928d255","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:cfc0b0ed3061fad83400b9a417935ca046697adebada64269352b09d5fb648ee","observation_id":"4301052c-2903-45d7-9e0d-cba4e2288d59","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-12T05:34:47.025995Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00373","last_updated":"2024-11-30T06:45:13Z","snapshot_observed_at":"2026-08-12T05:24:43.066659Z","submitted_at":"2024-11-30T06:45:13Z","title":"Approximate Fiber Product: A Preliminary Algebraic-Geometric Perspective on Multimodal Embedding Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T05:34:47.025995Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.00373"},"observation_digest":"sha256:da8d6915b6750ed13185cd35afa7842aeb5a53264c9f65938100883d5df6fddb","observation_id":"ded27548-0100-4ef9-8f7c-947b1dfd223b","resolution":{"observed_at":"2026-08-12T05:34:47.025995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-12T05:01:32.447223Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00800","last_updated":"2024-12-08T06:24:32Z","snapshot_observed_at":"2026-08-12T04:57:48.192135Z","submitted_at":"2024-12-01T13:01:01Z","title":"A Comprehensive Guide to Explainable AI: From Classical Models to LLMs","version":2},"reference_index":234,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:32.447223Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.00800"},"observation_digest":"sha256:18b65065f0562d418b688a4d25af7eb95ddd0d6bde7e46a594186ffecd21a1ae","observation_id":"39d49b10-cddd-43dc-9e55-f19a9b656251","resolution":{"observed_at":"2026-08-12T05:01:32.447223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T21:10:16.529113Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04954","last_updated":"2024-12-06T11:14:03Z","snapshot_observed_at":"2026-08-12T00:06:22.522160Z","submitted_at":"2024-12-06T11:14:03Z","title":"Gla-AI4BioMed at RRG24: Visual Instruction-tuned Adaptation for Radiology Report Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T21:10:16.529113Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.04954"},"observation_digest":"sha256:61fadacb30d205314c8eaed352a0a642812fbedc3e79fa694a82ed963582d255","observation_id":"abfa6e9c-6ade-47b0-9d00-6297e739ebbf","resolution":{"observed_at":"2026-08-11T21:10:16.529113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T18:40:21.730017Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.730017Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5f3857c0cd5bad5190d55fb90b26e3e44ef7959bf7224295627be029bf053a20","observation_id":"675d14c4-d3a2-45a6-a40d-716825cb5614","resolution":{"observed_at":"2026-08-11T18:40:21.730017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T20:41:44.976022Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-11T20:34:25.499794Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.976022Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:5b607efd7c2aa5d0b4867515e807c9b6fb7a5496ca153398d32b0c385fc2b7d7","observation_id":"5edea55d-0b14-4aca-a234-78064cce8fe4","resolution":{"observed_at":"2026-08-11T20:41:44.976022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T15:12:52.352469Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11258","last_updated":"2024-12-15T17:44:10Z","snapshot_observed_at":"2026-08-11T15:05:42.566368Z","submitted_at":"2024-12-15T17:44:10Z","title":"GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:12:52.352469Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.11258"},"observation_digest":"sha256:a4697596b4785c93157a126d0e791337b233b9508b697d256a16f10d2f2120f3","observation_id":"2fc05dbd-d25b-4d61-918b-68a7861d919a","resolution":{"observed_at":"2026-08-11T15:12:52.352469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T13:38:48.419921Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.419921Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:8163eb8e995dfbc6f124a9eaf6803a8c5f44743fa039f065bd1995b417887a79","observation_id":"f692c8d6-53e4-471b-b6b3-4483b6121e35","resolution":{"observed_at":"2026-08-11T13:38:48.419921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T11:48:07.102344Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.102344Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:59e0b68e35747e519a585a395a45937d3d8e75e8f2f2c7aa51417c435f40965f","observation_id":"cd9a2d0f-4f81-454b-86d7-ca7e8b50d817","resolution":{"observed_at":"2026-08-11T11:48:07.102344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T04:29:04.180247Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18826","last_updated":"2024-12-25T08:31:53Z","snapshot_observed_at":"2026-08-11T16:24:19.048579Z","submitted_at":"2024-12-25T08:31:53Z","title":"RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:29:04.180247Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.18826"},"observation_digest":"sha256:7bbf98f7432313ac4b123547d91f96aa75924ef85f53ebcd997ccce92344adec","observation_id":"67733d41-6039-4a1c-98b0-ba43ace8a2d0","resolution":{"observed_at":"2026-08-11T04:29:04.180247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T22:55:53.830145Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00569","last_updated":"2025-04-12T02:05:56Z","snapshot_observed_at":"2026-08-11T06:18:08.575362Z","submitted_at":"2024-12-31T17:54:29Z","title":"Probing Visual Language Priors in VLMs","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:55:53.830145Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.00569"},"observation_digest":"sha256:2c131c3dabb8acc5ea939653d4323caa372bf54514ac9ccd0a3894854d3c3808","observation_id":"02129c57-bde1-4233-92de-92c5abcbf6db","resolution":{"observed_at":"2026-08-10T22:55:53.830145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T22:28:31.925826Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02029","last_updated":"2025-01-03T07:01:15Z","snapshot_observed_at":"2026-08-10T22:20:27.188155Z","submitted_at":"2025-01-03T07:01:15Z","title":"Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:28:31.925826Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.02029"},"observation_digest":"sha256:eb61cb2253bdc9110ddd119b905c5a93b640ae927e5114a99a5f8e18f0617104","observation_id":"b9c4fec2-817a-4805-9ccd-b4a3e6751c7d","resolution":{"observed_at":"2026-08-10T22:28:31.925826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T22:17:27.398595Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.398595Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:7e51f9694490885ea7aadb337f9ba773e5726066f76c88f14e3b5c25b0d083b8","observation_id":"8fdf7032-bfc8-4664-b3fa-fdda4914506e","resolution":{"observed_at":"2026-08-10T22:17:27.398595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T21:46:28.028582Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03939","last_updated":"2025-01-11T14:21:37Z","snapshot_observed_at":"2026-08-11T03:31:24.809067Z","submitted_at":"2025-01-07T17:00:35Z","title":"Visual question answering: from early developments to recent advances -- a survey","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:46:28.028582Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.03939"},"observation_digest":"sha256:af4b10fe3c72a31066b95ca6de173a725ce65b66f376e17aa49f7d0f261dbebc","observation_id":"8c3bd792-8956-4fc2-b8c7-bf9bcec7fb30","resolution":{"observed_at":"2026-08-10T21:46:28.028582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T20:51:53.527412Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.527412Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:0c6b7abb0dc6aec531ec6b44e0b438d7de1667d59b091811b75f4bcf28c0d84b","observation_id":"7d57b587-6a4a-43eb-b6c3-75d10307ed32","resolution":{"observed_at":"2026-08-10T20:51:53.527412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T20:39:43.912259Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07802","last_updated":"2025-01-14T03:03:37Z","snapshot_observed_at":"2026-08-10T22:06:30.400320Z","submitted_at":"2025-01-14T03:03:37Z","title":"Visual Language Models as Operator Agents in the Space Domain","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:43.912259Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.07802"},"observation_digest":"sha256:ec0703c175206c9d774d98f50bcd03b0645a96b4e31d0c933b7508fc5a8dfe87","observation_id":"05431307-5a32-4082-8371-4b90293353ee","resolution":{"observed_at":"2026-08-10T20:39:43.912259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T16:22:20.758477Z","title":"ArXiv, abs/2204.14198","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13976","last_updated":"2025-01-23T00:19:14Z","snapshot_observed_at":"2026-08-10T18:11:37.897333Z","submitted_at":"2025-01-23T00:19:14Z","title":"Towards Safer Social Media Platforms: Scalable and Performant Few-Shot Harmful Content Moderation Using Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T16:22:20.758477Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.13976"},"observation_digest":"sha256:37b4d2aded81edd94ea65d0d20c6418f93238fa00c2a056aae1272f48f4cc6c3","observation_id":"48cbdffa-6db0-4dea-9421-54a27d1af176","resolution":{"observed_at":"2026-08-10T16:22:20.758477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T15:17:54.010963Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14210","last_updated":"2025-01-24T03:28:37Z","snapshot_observed_at":"2026-08-11T03:57:33.724741Z","submitted_at":"2025-01-24T03:28:37Z","title":"PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T15:17:54.010963Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.14210"},"observation_digest":"sha256:482f3b860660ea9dafe6ffdf1672d29fb1872269e2805614b39e9450c67bf7d9","observation_id":"8f521cca-703d-417b-88cf-938d9f19fdc2","resolution":{"observed_at":"2026-08-10T15:17:54.010963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T10:54:06.048139Z","title":"Flamingo: A visual language model for few- shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16769","last_updated":"2025-07-02T01:46:17Z","snapshot_observed_at":"2026-08-12T06:36:21.942137Z","submitted_at":"2025-01-28T07:49:52Z","title":"Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T10:54:06.048139Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.16769"},"observation_digest":"sha256:7ea21a6c782a08c476561d05ec5e33709bd99baa882c2cdb68d265fcbd61f403","observation_id":"6f91db66-a518-4fdf-860f-52a5e47d5eb1","resolution":{"observed_at":"2026-08-10T10:54:06.048139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T00:58:34.687621Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.687621Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:9616cec010dd021fc8496cf3e6498ce7cc1d9fda8d1a1718b7f8c6d9fa0def03","observation_id":"5d2ec1ba-9818-4141-b1c4-60a0ad8879fd","resolution":{"observed_at":"2026-08-10T00:58:34.687621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-09T18:05:52.203599Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00718","last_updated":"2025-07-10T14:44:44Z","snapshot_observed_at":"2026-08-09T21:15:27.675893Z","submitted_at":"2025-02-02T08:36:23Z","title":"\"I am bad\": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T18:05:52.203599Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.00718"},"observation_digest":"sha256:29331aa83e978f57b50ccc3590140b651adf261bd37aa9149c859e29c7be3b96","observation_id":"7bf96aeb-feb5-4280-8404-bf68c1088b43","resolution":{"observed_at":"2026-08-09T18:05:52.203599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-09T12:25:08.685367Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02370","last_updated":"2025-02-04T14:51:29Z","snapshot_observed_at":"2026-08-11T01:46:25.979390Z","submitted_at":"2025-02-04T14:51:29Z","title":"Mirai: A Wearable Proactive AI \"Inner-Voice\" for Contextual Nudging","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T12:25:08.685367Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.02370"},"observation_digest":"sha256:09ffeec512b1ff1c6d6be133a14532d23e48ccc745fbfbff3d7b4c18c7384151","observation_id":"c1f4af97-9df2-48a2-9752-2493d90474de","resolution":{"observed_at":"2026-08-09T12:25:08.685367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-08T13:35:05.044985Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-10T05:59:21.497164Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.044985Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:621e4f3e603be231d69ad060d2d2f2acfa57e2454e74da206a451d1d1ec4260b","observation_id":"cc374f1e-019e-4885-8ded-cd4e36732e6b","resolution":{"observed_at":"2026-08-08T13:35:05.044985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-08T00:03:16.308743Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08643","last_updated":"2025-02-18T16:45:59Z","snapshot_observed_at":"2026-08-09T11:31:44.840528Z","submitted_at":"2025-02-12T18:57:22Z","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:03:16.308743Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.08643"},"observation_digest":"sha256:9bf56e8f7ba5bac2abd585d5e932238e780022abb109402d938a49c77248cdf7","observation_id":"142373a9-c858-4b13-9cd2-3eb74d7aae02","resolution":{"observed_at":"2026-08-08T00:03:16.308743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T22:51:02.035005Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-12T01:21:40.141473Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.035005Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:1da0609b0316abddea2fef2b2965b26969adc2e16ceeb9b093be3ebf488d48d3","observation_id":"e3a99080-5ac5-41f9-a351-04e6bdf735ed","resolution":{"observed_at":"2026-08-07T22:51:02.035005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T20:06:00.672714Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-08-10T18:50:32.127116Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T20:06:00.672714Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.09927"},"observation_digest":"sha256:1fd1113d0a41c4825738fa19e2bcb8c05d0f9c9b8e6cd91e1d0d9a90f1666069","observation_id":"cb625869-bd87-4cf4-8317-493e3f46aed4","resolution":{"observed_at":"2026-08-07T20:06:00.672714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T16:33:23.448566Z","title":"arXiv:2204.14198 [cs.CV] https://arxiv.org/abs/2204.141 98","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.15712","last_updated":"2025-01-22T18:32:12Z","snapshot_observed_at":"2026-08-11T02:26:05.375139Z","submitted_at":"2025-01-22T18:32:12Z","title":"GPUs, CPUs, and... NICs: Rethinking the Network's Role in Serving Complex AI Pipelines","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T16:33:23.448566Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.15712"},"observation_digest":"sha256:d173f792fe1916e196721a9611608abe172990a7075a50cf3783711ff308aa31","observation_id":"1fe77a1d-50ec-4d0c-b45f-31d07352f173","resolution":{"observed_at":"2026-08-10T16:33:23.448566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T15:10:06.972843Z","title":"Flamingo: a visual language model for few-shot learning.arXiv preprint arXiv:2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16149","last_updated":"2025-05-22T02:47:36Z","snapshot_observed_at":"2026-08-11T17:21:49.600191Z","submitted_at":"2025-05-22T02:47:36Z","title":"When VLMs Meet Image Classification: Test Sets Renovation via Missing Label Identification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:06.972843Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.16149"},"observation_digest":"sha256:b48faf10dcc7c457ffba7f6982db9aa23bf2325b8596dd035bedec476a730d7b","observation_id":"48a3e18a-4e49-49f5-ae0b-0819e9da3985","resolution":{"observed_at":"2026-08-07T15:10:06.972843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T15:06:04.134589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16326","last_updated":"2025-08-04T06:14:13Z","snapshot_observed_at":"2026-08-10T07:26:23.903392Z","submitted_at":"2025-05-22T07:32:17Z","title":"ChemMLLM: Chemical Multimodal Large Language Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:06:04.134589Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.16326"},"observation_digest":"sha256:66ee20140d8ec798007ead9128fcd94440ad4791f6ad7821e055e9412eb6b3e1","observation_id":"73c87c79-8445-4673-924d-e5bcdbb80462","resolution":{"observed_at":"2026-08-07T15:06:04.134589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T14:37:47.145455Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-10T17:27:09.159914Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.145455Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f691c4a82e23924f5f21a226fccddea9411d52e96161b81a4f82898258901d1e","observation_id":"796be892-b44a-4377-ac8d-ab004995c347","resolution":{"observed_at":"2026-08-07T14:37:47.145455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T14:51:05.230269Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18214","last_updated":"2025-05-23T00:51:16Z","snapshot_observed_at":"2026-08-11T01:29:43.528533Z","submitted_at":"2025-05-23T00:51:16Z","title":"LA-RCS: LLM-Agent-Based Robot Control System","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:05.230269Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.18214"},"observation_digest":"sha256:a92aa14bb4f94b9e451f2a31fe7c9e2c41ed1aa109a7d2e5e8231ee4e788f505","observation_id":"f5bde0b2-ca05-4e48-90ce-8d2ca28116ef","resolution":{"observed_at":"2026-08-07T14:51:05.230269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T13:08:02.224914Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.224914Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:923f2d51d505d177017828121fa97c6d4b7a143f113d98a4168b67be73feb895","observation_id":"90463c61-bf5e-443d-8851-0b8611e30f46","resolution":{"observed_at":"2026-08-07T13:08:02.224914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T12:16:22.058110Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.058110Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:0a3f3e65a768e6e75607ed2decb04516a358d3c6e1518346a40fef42e4910348","observation_id":"2d9246e3-756a-499c-88e0-38d0731381b7","resolution":{"observed_at":"2026-08-07T12:16:22.058110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T11:58:08.090193Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.090193Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:27c2e3ff1782a9d18703fcf447b0416fc165f46abd8dc918796d291825270b80","observation_id":"f205f64e-d814-4608-b617-3f2535bf5cc7","resolution":{"observed_at":"2026-08-07T11:58:08.090193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T11:56:32.233009Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01031","last_updated":"2025-06-01T14:21:02Z","snapshot_observed_at":"2026-08-10T01:11:03.912616Z","submitted_at":"2025-06-01T14:21:02Z","title":"NavBench: Probing Multimodal Large Language Models for Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:32.233009Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.01031"},"observation_digest":"sha256:d6a4f9735ae71ad57835e6a51788c582e0696df0fe6de3941ff5e2944d70920c","observation_id":"43a30cec-1dad-4cb1-9574-8989f357a51c","resolution":{"observed_at":"2026-08-07T11:56:32.233009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T11:27:47.059429Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02452","last_updated":"2025-08-24T13:14:45Z","snapshot_observed_at":"2026-08-10T09:46:18.291674Z","submitted_at":"2025-06-03T05:17:37Z","title":"ANT: Adaptive Neural Temporal-Aware Text-to-Motion Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:27:47.059429Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.02452"},"observation_digest":"sha256:a4321485de244cc82302c9dbd561711f58d014bfde5361b22d6089ee8067af3d","observation_id":"eed9cf06-d45b-4a21-88c0-8dfa30cc481d","resolution":{"observed_at":"2026-08-07T11:27:47.059429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T06:05:39.399224Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06231","last_updated":"2025-08-16T20:27:12Z","snapshot_observed_at":"2026-08-09T12:30:33.058510Z","submitted_at":"2025-06-06T16:50:37Z","title":"Towards an Explainable Comparison and Alignment of Feature Embeddings","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:39.399224Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.06231"},"observation_digest":"sha256:5696e78e3f95a20987345381cad2910912a863397233ad2598087865adc2f257","observation_id":"910ecde8-b4f4-4ebf-8984-efea7b666151","resolution":{"observed_at":"2026-08-07T06:05:39.399224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T11:30:53.496195Z","title":"Flamingo: a visual lan- guage model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06353","last_updated":"2025-06-02T18:58:57Z","snapshot_observed_at":"2026-08-09T08:21:47.546274Z","submitted_at":"2025-06-02T18:58:57Z","title":"Large Language Models for EEG: A Comprehensive Survey and Taxonomy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:53.496195Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.06353"},"observation_digest":"sha256:7739352639bec6eaed560dbb30a30fc021992d1fcfdd4079d063ed3cb8fbd26d","observation_id":"f4858d70-7495-440f-a5b2-17793a48ed6a","resolution":{"observed_at":"2026-08-07T11:30:53.496195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T05:25:31.832536Z","title":"Flamingo: a Visual Language Model for Few - Shot Learning , November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.832536Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:433ea1733fcb6e8f0d3f49297d063eccf8ad6b9147a597e0f6978c325667a678","observation_id":"3da569a7-e35e-43b7-831e-8a15fb0eeb92","resolution":{"observed_at":"2026-08-07T05:25:31.832536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T05:10:48.454540Z","title":"Flamingo: a visual language model for few-shot learning.arXiv preprint arXiv:2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08666","last_updated":"2025-06-13T05:32:59Z","snapshot_observed_at":"2026-08-07T05:02:38.130320Z","submitted_at":"2025-06-10T10:27:52Z","title":"LLaVA-c: Continual Improved Visual Instruction Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:48.454540Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.08666"},"observation_digest":"sha256:7b64117142f08c2c127b25f4297a742e353bc6cc06bca97837cad54d0e91e65d","observation_id":"d3195398-5253-497d-a3c5-705797a42e3e","resolution":{"observed_at":"2026-08-07T05:10:48.454540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T04:42:02.564894Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning.arXiv, April 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09958","last_updated":"2025-06-11T17:31:38Z","snapshot_observed_at":"2026-08-08T12:16:45.655003Z","submitted_at":"2025-06-11T17:31:38Z","title":"Kvasir-VQA-x1: A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:02.564894Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.09958"},"observation_digest":"sha256:63bcfb411d554c42e74659a9b78a50e862d95e619c0aa1c016fad99f351438fb","observation_id":"a2c6ce8e-7a85-4ee8-bff5-7d04aa538d59","resolution":{"observed_at":"2026-08-07T04:42:02.564894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T04:42:22.457907Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.457907Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:b52ad2e0a6e87a8f1e36d8b1494b1eef85d95b55854554383a26de0e0bb82875","observation_id":"086ef63c-0e52-4f4d-a69f-f2d391546eae","resolution":{"observed_at":"2026-08-07T04:42:22.457907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T04:35:44.061335Z","title":"Flamingo: A visual language model for few-shot learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.061335Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:fde2c69e795a01292a3937b99f935509c42072c4b1601da9504d4f62502774b9","observation_id":"7a7396c1-0d9e-40bb-8825-e7a11f03ed87","resolution":{"observed_at":"2026-08-07T04:35:44.061335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T00:47:50.343150Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12724","last_updated":"2025-06-15T05:15:52Z","snapshot_observed_at":"2026-08-12T03:23:10.547605Z","submitted_at":"2025-06-15T05:15:52Z","title":"Dynamic Modality Scheduling for Multimodal Large Models via Confidence, Uncertainty, and Semantic Consistency","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:47:50.343150Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.12724"},"observation_digest":"sha256:9e692da387b90724e4dd673e6a61088f6a5b48907e22b7134247cfd21aa5d9e1","observation_id":"63157067-04a8-4578-be86-a399723a710e","resolution":{"observed_at":"2026-08-07T00:47:50.343150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T00:41:16.316084Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13205","last_updated":"2025-09-05T14:19:03Z","snapshot_observed_at":"2026-08-09T12:14:05.556317Z","submitted_at":"2025-06-16T08:09:32Z","title":"Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents","version":6},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:41:16.316084Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.13205"},"observation_digest":"sha256:b109360d399b06ad5246a431d6782720bfdc5534b2d56774d4a87dec559873fe","observation_id":"047da159-882b-4a99-82a3-4ae4a11b850c","resolution":{"observed_at":"2026-08-07T00:41:16.316084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T23:42:11.568556Z","title":"Flamingo: a visual language model for few-shot learning.ArXiv, abs/2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-11T00:54:41.191381Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.568556Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:e94ddf75d123ae800a8a3e08dde83712af40f8b0c1e6baf5e4103fb3d5c92cfc","observation_id":"5ddc843a-52dd-4c47-bc13-381f8f0a0edb","resolution":{"observed_at":"2026-08-06T23:42:11.568556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2506.20616","last_updated":"2026-05-07T01:33:15Z","snapshot_observed_at":"2026-08-11T06:05:27.332772Z","submitted_at":"2025-06-25T17:04:08Z","title":"Shape2Animal: Creative Animal Generation from Natural Silhouettes","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:42.121060Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.20616"},"observation_digest":"sha256:79107815522ad8305d829f88702b0b3a8ced509c9273b6b8b5845600536e7771","observation_id":"4a1a7083-b142-43d2-96a9-2404d4e8f116","resolution":{"observed_at":"2026-05-19T07:27:08.866082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T20:59:07.191372Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01334","last_updated":"2025-07-03T13:15:11Z","snapshot_observed_at":"2026-08-09T21:32:08.058029Z","submitted_at":"2025-07-02T03:51:16Z","title":"Symbolic or Numerical? Understanding Physics Problem Solving in Reasoning LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:59:07.191372Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.01334"},"observation_digest":"sha256:db44ee83db9a7df9f0d6b73585a773236cfd676d4841f9fd1ec083d01cfb099c","observation_id":"9eb300ff-d89e-499c-9e39-8ca49f5425d9","resolution":{"observed_at":"2026-08-06T20:59:07.191372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T20:38:27.564674Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.564674Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c5443d794074c54b9a61bf6f7ae760aa0ae4c34de47fb943354754043de55e46","observation_id":"45eb87ab-6ff5-493e-a973-cf7ec64bea59","resolution":{"observed_at":"2026-08-06T20:38:27.564674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T21:46:07.771553Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02957","last_updated":"2025-06-30T02:11:20Z","snapshot_observed_at":"2026-08-10T07:28:13.283512Z","submitted_at":"2025-06-30T02:11:20Z","title":"CS-VLM: Compressed Sensing Attention for Efficient Vision-Language Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:07.771553Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.02957"},"observation_digest":"sha256:38f510ea37e6ba22272a2ac484b904e025e021d57cbc1cc412750587a21eab50","observation_id":"aef837c9-0992-4bdb-94ae-3e0afcd318a1","resolution":{"observed_at":"2026-08-06T21:46:07.771553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T20:13:44.966493Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:44.966493Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:b4b6e7d93b1b9cf2c832846fa11a9b5c97acd6932c59f04a6b8c42b3bbf0379e","observation_id":"0bdd19ee-a710-47ff-b531-5ce9f118ab5d","resolution":{"observed_at":"2026-08-06T20:13:44.966493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T18:06:23.486547Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09209","last_updated":"2025-07-12T09:03:30Z","snapshot_observed_at":"2026-08-10T11:51:30.448443Z","submitted_at":"2025-07-12T09:03:30Z","title":"Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:06:23.486547Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.09209"},"observation_digest":"sha256:7402b4c6a1321b0a9c2069fa7a3620058d3eb22cc682c047115d48a6e3c3a410","observation_id":"b47d0111-3248-4caf-b0fe-8b3b56c6c592","resolution":{"observed_at":"2026-08-06T18:06:23.486547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T17:57:40.312626Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09535","last_updated":"2025-07-13T08:32:32Z","snapshot_observed_at":"2026-08-06T17:51:06.878303Z","submitted_at":"2025-07-13T08:32:32Z","title":"Reframing SAR Target Recognition as Visual Reasoning: A Chain-of-Thought Dataset with Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:57:40.312626Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.09535"},"observation_digest":"sha256:f7b4e0bb50f64bda560f230a8670d4534b944f64d747735ec83523780e6648a5","observation_id":"01a6443d-3f02-4fbf-947b-b3fce020aaf1","resolution":{"observed_at":"2026-08-06T17:57:40.312626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T16:42:13.216833Z","title":"Flamingo: a visual lan- guage model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12916","last_updated":"2025-07-17T09:02:04Z","snapshot_observed_at":"2026-08-11T15:45:25.444647Z","submitted_at":"2025-07-17T09:02:04Z","title":"Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:13.216833Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.12916"},"observation_digest":"sha256:1b2b35341ea0887f9aa8ba147d49f9aa770cdb055723c2f5f3f2df6aff42bf0d","observation_id":"73415d10-33d0-4ca3-9d97-e4ad7e0be999","resolution":{"observed_at":"2026-08-06T16:42:13.216833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T16:39:19.755081Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15875","last_updated":"2025-07-17T09:05:34Z","snapshot_observed_at":"2026-08-07T23:04:29.954585Z","submitted_at":"2025-07-17T09:05:34Z","title":"Differential Multimodal Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:19.755081Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.15875"},"observation_digest":"sha256:79617d815ae6c7411e654971ccede1efb889cd0ba500beaf56990a102dbdb298","observation_id":"c2067c6a-28c9-4368-b872-dce6d1a22381","resolution":{"observed_at":"2026-08-06T16:39:19.755081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T11:45:25.682150Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.682150Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:eb82edb51737e2793682e790cc2a70942326e9638b75de7b55302ca51743de1d","observation_id":"9fa5cd60-95ba-42e4-871e-3961f6655280","resolution":{"observed_at":"2026-08-06T11:45:25.682150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T14:33:29.392262Z","title":"Wenbin An, Feng Tian, Jiahao Nie, Wenkai Shi, Haonan Lin, Yan Chen, Qianying Wang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:29.392262Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:616a07b592d673b9e83bfcaf323e69fcf3192adb40bef76aa7ac18a3114adb63","observation_id":"d743f260-fd95-42d4-8140-e576d9fd42ed","resolution":{"observed_at":"2026-08-06T14:33:29.392262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T05:49:51.471076Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.471076Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:fb6b624cb01c32c4dd982ccaccdba14a1f4bacefb3515216aa732ba511a2281b","observation_id":"dc5a86d8-dd3d-48ca-a4c8-8cc0eb4a778d","resolution":{"observed_at":"2026-08-06T05:49:51.471076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T20:10:56.814518Z","title":"Alayrac, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11153","last_updated":"2025-08-15T01:49:58Z","snapshot_observed_at":"2026-08-05T20:10:56.184580Z","submitted_at":"2025-08-15T01:49:58Z","title":"LEARN: A Story-Driven Layout-to-Image Generation Framework for STEM Instruction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:56.814518Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.11153"},"observation_digest":"sha256:880dfa77e102b2c944a03a2d07128baeee199f79a51128c7cea63a707ddb8396","observation_id":"2b7a9b58-17b4-4205-a330-8714e8cd6787","resolution":{"observed_at":"2026-08-05T20:10:56.814518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T19:39:48.032858Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.032858Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:ca85af08704a79673afa3869a8c192a1f3d60b10aa1169fda9168a1a9f86d98c","observation_id":"7df1ea6a-cf53-4abe-8f61-2d24ae8de02a","resolution":{"observed_at":"2026-08-05T19:39:48.032858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T17:56:49.630598Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:49.630598Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:77fae178471c8c54507f6624261aaff35146187a9de0cd771b1d444cdd8795a5","observation_id":"5b34e853-a4bf-445b-9064-f9c98f78ffde","resolution":{"observed_at":"2026-08-05T17:56:49.630598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T10:59:05.052003Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-08T23:16:11.446216Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.052003Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:aafc570794229dcc79383226b3dd901ace3b6f8b003370a7973010609f0ea81a","observation_id":"97c46b42-392a-4835-a400-0d62648a5eae","resolution":{"observed_at":"2026-08-05T10:59:05.052003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-04T22:10:23.484160Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.07488","last_updated":"2025-09-09T08:08:35Z","snapshot_observed_at":"2026-08-04T22:10:17.534720Z","submitted_at":"2025-09-09T08:08:35Z","title":"Fine-Tuning Vision-Language Models for Visual Navigation Assistance","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T22:10:23.484160Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2509.07488"},"observation_digest":"sha256:6c1ce8241c829518ec71f5aa0baf2424f47533199874abd4c81186add6fc30d9","observation_id":"80464c7d-37da-4619-a08e-6043273e5877","resolution":{"observed_at":"2026-08-04T22:10:23.484160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-04T13:51:48.855655Z","title":"Flamingo: a visual language model for few-shot learning.arXiv preprint arXiv:2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-10T09:36:07.326330Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.855655Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:9f1b902394b348191fd4aab50a40cd39977b943cae9557f6a035b159a0ced919","observation_id":"6792aaef-5272-4ac6-8c45-0e485246dc4a","resolution":{"observed_at":"2026-08-04T13:51:48.855655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-04T12:44:41.101436Z","title":"Anthropic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02528","last_updated":"2026-05-29T19:41:43Z","snapshot_observed_at":"2026-08-07T21:53:59.199146Z","submitted_at":"2025-10-02T19:55:56Z","title":"Multimodal Function Vectors for Visual Relations","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T12:44:41.101436Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2510.02528"},"observation_digest":"sha256:85989d13c5f71714b846066f9ea61f644e37b0e175da62cd68fa49a5d269dd15","observation_id":"c3ce60a4-f745-44e6-921f-7c994602a1d8","resolution":{"observed_at":"2026-08-04T12:44:41.101436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2511.10292","last_updated":"2026-05-19T09:24:10Z","snapshot_observed_at":"2026-08-03T13:28:59.205168Z","submitted_at":"2025-11-13T13:29:38Z","title":"Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-21T18:47:28.768554Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2511.10292"},"observation_digest":"sha256:bd9b4e7b41a7c90b05a2af869d5ba420a4724be84bbf9a74078bac032decb6e1","observation_id":"6a78b63a-8516-425c-af10-365c57d7375f","resolution":{"observed_at":"2026-05-21T18:50:30.118231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2511.15578","last_updated":"2025-11-19T16:09:38Z","snapshot_observed_at":"2026-08-11T17:24:10.391404Z","submitted_at":"2025-11-19T16:09:38Z","title":"AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T20:18:19.580156Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2511.15578"},"observation_digest":"sha256:6d4161e1d8311db345ac367fe6054a7909e8fb4ca0f0b1721e0e6837e76c26c2","observation_id":"798de04f-8adf-42b6-9def-1d03258404dd","resolution":{"observed_at":"2026-05-17T20:20:11.809708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2511.17411","last_updated":"2026-04-27T17:16:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T17:09:43Z","title":"SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T20:21:12.375936Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2511.17411"},"observation_digest":"sha256:78242b2241f531e257b91d81b65febb716156a8f0a84d43dde855ead7698f9e4","observation_id":"9749a4ea-f322-41c3-b0f5-35db95e60391","resolution":{"observed_at":"2026-05-17T20:22:04.564118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-02T19:41:30.290370Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:30.290370Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:47f075a55327a6d01d5b1386cb495591c3dcc674de1cf685b9775dce01aa4b02","observation_id":"912dd5cc-333f-4773-ae8a-737c921ee3a1","resolution":{"observed_at":"2026-08-02T19:41:30.290370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2204.14198/citation-record","integrity":"/paper/2204.14198/integrity","json":"/paper/2204.14198/citation-record.json","paper":"/paper/2204.14198"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.07520","last_updated":"2022-01-19T10:45:38Z","snapshot_observed_at":"2026-08-08T01:56:14.270706Z","submitted_at":"2022-01-19T10:45:38Z","title":"CM3: A Causal Masked Multimodal Model of the Internet","version":1},"cited_work":{"arxiv_id":"2201.07520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.07520","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2201.07520 , year=","venue":null,"work_id":"a4a6d3b6-13f5-437f-8081-765dd23198b9","year":2025},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2201.07520","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:c4a93f1f8c00e57b713e53cb4c0e6f30eb916a7ebbe39ea32de481a1d45d021e","observation_id":"70778e2e-984c-40f1-9fb0-0c0b8d3eead3","resolution":{"observed_at":"2026-05-12T04:22:30.133071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- supervised multimodal versatile networks","venue":null,"work_id":"e74d2746-7572-448e-8003-4c1fae31a40a","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:2df0ae80d11a2d58b9f72f325441c909bab6741090fd4e1cb1544743d8d6a918","observation_id":"9ac766f7-5b89-4aac-98e4-0329f5641652","resolution":{"observed_at":"2026-05-12T04:22:30.747983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"548eb6b4-1874-4aa2-969b-19acfeeaee96","year":2015},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:e3e8544e4e37a56d51494d77d50135d1be5b72ff6fdc5c046d34f69da2898145","observation_id":"a1062d83-a7ab-42f2-99b0-704822c4e37a","resolution":{"observed_at":"2026-05-12T04:22:30.751062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ReZero is all you need: Fast convergence at large depth","venue":null,"work_id":"82499e42-eeae-4e7d-ab71-0de96b6d8375","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:ad097c195053387a2a1b707f666c9371acc60f97995554d8962574e1dbda7b5b","observation_id":"27d0936e-919a-43a9-99ee-0847ab0ec610","resolution":{"observed_at":"2026-05-12T04:22:30.756766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"d3aa5269-4c2c-4a7f-beab-c2b03cf52e57","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:afe52ffd32b4f7fb892c1c83176df6f566de0c87da416652fc6daa4a7a49bd83","observation_id":"a9be39e4-523d-40d9-bb69-bbedfaaa0cc5","resolution":{"observed_at":"2026-05-12T04:22:30.767228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Henriques, Jack Valmadre, Philip Torr, and Andrea Vedaldi","venue":null,"work_id":"4f9334cd-84be-45c4-8d65-ecfff835330e","year":2016},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:974d13760793def408ecd78efcb2bbf6e6df5271ef5035646580b3c7beb2738e","observation_id":"01ab33df-4bcc-422b-9a4e-f1ec70c1d8ee","resolution":{"observed_at":"2026-05-12T04:22:30.771825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08136","last_updated":"2019-07-24T14:43:31Z","snapshot_observed_at":"2026-08-10T12:54:21.108689Z","submitted_at":"2018-05-21T15:44:51Z","title":"Meta-learning with differentiable closed-form solvers","version":3},"cited_work":{"arxiv_id":"1805.08136","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-learning with differentiable closed-form solvers","venue":"cs.CV","work_id":"b613b3f1-1e74-44db-892d-defe8cdbc26a","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1805.08136","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:cf0e5125fd19c877da399b7bc2127ed107b7dba939523e34f38b5c5e0b382fe7","observation_id":"fbf68780-77f1-4c04-85e5-bb99bb549a9f","resolution":{"observed_at":"2026-05-12T04:22:30.625153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JAX: composable transformations of Python+NumPy programs","venue":null,"work_id":"eb8121c8-5208-4ea2-94b7-81138b112d3a","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:2e8c4202489829849c53d02acaae5cd4233ef9dcb8e167c3e1d41ad963c7743b","observation_id":"0b7577f0-4794-47cf-b8bd-8a66eedd4310","resolution":{"observed_at":"2026-05-12T04:22:30.780109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0679ac6f-c3d3-4537-b685-e25bd2cb17ab","year":1990},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:17176e9a5aa728609bd24eb2d981974d7258b3f57e297188a85ac7054fafe4de","observation_id":"857b7d0f-da3b-48ed-9540-b3e5d005af2a","resolution":{"observed_at":"2026-05-12T04:22:30.789363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06171","last_updated":"2021-02-11T18:23:20Z","snapshot_observed_at":"2026-08-11T18:32:33.968297Z","submitted_at":"2021-02-11T18:23:20Z","title":"High-Performance Large-Scale Image Recognition Without Normalization","version":1},"cited_work":{"arxiv_id":"2102.06171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.06171","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, and Karen Simonyan","venue":null,"work_id":"38e1ea86-9d6e-4ac3-8a9a-b780b771bea0","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2102.06171","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:6307d978a919191553eb89c377b3bcf60947f29444c2cc8a89f5346e104494f7","observation_id":"359f8b36-d44c-44f7-a474-e14b426c4e43","resolution":{"observed_at":"2026-05-12T04:22:30.232180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9ed33af8-8b23-4a22-b1fb-1afad6801987","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:6853c0c34a913bbf2bdfc8ff89eb6cfb5173fd31f680d65deec51dcead439c98","observation_id":"3cd128ba-bb5b-49f0-89e0-a8782ef9051b","resolution":{"observed_at":"2026-05-12T04:22:30.796728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gender shades: Intersectional accuracy disparities in commercial gender classiﬁcation","venue":null,"work_id":"398e0a74-066a-42d4-91f4-ebe63edc2e2b","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:0ea5ce10896894d5a31f35abc9be31d76dd84364e4ba072d7c3074ad798f81f9","observation_id":"63f56a12-30c0-4d20-801a-dd6142fcc0a3","resolution":{"observed_at":"2026-05-12T04:22:30.800217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"cea2b538-1070-448c-a287-5220b4c9419d","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:3f32eed14e708044ce5f63b5a3065c78e20d9a441ba3a5bd11ed635e06150162","observation_id":"d7e16df7-f972-4827-9757-a25082f6efe1","resolution":{"observed_at":"2026-05-12T04:22:30.803262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"b0cfcab7-4acf-4f5e-b61b-d61b8cd3732c","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:ca0dacde1eae5bfe161d0619e4babd6be38191b0607ab0ff02ac948a16d06d6e","observation_id":"112ee62b-5ad6-4a1a-9f39-ff3f640f861c","resolution":{"observed_at":"2026-05-12T04:22:30.806769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:d20b49233ed5a603db12fe9bf85db1468ad7db296f19c25bce4f2b38f1df1e42","observation_id":"9bd9d5a2-0df3-4e36-a224-5533aea59dae","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UNITER: Universal image-text representation learning","venue":null,"work_id":"619d1557-0adf-4a20-87c2-b4ac1fb28ea8","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:f1950cab0425f075f8f4fac841f874ea0324b3c8b03e674acd6534d4b7a33822","observation_id":"e083d66e-0e2c-4ef5-add9-10b682474612","resolution":{"observed_at":"2026-05-12T04:22:30.810219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":"5a4602a8-0500-4a5f-ab19-85e9a993b517","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:46fb471c82393e1eaaa841c8da03b9f0fd6a04782c58a0844fba7b543f037d2a","observation_id":"77ed2ac9-32b5-4171-8cee-b9354753f54f","resolution":{"observed_at":"2026-05-12T04:22:30.814300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:94a5054f61f1c59377390c94921ce984ac8c82bba9ebce99a5bfa429018996df","observation_id":"5563f1ea-d7c6-4120-80aa-d8bddbddfb64","resolution":{"observed_at":"2026-05-12T04:22:30.327417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enabling multimodal generation on clip via vision-language knowledge distillation","venue":null,"work_id":"030f2e42-363f-4cff-910c-42ff89b0a484","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:e14b554d63fd61a979ddcf8f0895a7c9e44ffc8c8e3bfc24f1464086ba88f39a","observation_id":"b077227d-0ea7-4002-8dfb-fe2d8f57ffeb","resolution":{"observed_at":"2026-05-12T04:22:30.818007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual dialog","venue":null,"work_id":"4bbe8b14-3fd6-4bf8-995c-a8e397b38fdb","year":2017},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:b761b87952d1e2f29e2edc68a4c0173d3cec0fb556645fe82d25819661bc8351","observation_id":"4222e384-6851-4cd5-b95e-e13e674f6417","resolution":{"observed_at":"2026-05-12T04:22:30.824546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does object recognition work for everyone? In IEEE Computer Vision and Pattern Recognition","venue":null,"work_id":"8a5b0c95-2d6f-4322-8c09-1088494ee860","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:9fe53ac50a5104a4b3a34c02668e0c80a19a6d66a9936035478328a8de948769","observation_id":"f1c9fa92-9171-4be0-b8ff-6f710ae209ce","resolution":{"observed_at":"2026-05-12T04:22:30.828270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VirTex: Learning visual representations from textual annota- tions","venue":null,"work_id":"cae93fa5-eac5-4dc8-a0e5-e69f22b91c4a","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:09801a649c5ecd6061b30113b355293633dec2015dca6852c12a86e4f9025921","observation_id":"74c85cd4-8dff-45e0-a182-869584018a19","resolution":{"observed_at":"2026-05-12T04:22:30.832184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:743fa25af60d6322dd1b3cc562f14391b6b0c9337312e8056134a31076da2a66","observation_id":"fd349d53-267c-4e14-9045-d052755e41c5","resolution":{"observed_at":"2026-05-12T04:22:30.332740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CrossTransformers: spatially-aware few-shot transfer","venue":null,"work_id":"75364f18-704b-40fd-bff2-124de95ad675","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:b28ac66d6671f79ada50b29b162153547b00b4e5c381de3d58d14e34e60a5a4f","observation_id":"7785852e-86c0-414a-baba-a8bbc4d678ae","resolution":{"observed_at":"2026-05-12T04:22:30.835592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long-term recurrent convolutional networks for visual recognition and description","venue":null,"work_id":"1c761f46-9d92-4560-8f1b-0ca3a21817b8","year":2015},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:bc61b480c160c196a6fb5b82a12d2b7bcd93d44c0b48c22851db629c17435b3d","observation_id":"1273261c-bf8e-494d-9beb-cca545281b18","resolution":{"observed_at":"2026-05-12T04:22:30.843334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05253","last_updated":"2022-10-24T21:35:42Z","snapshot_observed_at":"2026-07-06T12:17:10.684873Z","submitted_at":"2021-12-09T23:58:45Z","title":"MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning","version":2},"cited_work":{"arxiv_id":"2112.05253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05253","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2112.05253 , eprint =","venue":null,"work_id":"9707198b-280e-43c9-81bd-675e68a13ebc","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2112.05253","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:eee31402402dea9cb01f24dc429e43b19c8006cd05ef068d250704dd3a2308a4","observation_id":"6fcb7573-739f-457c-a8ce-a01256b35669","resolution":{"observed_at":"2026-05-12T04:22:30.180343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":"54819ba6-6223-4c58-b992-af129ccb73bd","year":2017},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:cfbe532b0fe7282836c0b838cd3305fe9b2754fddaf5aa4494389ae06b1a23b4","observation_id":"bceb97fa-76c7-446d-a422-a20fee6bb5ab","resolution":{"observed_at":"2026-05-12T04:22:30.847039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":"2111.12681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-07-03T00:57:30.204945Z","title":"Violet: End-to-end video-language transformers with masked visual-token modeling","venue":null,"work_id":"c7602525-8155-4a61-bd4e-abf06c26e6e7","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:33bdcc456badcfb92c31d3e56ccbbf0096955a2dd3155cb54d96d31e6a94fb68","observation_id":"066ab485-dc68-4c03-afbd-710371346d83","resolution":{"observed_at":"2026-05-12T04:22:30.252979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale adversarial training for vision-and-language representation learning","venue":null,"work_id":"d209f16a-827b-46e3-bb46-4a5050830804","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:595b58871388af472491399a4e615038e48b3cc4f73856f884e940d67524bb4e","observation_id":"b5338e59-d9e3-45f1-9981-1169719ec244","resolution":{"observed_at":"2026-05-12T04:22:30.850639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasheets for datasets","venue":null,"work_id":"eecadc5e-cbda-413c-9ce6-6d835784936f","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:384815b643fd17cd36f46ba9a5747255d1b25abda80220cbd3d1bf8111d48e23","observation_id":"6ab027de-991b-40ce-aea1-38a2bf372462","resolution":{"observed_at":"2026-05-12T04:22:30.853816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09921","last_updated":"2019-08-06T15:16:42Z","snapshot_observed_at":"2026-08-02T04:08:05.973568Z","submitted_at":"2018-05-24T22:08:27Z","title":"Meta-Learning Probabilistic Inference For Prediction","version":4},"cited_work":{"arxiv_id":"1805.09921","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1805.09921","snapshot_observed_at":"2026-07-02T16:47:09.973074Z","title":"arXiv preprint arXiv:1805.09921 , year=","venue":null,"work_id":"1f12709f-45bf-497e-b313-9556841f15d8","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1805.09921","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:da0ed15615cdb2dbbcddd8c5cda141a2c0055ff5a7ae3efda3b39d85880e8afb","observation_id":"5d9a49a5-c8a8-4c4a-8696-698f504d40c2","resolution":{"observed_at":"2026-05-12T04:22:30.415415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.0850","last_updated":"2014-06-05T16:04:02Z","snapshot_observed_at":"2026-08-05T10:16:44.137827Z","submitted_at":"2013-08-04T21:04:36Z","title":"Generating Sequences With Recurrent Neural Networks","version":5},"cited_work":{"arxiv_id":"1308.0850","doi":"10.48550/arxiv.1308.0850","metadata_source":"pith","pith_arxiv_id":"1308.0850","snapshot_observed_at":"2026-07-10T20:07:33.400866Z","title":"Generating Sequences With Recurrent Neural Networks","venue":"cs.NE","work_id":"3da63ce3-c701-48e0-a32e-756f2712b58c","year":2013},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1308.0850","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:dbd229c272fb9453f0d5889ba6c0de496ec48562cd98db2362a6fd387dfcf869","observation_id":"eae5d548-68e5-4cf8-b6cd-f45cb4bd9811","resolution":{"observed_at":"2026-05-12T04:22:30.482043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grifﬁths, Frederick Callaway, Michael B","venue":null,"work_id":"5ce7479b-209a-4da4-b7a9-f160c7d6ce5d","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:7b4b648487c82f166bbf742e902a0bbcca8ae83ec105c3b4958c1daf4c6cf5bc","observation_id":"690aab85-9388-4c11-8da9-777539c1b3da","resolution":{"observed_at":"2026-05-12T04:22:30.862362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":"2112.08614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KAT : A knowledge augmented transformer for vision-and-language","venue":null,"work_id":"a134c9a0-c717-47c4-b4ad-d2634879e129","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:aaecda14e3f5163784da8d15c5edf55d17e68b95228983cf684c325ee0a4198a","observation_id":"314f70ec-9202-4977-92e7-e119a1d396f1","resolution":{"observed_at":"2026-05-12T04:22:30.515015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":"99af0b6e-5f0d-4395-b84c-f8b19ab92995","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:77c54409595f1c89a1d7ea3c6256f14713a705a3b9dfd690eee5e39d9eab0224","observation_id":"fae816f9-52a2-4629-9202-5eda08c74b5f","resolution":{"observed_at":"2026-05-12T04:22:30.867310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-10T16:43:01.314986Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:4031341e1255de2cbf83eea246a8a89589a5489fc9abfe516fc47764f7dd332b","observation_id":"8501bb37-4668-4bfc-9689-f0dd56366d5b","resolution":{"observed_at":"2026-05-12T04:22:30.088404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Women also snowboard: Overcoming bias in captioning models","venue":null,"work_id":"981e25e3-83c5-47e4-ad7c-acec512d147c","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:e0a5dfd8d0b0872380cbfd8e3f49e50bd848faba281949645f140f5156f76445","observation_id":"a7263e53-1ae3-4877-84d4-63666af3292a","resolution":{"observed_at":"2026-05-12T04:22:30.872613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupling the role of data, attention, and losses in multimodal transformers","venue":null,"work_id":"7ae50461-92f0-4611-a3cb-f036f610860c","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:1585a3888f0bec742bf0b5af47f384f72218bf0858af393d0806e6afa6260474","observation_id":"67a5309d-fe07-44c3-9b37-41ccd31b64fa","resolution":{"observed_at":"2026-05-12T04:22:30.875607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:0281a5a81e4c961bd6ea2d397f1854ccd9a6f445545dc13b04c4535f9ac37e7c","observation_id":"fbd2c84e-63ab-4759-8fd6-76ea3162830b","resolution":{"observed_at":"2026-05-12T04:22:30.238555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Haiku: Sonnet for JAX","venue":null,"work_id":"6b257f81-6076-4fd8-991d-d30f4dda8026","year":null},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:c52901acb32484ad2d9f248fe3b3adad6f155d6319736be76ed821851f0ef265","observation_id":"3721b229-6351-485c-a92f-d414caebec41","resolution":{"observed_at":"2026-05-12T04:22:30.879584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e555277-9fff-4fb9-a470-364f9bc07779","year":null},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:84b6461b733384d48554fea965714b8095d1add77170ff717db1411bf68e9c86","observation_id":"501f32be-e62d-4a57-b9a2-9cbf96dfbad5","resolution":{"observed_at":"2026-05-12T04:22:30.883350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long short-term memory","venue":null,"work_id":"a0817cb9-423e-43c0-876e-808cc4938399","year":1997},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:1437dddec1519bbd5ec569e3497452bfa7b8144c37c8cf33d31aa0e83e8a279f","observation_id":"9bac2006-7fc3-47a5-a7ed-45a48ac6e450","resolution":{"observed_at":"2026-05-12T04:22:30.886734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:feeee21072f30c53484be23cc2831431a26719a3ad62935abdb83e8d45001f89","observation_id":"dd258193-3a6c-41fc-8511-69f5ebe27dcd","resolution":{"observed_at":"2026-05-12T04:22:30.370781Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parameter-efﬁcient transfer learning for NLP","venue":null,"work_id":"02e3c61a-4fbb-404e-9c53-535a5d0d0272","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:4e7fd386f1382ae9ed092e257954d7ddf4d0f12d3f68603a76b7e9144fab5c90","observation_id":"5a13d5fa-36b8-4d4a-9369-b63b5d9ea6ea","resolution":{"observed_at":"2026-05-12T04:22:30.901234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-06T18:01:48.915710Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":"1801.06146","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-07-04T07:39:38.353471Z","title":"Universal Language Model Fine-tuning for Text Classification","venue":"cs.CL","work_id":"9990d84d-84b4-4fd4-acb5-da451524d2f4","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:92052b70161eb049b4beefa73712c3381d2642be95c0ece467821b6e771f4982","observation_id":"10cc3d1a-9ec3-4ba2-a696-5f5925b2e09d","resolution":{"observed_at":"2026-05-12T04:22:30.420070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12233","last_updated":"2022-03-26T02:02:42Z","snapshot_observed_at":"2026-07-06T12:11:38.494286Z","submitted_at":"2021-11-24T02:30:22Z","title":"Scaling Up Vision-Language Pre-training for Image Captioning","version":2},"cited_work":{"arxiv_id":"2111.12233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12233","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up vision-language pre-training for image captioning.arXiv preprint arXiv:2111.12233, 2021a","venue":null,"work_id":"b2b2c3b7-8b5d-48dc-b289-7edf4d39ff9a","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.12233","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:17bff9745fc6ca33ad75b5c88076b75f41983209b3987ffcaf50a126e6a9a542","observation_id":"e504dc3c-b67d-4922-bfd6-2dd887c5494d","resolution":{"observed_at":"2026-05-12T04:22:30.459551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention on attention for image captioning","venue":null,"work_id":"573e2af1-5a00-43ba-ad37-9e0dfb875ce9","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:224bbe91282634c4976429729651f389d028b06cd7bd6158aeff1169a47358c0","observation_id":"978b0d15-dd70-4d47-b7e1-43f22b0eccf8","resolution":{"observed_at":"2026-05-12T04:22:30.925912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Derpanis, and Neil D","venue":null,"work_id":"27bd995a-74f2-4dd3-ba92-34b7f8277652","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:01b9f370963076f6bbd9a653426d6d48c9b1aa6669c5018262864bac75baaf26","observation_id":"2c9c9db0-94bf-4e77-beca-211c415071a5","resolution":{"observed_at":"2026-05-12T04:22:30.929401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"02b79ca7-0e06-43e7-abc0-f9361f7fd0f4","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:a350d1b1f0e72d097a2b505eae4175a3e794435b66de63eeceed16cbcb7e5360","observation_id":"242cc7b1-b572-4c62-9d7e-11d638d04637","resolution":{"observed_at":"2026-05-12T04:22:30.935245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05125","last_updated":"2021-09-10T22:26:05Z","snapshot_observed_at":"2026-07-06T11:46:30.298536Z","submitted_at":"2021-09-10T22:26:05Z","title":"MURAL: Multimodal, Multitask Retrieval Across Languages","version":1},"cited_work":{"arxiv_id":"2109.05125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.05125","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mural: multimodal, multitask retrieval across languages","venue":null,"work_id":"6f6ab0a4-4d4f-49b6-b0dd-e4f6c8e1df9c","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2109.05125","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:447fd63edd90e3735596616f0b7ea2ca2c4416a93ef5774afc648bc68a0aa073","observation_id":"c22c2205-aa49-4158-8b6c-c9e0d37f0f07","resolution":{"observed_at":"2026-05-12T04:22:30.573408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-11T01:45:10.663640Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:5dba2fe1070ab8f1fa1ba823713d57ee8df78d03a2bbf9b122ab0a625f692bd8","observation_id":"7fd6cab6-82f1-4d96-a6d7-6e0c3bc84eb8","resolution":{"observed_at":"2026-05-12T04:22:30.583825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07303","last_updated":"2022-03-14T17:06:30Z","snapshot_observed_at":"2026-07-06T12:47:38.925428Z","submitted_at":"2022-03-14T17:06:30Z","title":"All in One: Exploring Unified Video-Language Pre-training","version":1},"cited_work":{"arxiv_id":"2203.07303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07303","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All in one: Exploring uniﬁed video-language pre-training","venue":null,"work_id":"91bd00d9-4041-47ad-a58d-043b0c543c9c","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2203.07303","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:379841cfe8b78aaa7e103f02f86ef326c2af9584be05389c854c5ed5e8ff680e","observation_id":"15f088e5-4bdb-4807-953c-29f47edcd0ee","resolution":{"observed_at":"2026-05-12T04:22:30.588905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-08-10T06:35:58.834171Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:3a38d5ce72625fa333c42649ce2a7f60a161ec63718e3c3b8c7e2e9ead4bc7e6","observation_id":"7018ff85-dcd2-47dd-95cb-ac00a47c8fe2","resolution":{"observed_at":"2026-05-12T04:22:30.593919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:4a594a470226e3b0ebfb4d79a861a9ea9c5e824a7dbe5bd975c9f0f64734589c","observation_id":"bd706f14-42d4-4648-98d0-6da74048fa20","resolution":{"observed_at":"2026-05-12T04:22:30.610263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Hateful Memes Challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"a61691e2-87f3-4a66-b559-bd910a2562b5","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:21d8e6a619fca30a509f2c0e69bff8477c30545ef878a501315a1b3feb1ace1b","observation_id":"9566ef18-588f-43db-bc06-5bbfe4536167","resolution":{"observed_at":"2026-05-12T04:22:30.940129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"com/3895535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Few-shot classiﬁcation by recycling deep learning","venue":null,"work_id":"8798506f-4bb0-4186-b98c-351ba7e071dc","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:10c09d72cbb5669ac5007342df18682e3d21277217190f4d76efed3a7a64331d","observation_id":"0340b57d-6f89-40ff-b901-ae02952053f5","resolution":{"observed_at":"2026-05-12T04:22:30.080238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":"4fe927c9-d556-4666-8eee-6f1cdf2f7341","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:e9a96e3648944f7a3cc19a3155915112cfc861aafa9b757f0029ef6c8e2a6658","observation_id":"f0139bf0-04ac-4adf-b773-e8d84969fd7f","resolution":{"observed_at":"2026-05-12T04:22:30.946268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:617edbf2170268e9498e3403c8d94a23d25d042afefc2dc0d9e0442cc7165f63","observation_id":"baa19c17-51eb-4465-be33-c1137286e3f4","resolution":{"observed_at":"2026-05-12T04:22:30.106705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-07T23:43:49.317779Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":"2005.00200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-07-03T20:38:56.173895Z","title":"Hero: Hierarchical encoder for video+ language omni-representation pre-training","venue":null,"work_id":"d64e127a-fcfc-49d6-82f5-d45d60d42c80","year":2005},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:26532ef1b186c5cff1640f3bdc49e86bf7b32fb06f41db127b51d0bc8463766e","observation_id":"f4092bb5-b83a-4515-add3-d7bca8a114e5","resolution":{"observed_at":"2026-05-12T04:22:30.162304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":"2101.00190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-07-04T13:29:51.032515Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","venue":"cs.CL","work_id":"23ddcedc-909d-4b18-b28a-943a50a8cef7","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:29819f71ecd587e53b4fba7f94b371ea71ab9ea4fce16dae0f0bb297a16cc7d1","observation_id":"780ab3b3-c84f-43c0-8ee1-79ed8621e223","resolution":{"observed_at":"2026-05-12T04:22:30.168758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"96795e2e-f5cb-40eb-bb42-11ebb69f81ee","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:b5dcb685e65e5f5ceee85c07ce99273745d276a72684933ccfce3ff094970ac5","observation_id":"e523e3b5-51e6-466c-b4ee-8c819c1cabf8","resolution":{"observed_at":"2026-05-12T04:22:30.951694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12871","last_updated":"2020-12-24T14:28:17Z","snapshot_observed_at":"2026-08-10T10:55:43.305349Z","submitted_at":"2020-12-23T18:37:11Z","title":"A Multimodal Framework for the Detection of Hateful Memes","version":2},"cited_work":{"arxiv_id":"2012.12871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12871","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lippe, N","venue":null,"work_id":"9eb2fe6a-0d4c-4430-85b0-7a01f9d21aef","year":2012},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2012.12871","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:6697e8219de69f6547d1a757ba0078462674afd1cdf20f709185c73b5f02c757","observation_id":"a34ccb25-8607-46f6-84e5-f53e2b0621cc","resolution":{"observed_at":"2026-05-12T04:22:30.194481Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06804","last_updated":"2021-01-17T23:38:40Z","snapshot_observed_at":"2026-08-02T23:15:54.644289Z","submitted_at":"2021-01-17T23:38:40Z","title":"What Makes Good In-Context Examples for GPT-$3$?","version":1},"cited_work":{"arxiv_id":"2101.06804","doi":"10.48550/arxiv.2101.06804","metadata_source":"pith","pith_arxiv_id":"2101.06804","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What Makes Good In-Context Examples for GPT-$3$?, January 2021","venue":"cs.CL","work_id":"9b866521-5b8d-4302-b041-c8fcb347b54c","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2101.06804","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:392cf4a078c7f3e86c677f9e2c665b4edf88276d3bdfc537f93a90ecb5ea043b","observation_id":"7a530106-adc3-4ac0-87bd-ddd4d26f4c9e","resolution":{"observed_at":"2026-05-12T04:22:30.213836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:04.798882+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:04.798882+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization of image description metrics using policy gradient methods","venue":null,"work_id":"5550a9a0-816c-4841-aff8-3823f2adaa25","year":2017},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:cba8137b1c257c2753f3a5bc44dd6aafbae7a738b03c2aaa799adc3521eacf3b","observation_id":"8b6c790b-2c39-4094-9837-3eb47eec5511","resolution":{"observed_at":"2026-05-12T04:22:30.960786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing textual cues in multi-modal transformers for VQA","venue":null,"work_id":"c53ae0bb-e1df-4cbf-b37f-32c67c7c6dc1","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:3b12fa179436e0c5d9667a52bbf3eb201371d461a326ae692c90ad30de835d6a","observation_id":"7498eccc-96bf-4ef4-b13a-f291b2b46933","resolution":{"observed_at":"2026-05-12T04:22:30.966009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ViLBERT: Pretraining task-agnostic vi- siolinguistic representations for vision-and-language tasks","venue":null,"work_id":"fa188bfd-73a4-421c-ae69-de1a73c25b61","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:34bd159494eeccc2def797730f7f53b4355a8170a393d1b9b78e98edd394cf69","observation_id":"490fb7ff-823c-4f91-9033-c03443f64e8f","resolution":{"observed_at":"2026-05-12T04:22:30.975253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2002.06353","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Univilm: A unified video and language pre-training model for mul- timodal understanding and generation","venue":null,"work_id":"a3adb57a-7e0f-47de-a2ad-c50ade1ccc45","year":2002},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:84842a299b8e5b84cbed519e0c0d02f80fdb9ab2b67ea726cade8bccf6f29db4","observation_id":"9f765688-b808-4bfd-a3a2-09216f96be46","resolution":{"observed_at":"2026-05-12T04:22:30.263599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12723","last_updated":"2022-04-14T11:03:49Z","snapshot_observed_at":"2026-08-10T20:49:37.658589Z","submitted_at":"2022-01-30T04:44:54Z","title":"A Frustratingly Simple Approach for End-to-End Image Captioning","version":3},"cited_work":{"arxiv_id":"2201.12723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.12723","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VC-GPT: Visual conditioned GPT for end-to-end generative vision-and-language pre-training","venue":null,"work_id":"40868241-19c6-4f15-9096-708f49627a64","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2201.12723","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:b935f40ba5a5376dc60338b555d4829de9772b8e50cc7d2174b7acf0ac1c15d9","observation_id":"28f6a88b-2199-4b19-af78-b15f2cf623f6","resolution":{"observed_at":"2026-05-12T04:22:30.273063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"854448dd-1772-44a0-ab6f-6b7b8c08274f","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:8090004d797f1bc7f0daaa7461794234116391184794a0847ea2c0110cdc1318","observation_id":"e8ac43fa-e81f-4dfc-8719-a01cd7c9e02f","resolution":{"observed_at":"2026-05-12T04:22:30.980690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"abf32fd9-c775-4506-8021-d69519483f8e","year":1989},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:d3018ab7a9a0e1e3f2eea99f63610a2c11f7105fcd8cf89a88b6b5cd9224dc33","observation_id":"372a54c3-18bc-472e-a84e-bda27d0259a6","resolution":{"observed_at":"2026-05-12T04:22:30.983928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"418de189-7ea3-4136-a0fd-a8965f4c13c4","year":1989},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:253489b2dea0fe53198bad143cb630089f6020bb484a6a451cff5ae042e29078","observation_id":"4974358d-4d46-4865-b9bd-e6c07799abb8","resolution":{"observed_at":"2026-05-12T04:22:30.988885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11147","last_updated":"2022-03-21T17:26:29Z","snapshot_observed_at":"2026-08-01T19:23:25.711617Z","submitted_at":"2022-03-21T17:26:29Z","title":"Teaching language models to support answers with verified quotes","version":1},"cited_work":{"arxiv_id":"2203.11147","doi":"10.48550/arxiv.2203.11147","metadata_source":"pith","pith_arxiv_id":"2203.11147","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Teaching language models to support answers with verified quotes","venue":"cs.CL","work_id":"2950e664-d266-4db6-96e6-b81b3cf200ed","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2203.11147","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:2b373c1149779a2c81538354cd8de1f06c4268c0896e83dc065c984595464eb2","observation_id":"4ee3dba6-2d8b-4274-88d5-c8f6596210eb","resolution":{"observed_at":"2026-05-17T11:45:48.341649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T14:49:49.659773+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T14:49:49.659773+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01018","last_updated":"2020-08-03T16:53:35Z","snapshot_observed_at":"2026-08-11T21:51:03.462926Z","submitted_at":"2020-08-03T16:53:35Z","title":"RareAct: A video dataset of unusual interactions","version":1},"cited_work":{"arxiv_id":"2008.01018","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.01018","snapshot_observed_at":"2026-07-01T22:56:21.027705Z","title":"RareAct: A video dataset of unusual interactions","venue":null,"work_id":"8339b87c-5001-4e22-8143-1c5c42526a57","year":2008},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2008.01018","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:65636c4d150cedc4435ce0090bc87dc15df7fe8198dc6a051e74b0f3a86351d3","observation_id":"83fcf28b-d0b9-466c-885b-bf3d4e9e643f","resolution":{"observed_at":"2026-05-12T04:22:30.390215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end learning of visual representations from uncurated instructional videos","venue":null,"work_id":"ca8030bb-3209-4763-8ea8-b26180ae42f2","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:a31b27e6d4aa69a71531c5eb9c88ae807cfabe727bf1b13fc4787f3eba4d1be6","observation_id":"ff778200-0cd8-4b78-86b6-c1169808bc9b","resolution":{"observed_at":"2026-05-12T04:22:30.993024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recurrent neural network based language model","venue":null,"work_id":"a418f09e-bb55-43ad-b84b-c5b1dd87f24e","year":2010},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:87174ee9ad835b3c5bd2c6cd56b8bd3711b5a6e7123c4fb4d3956cf171b4de68","observation_id":"9ba6a572-e902-4f87-8f6c-d3c728fe686e","resolution":{"observed_at":"2026-05-12T04:22:30.996543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"cited_work":{"arxiv_id":"2202.12837","doi":"10.48550/arxiv.2202.12837","metadata_source":"pith","pith_arxiv_id":"2202.12837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","venue":"cs.CL","work_id":"d2b537df-825d-4427-9575-fc0664c0962a","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2202.12837","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:8f1f399c3f97865036ee304cb28cf75221cd9b09c8f7ef1cf5de4be04abcc2c7","observation_id":"7b95a539-937a-49f6-941a-d79d59df9199","resolution":{"observed_at":"2026-05-15T09:51:47.316034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:22:50.486187+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:22:50.486187+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model cards for model reporting","venue":null,"work_id":"95811841-f039-4585-a6f8-f40642c49dbd","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:2c19bc4b51dc894534682ecbd24f72220ba661cb81721fe567076c83b561e4fc","observation_id":"20807713-4460-43ad-b734-45868a65a50b","resolution":{"observed_at":"2026-05-12T04:22:31.002677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-11T17:44:55.630525Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:47d81459b18e6fa89737d638bbac56ccc19b97e9c60fa1efaf0173df1e94f76e","observation_id":"8cfeab8e-d3b3-4a90-9f76-16506dde437b","resolution":{"observed_at":"2026-05-12T04:22:30.476566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale pretraining for visual dialog: A simple state-of-the-art baseline","venue":null,"work_id":"04d4fd32-921f-48b0-93ab-3975547d3e1f","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:2029bf6101f8dba9932f57e9c676f631205dabff6fe163148a2e3ceecd498804","observation_id":"aca7b247-230e-42f3-b3f5-67eab3c7c250","resolution":{"observed_at":"2026-05-12T04:22:31.010928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"True few-shot learning with language models","venue":null,"work_id":"5dc9f2d4-9447-43ff-aee9-2399927eb79c","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:981f176806f22d1b47300696ccea699add5c57b0612c91b437f8a8a847bde57c","observation_id":"616e981e-8d88-481a-b490-59a984121927","resolution":{"observed_at":"2026-05-12T04:22:31.014259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":"2202.03286","doi":"10.48550/arxiv.2202.03286","metadata_source":"pith","pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models with Language Models","venue":"cs.CL","work_id":"d1274c54-508f-42f9-aeb3-91db13f3a622","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:8adaafc79aee546b89b46064139df5d212c5ad157af85591a2085249917d13ff","observation_id":"7a5c0f43-5227-463e-b23d-a8c257e91a83","resolution":{"observed_at":"2026-05-12T04:22:30.504465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10050","last_updated":"2023-04-12T08:26:28Z","snapshot_observed_at":"2026-08-12T07:45:33.991642Z","submitted_at":"2021-11-19T05:25:46Z","title":"Combined Scaling for Zero-shot Transfer Learning","version":3},"cited_work":{"arxiv_id":"2111.10050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.10050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2111.10050 , year=","venue":null,"work_id":"38fb2f70-f077-4765-8cb7-088bca890892","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.10050","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:00909228b8ae7085951a22312d93180ec226b0e200e7d66033291d20c4d57166","observation_id":"bbaac408-67bb-4bac-a332-c9c65a5031df","resolution":{"observed_at":"2026-05-12T04:22:30.510632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":"cb2039fb-0c9b-4b21-b332-f047558dce64","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:512582b290ffe1a651618676461038538242c5c5c4722a449227ee363ce3f7ab","observation_id":"c2735049-6516-4cba-b590-1e88c0e74e32","resolution":{"observed_at":"2026-05-12T04:22:31.022431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2106.15332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winner team Mia at TextVQA challenge 2021: Vision-and-language represen- tation learning with pre-trained sequence-to-sequence model","venue":null,"work_id":"3a932499-4198-4a72-903a-e24c8a907d22","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:18acdbfb5f44686ee380ab20d44e08e1a19489f6fb97609f4abae859a09d0264","observation_id":"08b64eb8-6d36-4c60-922e-8fc9acc85d5b","resolution":{"observed_at":"2026-05-12T04:22:30.520078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:f669c42221e3d5ce75229382ba01f6771287989a2c814b4ecc66470395952b22","observation_id":"c3bc78d9-7dc0-4754-be2b-33cedf04a679","resolution":{"observed_at":"2026-05-12T04:22:30.554692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:a820589594b1800fe620b4770a4b04fa9ba0c63637088f837900612361963740","observation_id":"70980115-d923-4419-a225-73de2a38f884","resolution":{"observed_at":"2026-05-12T04:22:30.559656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:0217dab2c2c6d87caced91ebdd7ad9be10bb1073f9755d467619d4751b2f3b80","observation_id":"48c1ee94-b9a4-4ae8-921e-6a8ec3292d6e","resolution":{"observed_at":"2026-05-12T05:37:56.023799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ZeRO: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"f5d69e5b-2a8c-4fd8-970f-0fe997205f7f","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:2803279492ff1724f26c5b056b333d73eac30c3284a9a3f5a4cc25e3efe6d3c4","observation_id":"27b79a20-df73-4d08-9117-d9277f54bf52","resolution":{"observed_at":"2026-05-12T04:22:31.031659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:5b29355ca3a15a26940f4737b10f8cc31a2e64775183901619641a24f750ba4b","observation_id":"27b70176-76c5-4cc4-8716-cb730171ffca","resolution":{"observed_at":"2026-05-12T04:22:30.579121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rennie, Etienne Marcheret, Youssef Mroueh, Jarret Ross, and Vaibhava Goel","venue":null,"work_id":"242831de-671c-43e1-8acd-cd88ac410157","year":2017},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:a725543f4ec240a0f6be8ce9ff8cca921efef3f0b44386acc8b0d9772f50a4e8","observation_id":"d36e3c0e-b6b9-4022-b02e-0067dfbeb058","resolution":{"observed_at":"2026-05-12T04:22:31.036099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e07d5b1-3b4a-4c81-b6ff-0c9e927887c6","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:f8e4ddd7029d87cd9e67979faa7dd68047f4d14e81469327ba8724f4cbf6f617","observation_id":"42c5e245-4082-46ca-9972-328ce2c084a8","resolution":{"observed_at":"2026-05-12T04:22:31.045820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompt programming for large language models: Beyond the few-shot paradigm","venue":null,"work_id":"f63a0d46-0a23-48da-8d47-dec99cd8bf1c","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:44290fc3fcc0a8b8e85586f3b41fa813d5138bb2e275133e794d746d6c00427c","observation_id":"5e2b0d6b-c673-4990-867d-118aa2d20f61","resolution":{"observed_at":"2026-05-12T04:22:31.053058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09301","last_updated":"2018-04-25T00:46:14Z","snapshot_observed_at":"2026-08-10T14:51:43.022329Z","submitted_at":"2018-04-25T00:46:14Z","title":"Gender Bias in Coreference Resolution","version":1},"cited_work":{"arxiv_id":"1804.09301","doi":"10.48550/arxiv.1804.09301","metadata_source":"pith","pith_arxiv_id":"1804.09301","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gender Bias in Coreference Resolution","venue":"cs.CL","work_id":"37924343-9298-4e9d-acec-8e9ac9a01a89","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1804.09301","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:76af27d5c8c9cd7907687fea71b5afe80b6b30b0b6f808f8d3a7257fef89c222","observation_id":"731cb385-27ff-495d-bb6d-f8bcb21ffaab","resolution":{"observed_at":"2026-05-12T04:22:30.599173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Berg, and Li Fei- Fei","venue":null,"work_id":"1eb1256b-fbde-42c6-8cb2-abd2a98b2473","year":2015},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:34f0ffff886b5cea77b6194be470e67cf137203d1dbdc11626fcb8506c21c6f0","observation_id":"4934788f-9125-4afc-ac1b-fe6fffcf17f4","resolution":{"observed_at":"2026-05-12T04:22:31.056748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bach, Lintang Sutawika, Zaid Alyafeai, Antoine Chafﬁn, Arnaud Stiegler, Teven Le Scao, Arun Raja, Manan Dey, M","venue":null,"work_id":"9ddad8be-91b7-4f3c-a56b-d09730ba68ea","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:8d711644660396810ab19f2f4e4e0c5f4cc3c86ba830a83df53bb9d0b59f0dbf","observation_id":"22c5877c-3547-4059-a63d-91b436eec5b6","resolution":{"observed_at":"2026-05-12T04:22:31.061331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:fb23391dca7c8105e3b8b7e05de02ba9efbcf7b188b02ee08458f9de8f9b5cb0","observation_id":"553f0795-8a64-42aa-b1a2-f4c213f9d25e","resolution":{"observed_at":"2026-05-12T10:21:01.130308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bello-Pardo, Stan Oklobdzija, Martijn Schoonvelde, and Jeffrey W","venue":null,"work_id":"bada235d-6108-4d21-b524-f9fd5f48c87d","year":2020},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:7b698f357f96d157a3573cb9a7963ea7516588500fb87634d1cdad45460532d8","observation_id":"b9deedba-3c00-43f8-8c8c-efcc30e8394e","resolution":{"observed_at":"2026-05-12T04:22:31.071346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual Captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"9189618c-59b9-4756-9275-3303c5d92583","year":2018},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:d8c9e4318ae14fdc81989cb323f64edd06cb986d8e19674fef83737eee52365c","observation_id":"e820973e-2f32-49ed-9716-7ccaeee8a986","resolution":{"observed_at":"2026-05-12T04:22:31.074758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:6c328ce9e5d350c8901e31f52246aa7a4bd1848b504c5d85144d2cf2ce00728a","observation_id":"ceb1e885-e3ec-4b0c-b0f9-90254d56b3ee","resolution":{"observed_at":"2026-05-12T04:22:30.097920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards VQA models that can read","venue":null,"work_id":"2cc8cc2d-2fb0-4245-bcee-78963337ff05","year":2019},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:8bd287e8517e060243ac3a4dfa6013fb5652d1cfcfeb32b68b8121054c03645d","observation_id":"c6a2f3f8-e170-4d77-b0da-956c33522965","resolution":{"observed_at":"2026-05-12T04:22:31.078131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":6,"verified_exact":37,"verified_fuzzy":51},"total_outbound_references":165},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 165 outbound references and 100 inbound Pith citation observations for arXiv:2204.14198."}