{"as_of":"2026-08-08T13:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ce89f93b902087f41d3eb48a5e1cda57383d573fd4a1cb04e832b26a3cf4a54","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:14:03.546300Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:10:05.334285Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:ae75a95ed58d2de0d8734403f3949a7e1eef0873672904e26e9cc18c463d4654","observation_id":"c79ce03d-e652-4e1a-9612-2a20441e7ebf","resolution":{"observed_at":"2026-05-16T09:38:09.573674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:2100e8ebc88b652afad43215b1af21f0e21e95a9eb76adafb8a63598a7ab73c2","observation_id":"d3e8c198-2f4b-45a5-9024-463d8f5a0c97","resolution":{"observed_at":"2026-05-16T09:50:00.756707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:5557f68fcf6bf981f1f24e2e397c6a45888e6282e0d77a2e8e416f31f694c750","observation_id":"16095bf5-2c75-47be-9efb-9967ab6dc02c","resolution":{"observed_at":"2026-05-12T04:22:30.338088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:8020104b19614584b046e226088e67cdc51227392e6d01d5c33d72a7ff9bc6b9","observation_id":"1e62c38a-c5ba-4473-8fc7-b04d20a8b76c","resolution":{"observed_at":"2026-05-15T10:53:08.385289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:0df4ca46971cde9d65655d93e5b721bd5d5a05318e2647b20673e7cfdf6f0ba8","observation_id":"1611710a-17ef-4a83-a512-ce11cd81fa89","resolution":{"observed_at":"2026-05-13T06:24:49.969674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:5463df3c0b044ad0bba360f675bac2a8b2e7e7ac7e8ccad5dee35bc45853b9b6","observation_id":"eed7dac8-d443-494c-8abe-df58544933c5","resolution":{"observed_at":"2026-05-12T04:49:31.252855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T20:10:43.912935Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2207.05608"},"observation_digest":"sha256:cafbca2e7193264483e797a8f3de521f001cb3da2ad2b989e963f9ba078b6482","observation_id":"150303d5-51e5-4690-8ec8-b4083d854709","resolution":{"observed_at":"2026-05-11T20:10:45.889197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:df9895eae6c4ee60a3d06e58f2d82e406430f9e0a84106f9b17a1daaf991b537","observation_id":"c47735b6-4b4a-4bc9-a0c3-540ba7b778eb","resolution":{"observed_at":"2026-05-16T09:29:06.091876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:cf4a97dacd52c8c435f1a1d11a406a05ea71801aa4e0bce6f66a7a1e474d1f57","observation_id":"46221846-5e44-4ae2-81cf-afb669f6962e","resolution":{"observed_at":"2026-05-14T23:07:42.982914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:3641efc263aa6ec46fb29242dc70c2833c0884342b6d668ecc3bcd73ccab680e","observation_id":"140417e2-36d2-4f70-aac2-476191209903","resolution":{"observed_at":"2026-05-16T02:56:42.300910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:9d91b12ec43228f8fda7f51d91ae53037690c817d4c5d44f290e3b84bea1f6dc","observation_id":"03da7090-bb13-4508-8d66-f508abdd6740","resolution":{"observed_at":"2026-05-18T14:25:59.818454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:b7566407196e36e95f52abc2b6e7797344d18e34012588a764309ad26261a34e","observation_id":"c3724561-48ee-48d5-9eca-06119d69a7ea","resolution":{"observed_at":"2026-05-11T13:10:21.208526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T20:14:03.546300Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09906","last_updated":"2025-02-14T04:29:17Z","snapshot_observed_at":"2026-08-07T20:05:12.566543Z","submitted_at":"2025-02-14T04:29:17Z","title":"Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T20:14:03.546300Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2502.09906"},"observation_digest":"sha256:e1c2bdfc4fbd3c5b4d2ef0c7d6835433b37ba1b8220e4923de881c48f990664a","observation_id":"8354bd25-586f-4f95-91f4-16e04aef353f","resolution":{"observed_at":"2026-08-07T20:14:03.546300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T14:59:40.666585Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16756","last_updated":"2025-05-22T14:59:30Z","snapshot_observed_at":"2026-08-07T14:53:56.794925Z","submitted_at":"2025-05-22T14:59:30Z","title":"Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:40.666585Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.16756"},"observation_digest":"sha256:d889a62547f70799872737842a5552f8afb77985f9b6dba463c0f0348da45e69","observation_id":"16d8b0d0-1aa6-4358-8cfd-db03e911ef78","resolution":{"observed_at":"2026-08-07T14:59:40.666585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T12:52:41.477507Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.477507Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:6143ba0d4b19658487cfc8f9832d95baf334b150964b6750fff6ab8db57d470b","observation_id":"77bd1637-6379-4ef3-8d25-928d3b36ff97","resolution":{"observed_at":"2026-08-07T12:52:41.477507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T05:53:45.667153Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06884","last_updated":"2025-06-07T18:26:58Z","snapshot_observed_at":"2026-08-08T01:16:34.931310Z","submitted_at":"2025-06-07T18:26:58Z","title":"FREE: Fast and Robust Vision Language Models with Early Exits","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T05:53:45.667153Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.06884"},"observation_digest":"sha256:676fa3170455c8e3c430f45f713e6ba3781cefd3f438c0e04b019c2e7a51548c","observation_id":"b0e924db-1927-410b-88be-ec97b3d2c838","resolution":{"observed_at":"2026-08-07T05:53:45.667153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T05:40:28.993874Z","title":"OFA: Unifying architec- tures, tasks, and modalities through a simple sequence- to-sequence learning framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07484","last_updated":"2025-06-09T07:04:47Z","snapshot_observed_at":"2026-08-07T05:30:08.010657Z","submitted_at":"2025-06-09T07:04:47Z","title":"CoCoA-Mix: Confusion-and-Confidence-Aware Mixture Model for Context Optimization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:28.993874Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.07484"},"observation_digest":"sha256:8476fc1d8434b433cf244d656bb2274623dc8d4a8988933d53b57fc85dc1b2c8","observation_id":"49ce8a1a-37bd-4601-aaeb-0f09e6ec81a7","resolution":{"observed_at":"2026-08-07T05:40:28.993874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T05:04:06.395146Z","title":"Simvlm: Simple visual language model pretraining with weak supervision.arXiv preprint arXiv:2108.10904, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09108","last_updated":"2025-06-10T17:13:09Z","snapshot_observed_at":"2026-08-07T04:54:52.572544Z","submitted_at":"2025-06-10T17:13:09Z","title":"SensorLM: Learning the Language of Wearable Sensors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:06.395146Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.09108"},"observation_digest":"sha256:95c63d1d35192a8b0792da6b3e2aed1b80f0127e9e449f3c641a5c7dad59958b","observation_id":"32f16b24-5e42-4983-ad77-b0bbfb6583fc","resolution":{"observed_at":"2026-08-07T05:04:06.395146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T04:44:02.444346Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-07T21:45:10.885875Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.444346Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:a3951a3c979ab953078bbc2e97d5076951147b5f35e7f6fe4d7121e2ae9717dc","observation_id":"b92bfa76-840a-4600-bc97-171cba9da0f1","resolution":{"observed_at":"2026-08-07T04:44:02.444346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T15:03:51.039188Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11053","last_updated":"2025-05-22T11:23:38Z","snapshot_observed_at":"2026-08-08T10:50:47.819194Z","submitted_at":"2025-05-22T11:23:38Z","title":"Bootstrapping your behavior: a new pretraining strategy for user behavior sequence data","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:51.039188Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.11053"},"observation_digest":"sha256:fd8f6e67cb55f0e14f8dd2429c9d0e832ef91fccf9f0462f33f9f38946d29a2e","observation_id":"940e16ad-a44d-49b6-aea4-fc124200a517","resolution":{"observed_at":"2026-08-07T15:03:51.039188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T20:43:03.339629Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.339629Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ceb48c9d383ac4d9d038495f0a361e97fc9f1d4b5c5a2c00704373e51c9e1c28","observation_id":"354e4939-3157-42f6-b4cd-52aaf15c6c4d","resolution":{"observed_at":"2026-08-06T20:43:03.339629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T19:43:45.349914Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.349914Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:534d474c11729b8057fd3af0d8a1f283564d272651f6cc6fc5eaafa06ba79c5f","observation_id":"8c065b3a-771b-4689-aae5-c083f0391f89","resolution":{"observed_at":"2026-08-06T19:43:45.349914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T18:54:10.057658Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07104","last_updated":"2025-07-11T03:43:50Z","snapshot_observed_at":"2026-08-06T18:45:01.971749Z","submitted_at":"2025-07-09T17:59:04Z","title":"Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:54:10.057658Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.07104"},"observation_digest":"sha256:5a898b2cdec5142a7a59a5a4c21e95796ac00a01910e5201708a20a141a06e18","observation_id":"7feecfc5-30d9-4655-bd45-b597bfe9ae9d","resolution":{"observed_at":"2026-08-06T18:54:10.057658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T17:43:53.077148Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-07T22:45:28.938815Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.077148Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:672ee8b399617fd2d74481a52e9e8f15fcf00ef41d27dd9bde5cc952c9f25538","observation_id":"9b31139e-1020-4c3a-ba56-e8306c567ce0","resolution":{"observed_at":"2026-08-06T17:43:53.077148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T11:20:07.002898Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22791","last_updated":"2026-06-11T08:47:41Z","snapshot_observed_at":"2026-08-06T11:20:00.457736Z","submitted_at":"2025-07-30T15:56:36Z","title":"Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey","version":2},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-08-06T11:20:07.002898Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.22791"},"observation_digest":"sha256:8f3553835b5b8962496e6193cc67fa3c7846c0fcfcf3475879f221614df7292f","observation_id":"2a718101-06aa-46d8-a604-39b2520da10e","resolution":{"observed_at":"2026-08-06T11:20:07.002898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-05T23:46:58.076344Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04942","last_updated":"2025-08-07T00:08:31Z","snapshot_observed_at":"2026-08-08T12:37:45.461578Z","submitted_at":"2025-08-07T00:08:31Z","title":"Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:58.076344Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2508.04942"},"observation_digest":"sha256:3987a3e60bc5c90af8213d2d080c0d027bcbe8a999be20948ef427931b0ba284","observation_id":"57360d68-7f3d-4b8d-bc83-b0b18d956ae8","resolution":{"observed_at":"2026-08-05T23:46:58.076344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-04T13:38:37.414051Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision.arXiv preprint arXiv:2108.10904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25991","last_updated":"2026-07-30T02:00:42Z","snapshot_observed_at":"2026-08-06T16:04:28.241438Z","submitted_at":"2025-09-30T09:26:32Z","title":"Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:38:37.414051Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2509.25991"},"observation_digest":"sha256:d5672421e2e054fed76e1359efbe7a0926803b60f65ed5ebcd97a3285d7a8822","observation_id":"c5700a91-3ab5-44d5-b93b-1c8fa37b2bb9","resolution":{"observed_at":"2026-08-04T13:38:37.414051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2511.02271","last_updated":"2026-05-14T05:07:16Z","snapshot_observed_at":"2026-08-06T11:24:33.436979Z","submitted_at":"2025-11-04T05:24:52Z","title":"Medical Report Generation: A Hierarchical Task Structure-Based Cross-Modal Causal Intervention Framework","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T01:45:29.400398Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2511.02271"},"observation_digest":"sha256:9ebacdb1aa2198bb535b1857c7b9d8da63baa10141bc8114de34fbfe4cb4fdd8","observation_id":"a81d2586-752a-418f-a8ad-eab72abd079d","resolution":{"observed_at":"2026-05-18T01:45:36.961944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-02T17:14:57.572731Z","title":"arXiv preprint arXiv:2108.10904 (2021) 1","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.27556","last_updated":"2026-07-17T03:36:55Z","snapshot_observed_at":"2026-08-05T09:32:09.869491Z","submitted_at":"2026-03-29T07:39:31Z","title":"Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T17:14:57.572731Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2603.27556"},"observation_digest":"sha256:600e786d557fa13eff1f4f114230a25c8b5b8d139e95fcc47643d2a6707d0f7b","observation_id":"5e42c1d0-96fb-429a-bbdd-c8fbb123c2e5","resolution":{"observed_at":"2026-08-02T17:14:57.572731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2604.05583","last_updated":"2026-04-07T08:23:39Z","snapshot_observed_at":"2026-07-30T03:36:30.860630Z","submitted_at":"2026-04-07T08:23:39Z","title":"WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:53.371412Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2604.05583"},"observation_digest":"sha256:15fffc4f39e4c8f398e0731e27b8d041cf0770d56fe89997279fa3579ff94e42","observation_id":"08bb4adf-603c-420a-b56e-f78030cdd1a4","resolution":{"observed_at":"2026-05-10T22:50:50.008483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2604.13970","last_updated":"2026-04-15T15:19:54Z","snapshot_observed_at":"2026-07-06T23:01:50.745555Z","submitted_at":"2026-04-15T15:19:54Z","title":"MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:33:02.946839Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2604.13970"},"observation_digest":"sha256:78ee10e2cabbf928597751ffe91f9b92a8d304436e8445ba97990c667a5e4e1b","observation_id":"7830cbe1-7e0c-47c9-b9f5-715b7dc3aaad","resolution":{"observed_at":"2026-05-10T13:35:26.372269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2604.27559","last_updated":"2026-04-30T08:08:46Z","snapshot_observed_at":"2026-07-31T22:09:01.311855Z","submitted_at":"2026-04-30T08:08:46Z","title":"RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T10:00:25.846913Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2604.27559"},"observation_digest":"sha256:5c6b68cda6ad9bc5c437968104e63002adcda6a71b40adb6ede126d64d957fb7","observation_id":"6d9a4388-4867-484a-a86d-89a600935572","resolution":{"observed_at":"2026-05-12T09:41:25.994420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-09T18:56:51.627714Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:48fc8cbe3975711e6b7aa75d5e219f7bcf76218ae5c23e26c5bd9ec831656366","observation_id":"02ec7dbd-701c-485e-bbcb-d116d23e87f8","resolution":{"observed_at":"2026-05-11T16:01:11.367780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:07.825460Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:40e19c4bfab621416f1020e9147e1cbe5b93f096197fbfd902fdd7595cd10d35","observation_id":"f7df252e-0aa0-48c8-8a74-640ef2e21b82","resolution":{"observed_at":"2026-07-01T07:35:28.761944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2605.24020","last_updated":"2026-05-20T06:11:25Z","snapshot_observed_at":"2026-08-07T05:47:37.699297Z","submitted_at":"2026-05-20T06:11:25Z","title":"Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T17:40:33.082748Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2605.24020"},"observation_digest":"sha256:19ac45fb259d33977e33390a153f817428ac08810a6adb3d3c474f31906e5fa9","observation_id":"b8422f70-2647-45b4-9bfb-232a5327bb6f","resolution":{"observed_at":"2026-06-30T17:44:57.697014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.12633","last_updated":"2026-06-10T19:42:03Z","snapshot_observed_at":"2026-08-02T11:20:31.077337Z","submitted_at":"2026-06-10T19:42:03Z","title":"ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T09:45:35.383450Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.12633"},"observation_digest":"sha256:a6ed8d707a254e83c835bce1a3516adb5f1e7031a513b0c7eebb8ee42156bf40","observation_id":"3f559bf9-22c8-41cd-a996-5ea9fef6de58","resolution":{"observed_at":"2026-07-03T10:58:03.089296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.18147","last_updated":"2026-06-16T16:45:56Z","snapshot_observed_at":"2026-08-03T00:46:36.791384Z","submitted_at":"2026-06-16T16:45:56Z","title":"WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-06-27T00:53:11.223341Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.18147"},"observation_digest":"sha256:b4dfe6feac355f7677c226e1528a1ae9664605527bd3a77902b1dc7f6b602928","observation_id":"c548dcb9-23c9-4aeb-95e7-9b654439f2dc","resolution":{"observed_at":"2026-07-03T21:08:58.489179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.25298","last_updated":"2026-06-24T01:59:29Z","snapshot_observed_at":"2026-08-06T12:47:29.014745Z","submitted_at":"2026-06-24T01:59:29Z","title":"KidRisk: Benchmark Dataset for Children Dangerous Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T21:38:32.529040Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.25298"},"observation_digest":"sha256:694c81aece2be593fe9360488103157d89b739c82af66ba1cb3c0f96844c5f08","observation_id":"a2d6d632-ba4e-4dca-a174-d876a3603909","resolution":{"observed_at":"2026-07-04T19:10:05.335820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.29431","last_updated":"2026-07-07T03:19:40Z","snapshot_observed_at":"2026-08-02T13:30:27.757596Z","submitted_at":"2026-06-28T14:48:08Z","title":"FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-30T07:07:00.265141Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.29431"},"observation_digest":"sha256:5cd47f9a5f39bb8391120c4e3ddaaef7a1de9a8bfb12a3147c7b4573d18a1371","observation_id":"8fef56a8-4df4-4064-bd39-324d808df81d","resolution":{"observed_at":"2026-06-30T07:14:21.507790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.29431","last_updated":"2026-07-07T03:19:40Z","snapshot_observed_at":"2026-08-02T13:30:27.757596Z","submitted_at":"2026-06-28T14:48:08Z","title":"FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-02T20:46:16.298898Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.29431"},"observation_digest":"sha256:cf781c242a431996c942b74303a117a35888a58ddb2cd1154f1643ee0b053f4e","observation_id":"87bd443d-8580-4a0d-8b66-6712e854a642","resolution":{"observed_at":"2026-07-02T20:47:22.354415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2108.10904/citation-record","integrity":"/paper/2108.10904/integrity","json":"/paper/2108.10904/citation-record.json","paper":"/paper/2108.10904"},"outbound":[],"paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2108.10904."}