{"as_of":"2026-08-06T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9692ce0d4aa84f9c74c22ffe12a413717b92a10daa4e070e67db56c083f9fd58","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T21:38:19.467233Z","state":"measured"},{"denominator":146,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":146,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":146,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:20:06.322331Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1634,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"1907.09238","last_updated":"2019-07-22T11:21:08Z","snapshot_observed_at":"2026-08-04T02:43:37.585865Z","submitted_at":"2019-07-22T11:21:08Z","title":"Crowdsourcing a Dataset of Audio Captions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T18:09:08.661697Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1907.09238"},"observation_digest":"sha256:22d68c24ee28dd985f7573983bb90721837890718dfba8146ef6fa269742931a","observation_id":"1b224bc0-b1cb-4f54-b4c0-d64a0ee6fbf4","resolution":{"observed_at":"2026-05-24T18:09:47.742982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-07-06T08:13:26.248817Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-15T23:59:37.636404Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.03557"},"observation_digest":"sha256:be1b350be12a064c72a8083cbb9916aa80f3e5396385a9ebb69c3ccee6c01790","observation_id":"8beb0f93-e65f-4839-94cc-14a66091233d","resolution":{"observed_at":"2026-05-15T23:59:37.780504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2103.11474","last_updated":"2021-10-28T01:27:51Z","snapshot_observed_at":"2026-07-06T10:51:55.218757Z","submitted_at":"2021-03-21T19:55:46Z","title":"#PraCegoVer: A Large Dataset for Image Captioning in Portuguese","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T13:43:24.358023Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2103.11474"},"observation_digest":"sha256:c1d050fdd9d4f8dd6bed54d50298bf5cadb286cb4600af2015010de6b4272539","observation_id":"28f8284f-880d-4a7b-af0e-ed6aecf21ed8","resolution":{"observed_at":"2026-05-24T13:44:32.039341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2201.01984","last_updated":"2026-03-10T04:54:20Z","snapshot_observed_at":"2026-08-02T07:16:01.495417Z","submitted_at":"2022-01-06T09:23:18Z","title":"Image Captioning via Compact Bidirectional Architecture","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-24T12:18:47.846727Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2201.01984"},"observation_digest":"sha256:048e6c0331bb9206ed49a84521a22f8a343f2b72e8d29de8cee88eff9f3f0d80","observation_id":"1be85add-ca19-4722-b024-b84682139dba","resolution":{"observed_at":"2026-05-24T12:19:27.034831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:4cfd02ea7ed95c915eb2e980db8cef0bd4c9eed53734a18b43064dcbbac812f9","observation_id":"a5e5b6e1-e1be-45c7-b0f9-9aec249a0b21","resolution":{"observed_at":"2026-05-16T09:50:00.679782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:d1fca90845f8575176648cc5f8fa033648a28b62aacc7ee786cca1f813c632f0","observation_id":"9bd9d5a2-0df3-4e36-a224-5533aea59dae","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:af9593405c5ba9513d278ee8815f9c1dcdab52d2aa8367386d88fed17683ff70","observation_id":"85ff7a0c-afc8-45c8-9c53-afc8e6b0d871","resolution":{"observed_at":"2026-05-15T10:53:08.487450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:39645a416dd42749edd60663caf35dbe719d5f46ab5a70a3faba68d6a52b072c","observation_id":"5063c6e6-0e76-45d7-91e6-dcb9abafb7a7","resolution":{"observed_at":"2026-05-13T06:24:49.989850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:d7be44739c74aace6be471950f86d0d18386df5e567450d4bf22c06bb5e8ba7d","observation_id":"4972a877-902d-4b91-a06e-e0cc5db38a2b","resolution":{"observed_at":"2026-05-16T09:29:06.050752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2212.12130","last_updated":"2026-05-15T03:31:02Z","snapshot_observed_at":"2026-07-06T14:34:19.510288Z","submitted_at":"2022-12-23T03:54:59Z","title":"Learning to Detect and Segment for Open Vocabulary Object Detection","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T10:24:52.653023Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2212.12130"},"observation_digest":"sha256:f489c82b5324bcb7b606ba63eec0d0a66de48a67c1417fecaf71dc9d30579f65","observation_id":"dcaf4239-7be8-442b-998d-32601fd7840e","resolution":{"observed_at":"2026-05-24T10:26:08.085742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:05:36.460932Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2303.15343"},"observation_digest":"sha256:7cefbc32a445dd49cf99cc1ec0cb785e096a094465b6e8c738f406063cd3648c","observation_id":"72eb375c-a89a-417d-b9bf-3a5a0d6ec89a","resolution":{"observed_at":"2026-05-16T13:05:36.533326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T09:02:31.211260Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2304.14178"},"observation_digest":"sha256:99f664be92301a69f9a6dcf61b65f3f12a89ffddcc05d19415ca7bfcda5476ae","observation_id":"8ec80962-ecf4-4b0d-ab78-4a128e7c5401","resolution":{"observed_at":"2026-05-24T09:04:15.032403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T08:41:04.743886Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2304.15010"},"observation_digest":"sha256:753f8b8af7061a14032d76d48c366eddcff0087661f10a33b4f5d2faa818352f","observation_id":"6b5bb468-a0cb-45db-aaa3-856fe30870c9","resolution":{"observed_at":"2026-05-15T08:41:04.775361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:33689a87a93bc49dd95fac4e8402c740299aaf2972e2066175498086b6579090","observation_id":"d65ca8d9-1a4f-4151-ac49-c1be7d63de2f","resolution":{"observed_at":"2026-05-15T02:43:47.935048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:76e8b421b0c54a51b8a7a64a625094508f6f606e3d41652aee8e1c9c26063a65","observation_id":"e3d6e35d-5704-4e6a-80c4-1fd9563f1deb","resolution":{"observed_at":"2026-05-13T23:30:00.510458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T08:27:35.798991Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2306.00978"},"observation_digest":"sha256:7ce8c60617ad98177b470fef05b9d512a5d10c74771afceaab08499accf97bbe","observation_id":"c5faac31-01d7-4ec8-a997-7452b3a0043f","resolution":{"observed_at":"2026-05-24T08:29:11.333273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:cb8a6372fd98961b7bc55d7cd780f531d6274eaf54079e54e4d967c6c2302216","observation_id":"d72dc9d0-68d7-48fa-9da9-00833f1d5585","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T17:20:53.687692Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2307.06281"},"observation_digest":"sha256:a5f97e5b0a78c711d8b01aeb4b22c8583beabe896768b3ee816e7a7e67796848","observation_id":"e0f64b52-267f-4c9c-b3b2-2ea512a05ab7","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T01:52:01.163900Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2308.01390"},"observation_digest":"sha256:f871a965302212e3d48bbf79b6278fb3b4281e9b2334560b02f8e0ed1531d52b","observation_id":"e9e2fc6e-7849-44a6-92a1-1935d9dbbb30","resolution":{"observed_at":"2026-05-14T01:52:01.402804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-08-06T10:08:54.816113Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T09:11:32.018262Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2309.17400"},"observation_digest":"sha256:5107bef240c55242c117ffecfc8551f3ef99d9a2e7e63e927f2c8f2b10ef7468","observation_id":"58ace55f-b7c3-46a4-9f8f-c0bbfadc5816","resolution":{"observed_at":"2026-05-16T09:11:32.066723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:94fe978d93a5fe70fd4c1c4610bda81c17565578359d4a53031adef3f391d503","observation_id":"b73ff6d1-a6a1-4f16-8cef-e628fa8411e4","resolution":{"observed_at":"2026-05-15T23:26:06.540494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T17:08:12.727773Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2311.12793"},"observation_digest":"sha256:d9ff7efd6d5290ad5d7c4356ab9dd3a7e842cbdd046afdd6430b1358cc828055","observation_id":"2c1c9cb5-18d6-4fad-a99b-b5568e944a1b","resolution":{"observed_at":"2026-05-13T17:08:12.795765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:261ec027bcc33baa57f78eed435c4fc960db6589e9f71c4774210d76e56a7e50","observation_id":"78707856-7a45-4c03-941d-9e768b6f2e47","resolution":{"observed_at":"2026-05-13T22:46:09.829246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-15T22:26:21.449135Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2402.09353"},"observation_digest":"sha256:e20017dde64a3ed22b36cb9dcce4eeae7f7e7b107e6b1c6868e08d85eeae5310","observation_id":"2a143420-8309-4e39-ad92-46cc99f2d939","resolution":{"observed_at":"2026-05-15T22:26:21.591591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:86d86946f3c6b5186fdafe815a579cec80e389f6fbc7fb61ad15682371390040","observation_id":"634ff84b-25a1-48e8-8fe9-f4856ffe6db7","resolution":{"observed_at":"2026-05-16T04:09:36.145523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:e80a90957b28ceb8c148e50baf8d69a56c7f1d6a4ccbc12db90cd133310f3188","observation_id":"1c5c2acd-fa89-4835-89a3-b54106d45d9d","resolution":{"observed_at":"2026-05-17T07:44:47.588449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2404.10141","last_updated":"2026-04-25T04:41:00Z","snapshot_observed_at":"2026-07-06T18:00:39.863947Z","submitted_at":"2024-04-15T21:19:10Z","title":"ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T01:42:10.041654Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2404.10141"},"observation_digest":"sha256:4f6db51cfa82d8a06ee581549f24b5ad7f8d8e474b457321a015e94dedfabdf5","observation_id":"6eaba2df-25ca-4931-9e93-1bbf2b57fd07","resolution":{"observed_at":"2026-05-24T01:43:42.944905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:cb4433e6403939c95dcd01ccc808a6df0c7123100560a0c638e2ba8b8d237257","observation_id":"7ae65d8e-6ae0-4fe9-b52c-9b6763fe6d40","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:911b03fecf150ef98760447ae0f965b00c9a83faffede89aa70c9bd1e1450c24","observation_id":"cde83335-67ae-484f-a674-e202b2d35f41","resolution":{"observed_at":"2026-05-24T01:25:54.539820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-04T10:57:26.733885Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T01:17:11.261301Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2405.14430"},"observation_digest":"sha256:51c208d913a693a59be5bee038875bca5c74097929f6c5c14b103409a02ebcc6","observation_id":"56fcaa07-b58f-47c1-92a5-af4c13df9346","resolution":{"observed_at":"2026-05-24T01:18:42.384966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:be3a715b90acb1fc97944f7e8fb19c4b425c36f684fb2bc0b064162297b42863","observation_id":"a907fd74-2589-47b4-b26a-14e1b92d53ae","resolution":{"observed_at":"2026-05-18T06:38:36.868269Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:58712f26b6ae40b582a263e298939e2c3d45f7a68452cf74ea550cf00ec0ebd0","observation_id":"e27abcfe-0a82-4689-8963-6ac137d7c451","resolution":{"observed_at":"2026-05-15T01:55:12.582208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:97400262cce0382131c81bcc3fd1c3c3962d644e9a6b28737a76eec35d32a6b7","observation_id":"6a2041fe-417b-4c19-9a2d-0547cea3490b","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:abb1d3e6e2a540e68b6e6066d3aa24edcd6a5cce152ee708427a830ccbfec7db","observation_id":"3613bcb3-16b4-4e07-9744-43832d64649e","resolution":{"observed_at":"2026-05-15T22:09:16.420682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2412.14113","last_updated":"2026-05-14T17:15:02Z","snapshot_observed_at":"2026-07-06T20:09:28.763595Z","submitted_at":"2024-12-18T17:58:58Z","title":"Adversarial Hubness in Multi-Modal Retrieval","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T06:39:36.039613Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.14113"},"observation_digest":"sha256:919e5d2e8ffb707b6d4a010ac6a4c38322dd710608df2ba7dcc23c1e6a220e32","observation_id":"849f954c-b5d3-45ed-9ad8-a1e4fb5f5c82","resolution":{"observed_at":"2026-05-23T06:42:39.767194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2412.14642","last_updated":"2026-05-22T16:03:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T08:51:16Z","title":"Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-25T08:12:15.133695Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.14642"},"observation_digest":"sha256:dd8c6e5fe05dfa27787bec77aff477d5fdc45bd20eda890710deccc51bcf778d","observation_id":"b421cf42-446e-47dc-a096-f07fe94d7417","resolution":{"observed_at":"2026-05-25T08:15:33.999096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2502.18816","last_updated":"2026-05-07T07:59:16Z","snapshot_observed_at":"2026-08-06T02:20:50.026726Z","submitted_at":"2025-02-26T04:50:20Z","title":"Grad-ECLIP: Gradient-based Visual and Textual Explanations for CLIP","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T02:21:09.704462Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2502.18816"},"observation_digest":"sha256:3c0e2c9d3f3ac10279adee89df1cbc7b57b9afaec92f6a0e785b9bf42446d296","observation_id":"c6fb3883-0635-402b-9e8c-7b33de0352f1","resolution":{"observed_at":"2026-05-23T02:22:25.136680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2503.07878","last_updated":"2026-04-29T20:30:35Z","snapshot_observed_at":"2026-08-03T14:12:26.604832Z","submitted_at":"2025-03-10T21:50:58Z","title":"A Woman with a Knife or A Knife with a Woman? Measuring Directional Bias Amplification in Image Captions","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T23:54:15.135595Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2503.07878"},"observation_digest":"sha256:9042be76f6920cb8f6fd00cfc18d904326feeddaf2865b9eb1c878287f045db0","observation_id":"056870e0-0de0-41d7-ba02-e8b606b04876","resolution":{"observed_at":"2026-05-22T23:55:15.074377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:716a3b80eabc5735202d8c6acfe89a4f7987d4a28953f142c74c32acfa1988e5","observation_id":"ef1c1f6c-8326-4732-9178-5854e652d087","resolution":{"observed_at":"2026-05-22T22:22:12.291375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:d41a9ffdf07abbfb79df8eb300ac59588e39cd20b22419fb82b6893f9a6515ec","observation_id":"75e1d32f-7ffe-4658-b2fc-ef8ea69bf78d","resolution":{"observed_at":"2026-05-22T18:05:00.977492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:1195c535d43a427416597c7be9e8ab815e89cf04357c827bd7100bcd3454f7c8","observation_id":"d9765233-7f4f-4ef4-a691-6772fcad41cd","resolution":{"observed_at":"2026-05-22T18:56:58.326343Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2504.19455","last_updated":"2026-05-07T07:04:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T03:42:42Z","title":"Masked Language Prompting for Generative Data Augmentation in Few-shot Fashion Style Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:59.412368Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2504.19455"},"observation_digest":"sha256:1f2ba5c48233740e0f477f935c04471876f7b5d426cfae964d3476d05ece4283","observation_id":"b62dd826-55a9-4bed-bf3b-221e700e048a","resolution":{"observed_at":"2026-05-22T18:05:00.839252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2505.12217","last_updated":"2026-05-19T11:31:17Z","snapshot_observed_at":"2026-08-02T21:48:00.406423Z","submitted_at":"2025-05-18T03:32:24Z","title":"HyperCap: Hyperspectral Land Cover Captioning Dataset for Vision Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T15:15:19.523035Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.12217"},"observation_digest":"sha256:34bee07ea54f090afcc604bd8afda072fdf796d167a923e29b5ef5781b950801","observation_id":"32f12def-dc00-4938-9830-98e138ab2a0f","resolution":{"observed_at":"2026-05-22T15:16:43.738611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2505.17726","last_updated":"2026-05-19T09:55:01Z","snapshot_observed_at":"2026-08-03T09:08:10.935540Z","submitted_at":"2025-05-23T10:43:45Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T02:06:35.204166Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.17726"},"observation_digest":"sha256:630f35467b1e55f85585a49f4fe0aa62e589382fa35e0ef4e411d75f0e858e41","observation_id":"071ea3a2-2e7b-4f78-babf-6cbf29e18ff0","resolution":{"observed_at":"2026-05-22T02:10:56.220111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2506.00721","last_updated":"2026-04-04T02:19:01Z","snapshot_observed_at":"2026-07-30T08:35:22.353423Z","submitted_at":"2025-05-31T21:42:12Z","title":"Common Inpainted Objects In-N-Out of Context","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T11:38:44.069681Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.00721"},"observation_digest":"sha256:f99e1802c88780c7a098fee52e9d8c940c57076bb2aca1f3aa0b769906685674","observation_id":"a69c3971-c78c-4fb8-8cb5-9ff221c9e252","resolution":{"observed_at":"2026-05-19T11:42:15.974706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2506.02387","last_updated":"2026-04-13T08:26:12Z","snapshot_observed_at":"2026-08-04T07:16:14.991803Z","submitted_at":"2025-06-03T02:57:38Z","title":"VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T11:57:08.314088Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.02387"},"observation_digest":"sha256:ea92edcc79a34646f804d5648137508350629c37d2bbc7350c0b0a15d3f45122","observation_id":"70a55e50-6593-4259-b46b-b15de2234537","resolution":{"observed_at":"2026-05-19T11:57:16.282786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T11:20:06.322331Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.22791","last_updated":"2026-06-11T08:47:41Z","snapshot_observed_at":"2026-08-06T11:20:00.457736Z","submitted_at":"2025-07-30T15:56:36Z","title":"Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T11:20:06.322331Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.22791"},"observation_digest":"sha256:9a5239b5393f8652593334ba1df78df7c0333027b8135067c26cd6d069bc7dc1","observation_id":"6abbd0e3-cca2-48d5-9fd2-c7aa20ad659a","resolution":{"observed_at":"2026-08-06T11:20:06.322331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T04:46:59.069582Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.03091","last_updated":"2025-08-05T05:10:14Z","snapshot_observed_at":"2026-08-06T04:46:58.766707Z","submitted_at":"2025-08-05T05:10:14Z","title":"T2UE: Generating Unlearnable Examples from Text Descriptions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:59.069582Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.03091"},"observation_digest":"sha256:c34db8785fe6abb059a7ec27a242a93452e8847efbd422b0e731cf73ce53c784","observation_id":"2ed96b91-ddab-4159-9191-dda38d3ba10b","resolution":{"observed_at":"2026-08-06T04:46:59.069582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2508.04427","last_updated":"2026-06-11T09:27:03Z","snapshot_observed_at":"2026-08-06T00:02:56.551873Z","submitted_at":"2025-08-06T13:14:20Z","title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-19T00:34:38.247099Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.04427"},"observation_digest":"sha256:d0169aef090f7d16eb36cc6b78a89daa77be285a4a4fb9ad3f1ebccad9396d20","observation_id":"104d7e7f-843c-4d54-b4ea-67aa9a54e84a","resolution":{"observed_at":"2026-05-19T00:36:56.333655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T00:02:58.992894Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.04427","last_updated":"2026-06-11T09:27:03Z","snapshot_observed_at":"2026-08-06T00:02:56.551873Z","submitted_at":"2025-08-06T13:14:20Z","title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-06T00:02:58.992894Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.04427"},"observation_digest":"sha256:d3d42bfcaf91ed63be6f3e560073225c6bf418d594eff852ba685847975497fa","observation_id":"6a2dce26-9059-4f6b-8fca-e1f536e47088","resolution":{"observed_at":"2026-08-06T00:02:58.992894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T23:17:06.035332Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-05T23:17:01.532309Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.035332Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:d36add2201cbc619c6c6223992d95833ac9308a027485b9705a15ed2942600c0","observation_id":"aaf5043a-1208-4a05-9244-460064c6cb40","resolution":{"observed_at":"2026-08-05T23:17:06.035332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T22:58:33.657104Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-06T03:34:02.844394Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.657104Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:4d8bcc045407a695d56727751181bd3a5dae365aa037b5c788333cdcc7249c54","observation_id":"da60b3e5-d993-46ec-b9e0-2c35daee4b04","resolution":{"observed_at":"2026-08-05T22:58:33.657104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T21:52:47.542522Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.07818","last_updated":"2025-08-11T10:03:00Z","snapshot_observed_at":"2026-08-05T21:52:44.804322Z","submitted_at":"2025-08-11T10:03:00Z","title":"Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:47.542522Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.07818"},"observation_digest":"sha256:c1f196a894d88d78eb27e5faff3d7722b1a7ab9ba547364606fbfddb6eb874bf","observation_id":"eb61d106-f26f-4c75-bb70-9a412e1885f1","resolution":{"observed_at":"2026-08-05T21:52:47.542522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T20:36:40.251887Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.13184","last_updated":"2025-08-14T00:55:18Z","snapshot_observed_at":"2026-08-06T03:45:08.398187Z","submitted_at":"2025-08-14T00:55:18Z","title":"BERT-VQA: Visual Question Answering on Plots","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:36:40.251887Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.13184"},"observation_digest":"sha256:4a4215a09476f2858b53e641fc1d826b8fee01d6a79a5adcaaf7465d00b18020","observation_id":"04e72c13-00da-4d94-94e1-a2a106e8c979","resolution":{"observed_at":"2026-08-05T20:36:40.251887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T14:59:19.506021Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20691","last_updated":"2025-08-28T11:50:22Z","snapshot_observed_at":"2026-08-06T05:56:44.188729Z","submitted_at":"2025-08-28T11:50:22Z","title":"MobileCLIP2: Improving Multi-Modal Reinforced Training","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T14:59:19.506021Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.20691"},"observation_digest":"sha256:572041b9abbcab976dde912f25ffb3c43cc0f7835cffd5097842ce98aef0659a","observation_id":"4e04d4c3-2a9c-4b4a-96f7-cf27e24fb2fc","resolution":{"observed_at":"2026-08-05T14:59:19.506021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T10:15:50.303995Z","title":"Microsoftcococaptions:Datacollectionandevaluationserver,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-05T10:15:47.702669Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.303995Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:3399194faf3bf7d4eb15eaf4d7d96f24ea52e401bb954523435db811b7b1b0fb","observation_id":"f9d83025-6180-41d2-896d-ad21f1ed39d8","resolution":{"observed_at":"2026-08-05T10:15:50.303995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T12:57:49.943388Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.05333","last_updated":"2025-09-01T02:13:00Z","snapshot_observed_at":"2026-08-05T12:57:46.958193Z","submitted_at":"2025-09-01T02:13:00Z","title":"RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T12:57:49.943388Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.05333"},"observation_digest":"sha256:8c67878fe01791fcd2500bd1a1f09aeb708107bde2b218481ef5c86677251423","observation_id":"c62b17c4-81a9-43fd-884c-47acded4c33f","resolution":{"observed_at":"2026-08-05T12:57:49.943388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T05:12:44.083105Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.05714","last_updated":"2025-09-06T13:26:04Z","snapshot_observed_at":"2026-08-05T05:12:38.270450Z","submitted_at":"2025-09-06T13:26:04Z","title":"Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T05:12:44.083105Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.05714"},"observation_digest":"sha256:8f2130d55b6ba942a45ed9e6448166559dc98d1a316ed26d520760de1f6447e5","observation_id":"c4d6bcf3-0373-476b-a9ec-42fd2926a9e3","resolution":{"observed_at":"2026-08-05T05:12:44.083105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2509.22123","last_updated":"2026-05-13T12:28:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-26T09:46:13Z","title":"Multilingual Vision-Language Models, A Survey","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T13:02:08.000814Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.22123"},"observation_digest":"sha256:f3bf67e0ceebd84d652e2876a51b1548e2ec0db0e2e08ba3c7db575a81150f68","observation_id":"e0573306-2c83-4580-99cc-0589aa918643","resolution":{"observed_at":"2026-05-18T13:02:37.444440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-04T14:58:37.449797Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-04T14:58:34.204803Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.449797Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:6fd22e0da2c67a4f7f6756353c34a06415ccf36fcfbfc7c08d816d8d9583294a","observation_id":"cfdadec1-1bae-4b93-9db0-91c600144b44","resolution":{"observed_at":"2026-08-04T14:58:37.449797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2510.04225","last_updated":"2026-04-21T18:16:55Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T14:29:01Z","title":"Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T10:13:08.112072Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2510.04225"},"observation_digest":"sha256:fcc58359430bd32479e98cfc1800d5590000d0329dc9d380d3197a1b202c81d5","observation_id":"ce35e764-dc80-440c-9624-75d245551088","resolution":{"observed_at":"2026-05-18T10:16:14.416463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2510.04309","last_updated":"2026-05-16T04:44:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T18:05:28Z","title":"Activation Steering with a Feedback Controller","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T21:50:05.186376Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2510.04309"},"observation_digest":"sha256:3e461d5f8b64dd11c10430f6d62b215fa04b774c179b1797fe41e911b9600462","observation_id":"43c6531b-7c27-4a43-86d7-ad1e0e6896d5","resolution":{"observed_at":"2026-05-21T21:50:41.390967Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-04T09:31:55.130506Z","title":"Microsoft COCO Captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-06T06:03:02.383912Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.130506Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:7967365773b504eebda593b5c2cf53817da2f74180559b2059c09895acf64672","observation_id":"c1f49450-7e1b-424f-b3e3-caf108aba6aa","resolution":{"observed_at":"2026-08-04T09:31:55.130506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2510.20093","last_updated":"2026-04-14T09:32:02Z","snapshot_observed_at":"2026-07-06T22:33:53.834577Z","submitted_at":"2025-10-23T00:27:32Z","title":"StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:26:42.034972Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2510.20093"},"observation_digest":"sha256:bd37ee6fa16be8fb3622f23f9605024643d78cb22384ec6e702c74728a025813","observation_id":"4b131054-0fb6-4782-952a-2473e4857ac5","resolution":{"observed_at":"2026-05-18T05:30:55.340950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:04.983299Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:d558179c9ab23a04845b354229d4fb4375a9e17cb455ebe1bed35d067f22c748","observation_id":"3a55d6f6-ec61-41a2-a2b1-845abd6728ba","resolution":{"observed_at":"2026-05-21T19:54:20.234562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-03T21:43:58.707091Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:43:58.707091Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:3d71c6c64bccbcb08f18511202b3175df350c08d3b6d6ef82eea1186c551a473","observation_id":"6a66a247-ca63-4b4d-9fb9-2a60e134f0f1","resolution":{"observed_at":"2026-08-03T21:43:58.707091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-03T20:27:03.812410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20002","last_updated":"2026-06-17T05:14:08Z","snapshot_observed_at":"2026-08-03T20:27:02.365537Z","submitted_at":"2025-11-25T07:13:13Z","title":"Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T20:27:03.812410Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2511.20002"},"observation_digest":"sha256:be099f6ab80483093ad8d7aa16f14845e01321e38901a02557bf7524fcb2b627","observation_id":"5c40efce-1f1f-45ce-8a00-1988d3ee5d9d","resolution":{"observed_at":"2026-08-03T20:27:03.812410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2512.20901","last_updated":"2026-05-22T15:06:27Z","snapshot_observed_at":"2026-08-02T04:42:54.079175Z","submitted_at":"2025-12-24T02:59:01Z","title":"Benchmarking and Enhancing VLM for Compressed Image Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:06.192538Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2512.20901"},"observation_digest":"sha256:ef49970961dd971054e34b4c3b6d3fa924f3f1bdfea7d0fd319e9dfdc6092b63","observation_id":"3bc9f3e4-c916-459b-be60-ac19a6b184fb","resolution":{"observed_at":"2026-05-25T07:26:41.749325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-03T05:17:24.815840Z","title":"Chen, T., Kornblith, S., Norouzi, M., and Hinton, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.02877","last_updated":"2026-06-24T04:32:54Z","snapshot_observed_at":"2026-08-03T05:17:21.068350Z","submitted_at":"2026-02-02T22:33:49Z","title":"A Geometry-Aware Efficient Algorithm for Compositional Entropic Risk Minimization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T05:17:24.815840Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2602.02877"},"observation_digest":"sha256:57ee84ac59a5014d3e8832bd19a66f5986b58be2bc1e9afcbf14a08e308a7adb","observation_id":"a19db48b-6f61-4ad4-b66d-8bd77e2769b2","resolution":{"observed_at":"2026-08-03T05:17:24.815840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-02T22:25:58.434888Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-02T22:25:56.850881Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.434888Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:e6b9ed417f25ca33f130ede9416234d4d03c658a66c52e0e3cb09b11d0e7ab7c","observation_id":"861bfd8e-0120-4558-bb20-82a55f20ac88","resolution":{"observed_at":"2026-08-02T22:25:58.434888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-02T23:46:04.720421Z","title":"Bolukbasi, T., Chang, K.-W., Zou, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.02237","last_updated":"2026-05-30T08:18:21Z","snapshot_observed_at":"2026-08-02T23:46:03.167678Z","submitted_at":"2026-02-13T11:07:23Z","title":"Concept Heterogeneity-aware Representation Steering","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:46:04.720421Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2603.02237"},"observation_digest":"sha256:6fc0fe66bf6ae2cf26bc8159fd4d4df3867ef66d16f0883c7168a19cc14563bd","observation_id":"1654ccdf-30af-4f0b-9e10-79da33a60132","resolution":{"observed_at":"2026-08-02T23:46:04.720421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.00829","last_updated":"2026-04-25T12:57:30Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T12:38:27Z","title":"LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T22:55:49.617588Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.00829"},"observation_digest":"sha256:8a192966176930c9eca625b37cd304d98ea7497d83d4906e01eb980b4dfcbc53","observation_id":"b3eeed85-7c5e-4003-bfbd-110ea924877e","resolution":{"observed_at":"2026-05-13T22:58:23.958105Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-07-30T06:32:02.248567Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:1248f17a2bdb114fa2a9abe7d11f53d8b1e504fa1edbc334da3c556df0eb420c","observation_id":"bf121e0a-cf53-49e2-a98d-dc675e30b284","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.04681","last_updated":"2026-04-06T13:48:11Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T13:48:11Z","title":"Batch Loss Score for Dynamic Data Pruning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:17:42.229302Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.04681"},"observation_digest":"sha256:d6ff5626d8c5dcc4418a2488736d34e14a8db8d3dccdbf29fde739371a183337","observation_id":"c68ea044-6281-4f65-b0f2-d487fc3b967a","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.05623","last_updated":"2026-04-07T09:27:01Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T09:27:01Z","title":"DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:29.592129Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.05623"},"observation_digest":"sha256:9576f2e8f4379be24ba9f82be788eac599971ed447ea55655e4ebb5104e76397","observation_id":"e86717f9-2227-49dc-9280-22bdebb26ccf","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.08212","last_updated":"2026-04-09T13:11:30Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:11:30Z","title":"Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:39.410040Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.08212"},"observation_digest":"sha256:c17e1e9af38843f9d81c516b9e8d148fb17dd2ea0b4eee8fa941aa0612d31619","observation_id":"0f8eb8c4-a5a0-4ee5-9983-29578d8f499a","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.10180","last_updated":"2026-07-09T07:28:08Z","snapshot_observed_at":"2026-07-12T23:17:28.794767Z","submitted_at":"2026-04-11T12:19:11Z","title":"Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:39.600498Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.10180"},"observation_digest":"sha256:a7d6d8d34a0c3e55c8df8c84562d50a8f1596b428f27508fafa24eb8dcfdaab9","observation_id":"682baa85-5976-4d35-bbf2-5c2796df9f60","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:737e015d7a01a5be3e3ccd8241fb8ed8babc874bdbc80cba44593694df9d826c","observation_id":"c7cbac4f-55ca-4d26-a927-767a880de252","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:bceeecb894901f20d4f8a5e6d2e09b3e08b41d78b0144f5cfd0e2a32698b1c2e","observation_id":"6eb3bc23-8ff8-4672-b700-2f559dca0f0d","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.12833","last_updated":"2026-04-14T14:52:15Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:52:15Z","title":"Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:58:28.202606Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.12833"},"observation_digest":"sha256:4996592567eea91b8fdcc625b0c3f59c7352fd24b6a2e818df3f01f862a6b0f6","observation_id":"c1a64b82-9a6e-45ea-89ea-66d3ba2eafec","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.16557","last_updated":"2026-07-30T13:33:20Z","snapshot_observed_at":"2026-08-02T23:57:44.839325Z","submitted_at":"2026-04-17T08:39:07Z","title":"S-GRPO: Unified Post-Training for Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:18:59.432486Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.16557"},"observation_digest":"sha256:f127e8dc8eeda8847d15dd0ebca6742ea0078e5e0a62c04765d86f3fee05692e","observation_id":"72392037-408c-4038-b241-f0825ca65924","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-02T16:10:53.670309Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.16557","last_updated":"2026-07-30T13:33:20Z","snapshot_observed_at":"2026-08-02T23:57:44.839325Z","submitted_at":"2026-04-17T08:39:07Z","title":"S-GRPO: Unified Post-Training for Large Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:53.670309Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.16557"},"observation_digest":"sha256:ad8e04d24ddd752c4a00b2f6e211fbe9c7c8f24b76b39bc0735ceb1ded1c56b8","observation_id":"a7e2dc5f-ca7d-49c0-8e81-b447cb4febae","resolution":{"observed_at":"2026-08-02T16:10:53.670309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.17241","last_updated":"2026-04-19T04:04:02Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T04:04:02Z","title":"GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T06:26:06.208036Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.17241"},"observation_digest":"sha256:6e8137e68b7fd1d40ce05735638afd1216d4289ab1f8c66b553a1ccbe8718257","observation_id":"9ca71ed9-5063-4ca7-a91f-bd613812408d","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.17941","last_updated":"2026-04-20T08:21:06Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:21:06Z","title":"From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-10T05:44:37.891638Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.17941"},"observation_digest":"sha256:7717872f69976e1fe3044286f049f9a2356deb1e4176800d3ecd03c2e7cc8e51","observation_id":"30411ee3-4c6b-40b3-acf4-2c89db9e798d","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f3413b33eb8ff069a9e1901467c35ff7b666bce7926b5ef18e14a76a0d211830","observation_id":"0d3419f0-c575-48a1-bb60-db89462d6476","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.23344","last_updated":"2026-04-25T15:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-25T15:06:07Z","title":"Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T08:41:12.351655Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.23344"},"observation_digest":"sha256:e8d72192cac0a75b5f6d7ab52bead3c26bd62ff52a32ac54089cc500c0d2c04f","observation_id":"9db6f033-ac28-4632-8ede-a143d374c9ae","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.00733","last_updated":"2026-05-01T15:33:38Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T15:33:38Z","title":"EASE: Federated Multimodal Unlearning via Entanglement-Aware Anchor Closure","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T18:29:15.893882Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.00733"},"observation_digest":"sha256:ef294c8701f0e605c1418d2ede5cb17471a721959058b275fb916cab643d909d","observation_id":"a707248a-0b80-46c7-98f0-6f61ee59764f","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.02116","last_updated":"2026-05-28T04:23:25Z","snapshot_observed_at":"2026-07-06T23:15:11.601042Z","submitted_at":"2026-05-04T00:38:29Z","title":"Statistical Consistency and Generalization of Contrastive Representation Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-09T16:55:04.086365Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.02116"},"observation_digest":"sha256:152427ac4dec0f0194fe2bd48a64e2e7e5c5f7b5236fcdd5ee552882935a40bc","observation_id":"56655c96-ac24-4294-83f0-8cc0be789acf","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.02116","last_updated":"2026-05-28T04:23:25Z","snapshot_observed_at":"2026-07-06T23:15:11.601042Z","submitted_at":"2026-05-04T00:38:29Z","title":"Statistical Consistency and Generalization of Contrastive Representation Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-21T09:00:00.110353Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.02116"},"observation_digest":"sha256:2881ae4bc249111b8824a029d3ccccfba634706c35fe18b9063ea69b40c413ad","observation_id":"440091d4-9a67-4776-b93b-7481e51b04fa","resolution":{"observed_at":"2026-05-21T09:04:04.649210Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.03189","last_updated":"2026-05-04T22:16:11Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-04T22:16:11Z","title":"Sentinel2Cap: A Human-Annotated Benchmark Dataset for Multimodal Remote Sensing Image Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T18:17:35.846352Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.03189"},"observation_digest":"sha256:9fbb38ab9907b16a7091c5b2c227a11ad733a5a0229220d6ff9d1d61d798820c","observation_id":"ca5676f7-4456-4ec2-83bb-05227f70caed","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-08-02T13:39:32.739295Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:409a0139ef0b802bc0d446a030f10508db87ed0c72b55ddecf9c32a0f1e2f529","observation_id":"869a73a3-2b58-4301-909d-fbae7dd547e7","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-02T10:00:31.466870Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:70f35762bdb5b33026d29a434a8c6b813f19d4f47e0cddd5920ed6cb4f36fc12","observation_id":"7341c44f-03db-4fb8-8821-41a6c14ff47d","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-02T12:36:41.415898Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:67ef68c9c73b6623ba88acc78b77ea7eb578121b5035ba8f098c79cb32c3a1be","observation_id":"bbfff318-c287-4577-8b86-c56bccd91a9f","resolution":{"observed_at":"2026-05-14T20:22:56.233042Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.13173","last_updated":"2026-05-13T08:34:10Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:34:10Z","title":"OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T02:13:53.218695Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.13173"},"observation_digest":"sha256:b62dc459d0c2ad4b6e0318c128c021010327920fc8f7ebe2b5b1559b44b407d6","observation_id":"9bb89455-6644-4877-865f-7f36bb5ce8a6","resolution":{"observed_at":"2026-05-14T02:18:37.559140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.16651","last_updated":"2026-06-09T22:26:11Z","snapshot_observed_at":"2026-08-01T05:03:28.887763Z","submitted_at":"2026-05-15T21:44:16Z","title":"Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T18:19:05.137641Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.16651"},"observation_digest":"sha256:85ec60a5a90e3645eb9463579eb44021ca4ad86514ebdc71f81858cdda915bcb","observation_id":"a2483a73-46e5-4985-8421-ec4436a5fb34","resolution":{"observed_at":"2026-05-20T18:23:37.723191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.16651","last_updated":"2026-06-09T22:26:11Z","snapshot_observed_at":"2026-08-01T05:03:28.887763Z","submitted_at":"2026-05-15T21:44:16Z","title":"Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T19:08:14.197339Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.16651"},"observation_digest":"sha256:bfec8225d529b7cd61a0b804a4aa80b038a70516d2097c539fa3c8c5d8b03708","observation_id":"4bda0e1f-e7df-4e18-bfa9-129e3909eda8","resolution":{"observed_at":"2026-06-30T19:15:00.870582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.16732","last_updated":"2026-05-16T00:52:00Z","snapshot_observed_at":"2026-07-31T16:38:42.574868Z","submitted_at":"2026-05-16T00:52:00Z","title":"DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T21:48:35.203469Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.16732"},"observation_digest":"sha256:1f4ad5ef392b4b0f508fac7c20f5154e37cebfa6a3e770467ff28f81afad3e3b","observation_id":"4849b43a-6994-4b13-ba5f-672e3a3ce30d","resolution":{"observed_at":"2026-05-19T21:52:48.408408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.18868","last_updated":"2026-05-15T12:28:16Z","snapshot_observed_at":"2026-08-02T22:00:15.007211Z","submitted_at":"2026-05-15T12:28:16Z","title":"DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T18:31:48.770507Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.18868"},"observation_digest":"sha256:a25ccb1b28508485ffeec6116ba96f4193d29a1c398049108142b1a55e603900","observation_id":"cce6b67d-dcbf-4033-af31-f2a2a54d8585","resolution":{"observed_at":"2026-05-20T18:33:37.936267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.20273","last_updated":"2026-05-19T03:11:54Z","snapshot_observed_at":"2026-08-03T21:46:08.439992Z","submitted_at":"2026-05-19T03:11:54Z","title":"Modality-Decoupled Online Recursive Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T08:44:56.543284Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.20273"},"observation_digest":"sha256:f0a2aba4b2f54358fc57fb89d00a48fca80835702712c4318ab775d4cd38e9cc","observation_id":"877641bb-11f5-4ad2-8da4-1b4fd1c4bb75","resolution":{"observed_at":"2026-05-21T08:49:53.972582Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.22168","last_updated":"2026-05-21T08:39:46Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:39:46Z","title":"Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:34.039507Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.22168"},"observation_digest":"sha256:80edd3d408ab5236500c5e139d86fb32693dda268325c733ff4537f93f2b7165","observation_id":"c96ca966-6bf5-4cb7-846a-c483f92a05ff","resolution":{"observed_at":"2026-05-22T06:06:08.766897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1504.00325/citation-record","integrity":"/paper/1504.00325/integrity","json":"/paper/1504.00325/citation-record.json","paper":"/paper/1504.00325"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the semantics of words and pictures","venue":null,"work_id":"3d416005-6a1b-49d5-8f37-b63f1c63620e","year":2001},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:81ffcf7c3cdc2f1957fbc61eaa3fc63f8698672c8a90b5a64b992c1a6a0fd44d","observation_id":"d0fca574-faff-4a9f-8e20-7b730f51d70e","resolution":{"observed_at":"2026-05-12T21:38:19.689981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Matching words and pictures","venue":null,"work_id":"8c3cdf6a-7603-4345-87e8-53ab047bcdfd","year":2003},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:e0bae5ae37690a0d593faab11bf6c6f0e4df5f94fe9fe6c9cd2960782abb8364","observation_id":"1c09e5c8-962e-4b4a-bc29-c5da351e87a7","resolution":{"observed_at":"2026-05-12T21:38:19.698876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A model for learning the semantics of pictures","venue":null,"work_id":"cba48426-6ab4-41b6-a631-bc85c357bb8c","year":2003},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:62cb96bf4de07474ecd917849cdbe9503c36b7f5bf383fd6761c0ccf9f1b9d76","observation_id":"c7b7e6de-7abc-4a3e-a224-150ba7f3c525","resolution":{"observed_at":"2026-05-12T21:38:19.703779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Baby talk: Understanding and generating simple image descriptions","venue":null,"work_id":"2e7ce5fc-9fa8-494f-8a33-0667124a90f1","year":2011},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:82949250420f09b0cd03e0b3d7f022ed4114684809c78239760232f4bfab7fdb","observation_id":"57b70b4b-c22c-4850-8692-9e48499cb3de","resolution":{"observed_at":"2026-05-12T21:38:19.708165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Midge: Generating image descriptions from computer vision detections","venue":null,"work_id":"0514fdca-124c-4da4-bd00-fc17d4f2d3b4","year":2012},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:6f4051e95818a5abc3fe8a2e54e8541e343a04e287dbc921599a760345dad847","observation_id":"82f6e1ee-94a8-4e44-b5f1-5c375839de19","resolution":{"observed_at":"2026-05-12T21:38:19.712570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Every picture tells a story: Generating sentences from images","venue":null,"work_id":"3ff13106-a797-4b98-a854-e29e345499f5","year":2010},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:36ca00af7527917d36e5c3bc96bf9c47d369ec7b12a74bf7a2c1b3cb1c3e1b73","observation_id":"cb1a9009-dfe2-4684-8e31-80338c82d45b","resolution":{"observed_at":"2026-05-12T21:38:19.716746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framing image de- scription as a ranking task: Data, models and evaluation metrics","venue":null,"work_id":"1da2a189-0585-451f-bb0e-971cbd56c6b8","year":2013},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:4595d33e90d357c0c3d7b622ae85438b342ab1d461b96e6ae7a498ccde60d297","observation_id":"9f48f1cb-22cc-4356-821c-26e071949ace","resolution":{"observed_at":"2026-05-12T21:38:19.721122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collective generation of natural image descriptions","venue":null,"work_id":"2d311742-5641-4a4d-8e23-f8f002c8f179","year":2012},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:f0a73ac5a6d90adee2766ffecd85bb0fb64ad91f4c525ffd5f7ef2da2fd554d7","observation_id":"dc7b9a30-0ff2-4b85-a102-cd58173a3c7d","resolution":{"observed_at":"2026-05-12T21:38:19.724924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Corpus- guided sentence generation of natural images","venue":null,"work_id":"a7ad83c0-dbf9-4751-9e30-c2dca537cc6b","year":2011},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:85910387a52a7c3614d55ea420832375e49689d7085e5c38074578ea90c5c681","observation_id":"5c1c9ca7-f529-49d4-ae98-2f5e9703f1ce","resolution":{"observed_at":"2026-05-12T21:38:19.730308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Choosing linguistics over vision to describe images","venue":null,"work_id":"8216fe5e-d451-4349-9fc8-36223d09a22e","year":2012},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:5ca206eb40784118a9a975e6c6b217749443a4abce7a5855752d1d63d5a9a6ed","observation_id":"41de0ff8-83cc-4e98-82c2-b7fca65b13b1","resolution":{"observed_at":"2026-05-12T21:38:19.737094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributional semantics in technicolor","venue":null,"work_id":"810bdbf6-9e76-44a1-8b92-1fe84b40242e","year":2012},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:a49adb79f329cbc52f848364f721aa0135b5677bbc020843d374ede8ce8c4565","observation_id":"a4a31652-9f26-4fe9-b24a-e6bc5f82d9f7","resolution":{"observed_at":"2026-05-12T21:38:19.741339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic caption generation for news images","venue":null,"work_id":"96535b30-5369-433b-b0b1-5ea7eee54154","year":2013},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:2cd8116616c384fbc873685d8622fd6db0bc2d812c20301aad41958fd090a2a7","observation_id":"8f655521-d30d-4f68-9c63-7510ffe7c672","resolution":{"observed_at":"2026-05-12T21:38:19.592504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image description using visual depen- dency representations","venue":null,"work_id":"b8958c58-ea39-4282-a5e8-ab0257086e01","year":2013},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:36d91e2ee295018061e79f3eaa8431db333f38e746e310185561fbed22f1cd5d","observation_id":"ac2e3079-6ed4-4153-b2ee-838764b63ce9","resolution":{"observed_at":"2026-05-12T21:38:19.597889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep fragment embeddings for bidirectional image sentence mapping","venue":null,"work_id":"b7dc0b9c-3b27-4312-8ca3-bee60cb3d276","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:70022e8bea5eb50e0013f535f3aacc26a0ebb6604a01cd1a834d3cbba0752348","observation_id":"98a7367c-97ca-4a7e-9948-cf5b97de07cc","resolution":{"observed_at":"2026-05-12T21:38:19.602473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image-sentence embeddings using large weakly an- notated photo collections","venue":null,"work_id":"cc06d38a-6903-4487-8ca8-8f72b0916a4d","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:1ed628eb9fd2f09f607aad82a7c7d7fa231ccf37d2ec5d0474063402c50c3f1e","observation_id":"86889648-4499-48f6-9195-bc952ca2bd19","resolution":{"observed_at":"2026-05-12T21:38:19.606466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonparametric method for data- driven image captioning","venue":null,"work_id":"aa494649-2d58-48cb-93d9-d6332ef1b907","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:cb2fbe78965cf8eba6c1ad9640ac736423921789c637c9655a55a970b9b336c7","observation_id":"1ae5dd68-bdeb-43ef-b75f-6c524968aff4","resolution":{"observed_at":"2026-05-12T21:38:19.610330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Treetalk: Com- position and compression of trees for image descriptions","venue":null,"work_id":"04bc6223-7e85-40f7-a610-ec418495ce66","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:de6f6709c790d510159539b2cfb6a528345f0345b57d2b268944431234c221e0","observation_id":"f4542b6b-0a82-458b-a20c-774b2daa6870","resolution":{"observed_at":"2026-05-12T21:38:19.615522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autocaption: Automatic caption generation for personal photos","venue":null,"work_id":"9e6abded-8e49-4641-823f-aabd40e3ec72","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:40e424b1d2030a1a6fec704860990f7ffce655eda1a9c62e3e7f39d023829ebe","observation_id":"291577fd-92a6-457e-9050-c3c088e71f00","resolution":{"observed_at":"2026-05-12T21:38:19.619855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is this a wampimuk? cross-modal mapping between distributional semantics and the visual world","venue":null,"work_id":"c46d9ff9-6456-45ec-bdb4-88737d1fcd82","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:1565ff6efcc77687b2a9437fea09ff739f4827db2feb11eaa983740794bde8d9","observation_id":"3cc59b09-c17e-4f3a-a93d-cf5eb152198a","resolution":{"observed_at":"2026-05-12T21:38:19.624692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal neural language models","venue":null,"work_id":"29b43e24-310b-41b0-92cc-6f0ebf9e7182","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:8bf79bb559a8a6f857388e7a3981c3ec3d401b9aef0ca3693537f3aa8ab674c2","observation_id":"94234b57-8d52-44eb-bb38-a2c6ddb18bba","resolution":{"observed_at":"2026-05-12T21:38:19.628927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.1090","last_updated":"2014-10-04T20:24:34Z","snapshot_observed_at":"2026-07-06T03:56:26.246782Z","submitted_at":"2014-10-04T20:24:34Z","title":"Explain Images with Multimodal Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":"1410.1090","doi":null,"metadata_source":"pith","pith_arxiv_id":"1410.1090","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Explain Images with Multimodal Recurrent Neural Networks","venue":"cs.CV","work_id":"c903466d-5852-4057-87ef-6cc59d66a09d","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1410.1090","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:0e6a8f622410c874b8f41352dc2951b36aa528fb72cc3ad38ca9f40402fcc5dc","observation_id":"5c2f80e5-1a2f-4fcf-b129-baddddfc405a","resolution":{"observed_at":"2026-05-12T21:38:19.544943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.4555","last_updated":"2015-04-20T22:26:11Z","snapshot_observed_at":"2026-08-05T19:52:52.260168Z","submitted_at":"2014-11-17T17:15:41Z","title":"Show and Tell: A Neural Image Caption Generator","version":2},"cited_work":{"arxiv_id":"1411.4555","doi":null,"metadata_source":"pith","pith_arxiv_id":"1411.4555","snapshot_observed_at":"2026-07-03T15:38:33.137868Z","title":"Show and Tell: A Neural Image Caption Generator","venue":"cs.CV","work_id":"0c23858d-3781-429b-a8e3-3288f9e8a6e7","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1411.4555","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:716b82aacf54bf60598723cf22a440d4824d8f3fdba921dc9fab5c1be21e88e5","observation_id":"03732dc8-78fc-4552-9f8f-4866fea7b655","resolution":{"observed_at":"2026-05-12T21:38:19.562091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.2306","last_updated":"2015-04-14T05:02:53Z","snapshot_observed_at":"2026-07-06T04:02:50.341299Z","submitted_at":"2014-12-07T02:36:07Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","version":2},"cited_work":{"arxiv_id":"1412.2306","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.2306","snapshot_observed_at":"2026-07-03T15:38:33.140259Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","venue":"cs.CV","work_id":"5dd4766b-7228-4dbb-9fac-c0ed83c45019","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1412.2306","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:01705a83f7bc2082532c93a8f4599a5d506e7c4eab277c1a282ec5f8fae858c3","observation_id":"e7e304ae-2e03-43fe-9340-6ee2e07c86b5","resolution":{"observed_at":"2026-05-12T21:38:19.570591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-07-06T04:00:05.122784Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":"1411.2539","doi":null,"metadata_source":"pith","pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-07-02T15:17:07.122405Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","venue":"cs.LG","work_id":"400e54cd-2c42-418c-82b8-c43bf44e46c8","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:b00ff889f13312b7501e15d69b4655853302dadc1874a1852d35ad15e3efce8c","observation_id":"b9d6221c-6c39-4453-9ee3-03755662c2d7","resolution":{"observed_at":"2026-05-12T21:38:19.578820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.4389","last_updated":"2016-05-31T22:57:33Z","snapshot_observed_at":"2026-07-06T04:00:45.542965Z","submitted_at":"2014-11-17T08:25:17Z","title":"Long-term Recurrent Convolutional Networks for Visual Recognition and Description","version":4},"cited_work":{"arxiv_id":"1411.4389","doi":null,"metadata_source":"pith","pith_arxiv_id":"1411.4389","snapshot_observed_at":"2026-07-01T22:36:18.028797Z","title":"Long-term Recurrent Convolutional Networks for Visual Recognition and Description","venue":"cs.CV","work_id":"dcb7239a-0f85-439c-8f67-617112b68ef7","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1411.4389","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:4bed66831a37bdf7975dc38d47c2915f382956bd717c8ed4b2e53c00960c3eed","observation_id":"38a27fdf-cc51-4e93-aeca-4126a352feab","resolution":{"observed_at":"2026-05-12T21:38:19.586510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.4952","last_updated":"2015-04-14T18:05:07Z","snapshot_observed_at":"2026-08-02T01:51:07.621546Z","submitted_at":"2014-11-18T18:23:45Z","title":"From Captions to Visual Concepts and Back","version":3},"cited_work":{"arxiv_id":"1411.4952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1411.4952","snapshot_observed_at":"2026-07-04T20:50:48.615902Z","title":"From captions to visual concepts and back","venue":null,"work_id":"d2fc7e87-3376-4395-8a9d-2b73c1297774","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1411.4952","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:775b8008fb4d6dd331d4003c02346d4890ee107e3aeb158e717e1a5c90b55e36","observation_id":"efc3f455-2459-47b9-b689-70a1e5269383","resolution":{"observed_at":"2026-07-04T20:50:48.615902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5654","last_updated":"2014-11-20T19:50:27Z","snapshot_observed_at":"2026-07-06T04:01:11.932860Z","submitted_at":"2014-11-20T19:50:27Z","title":"Learning a Recurrent Visual Representation for Image Caption Generation","version":1},"cited_work":{"arxiv_id":"1411.5654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1411.5654","snapshot_observed_at":"2026-07-04T19:13:44.685711Z","title":"Learning a recurrent visual representa- tion for image caption generation","venue":null,"work_id":"3d152ba4-8c7a-455c-8613-f909d4cb1bf3","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1411.5654","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:78c70ce2c03fc7f8b530e3a5834d24259bf0cdc277f91ae79b36660b723e33c0","observation_id":"d86d2490-9e03-4a9e-a5d7-3a9874a3396e","resolution":{"observed_at":"2026-07-04T19:13:44.685711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03671","last_updated":"2015-04-09T09:48:52Z","snapshot_observed_at":"2026-07-06T04:09:03.237961Z","submitted_at":"2015-02-12T14:17:15Z","title":"Phrase-based Image Captioning","version":2},"cited_work":{"arxiv_id":"1502.03671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1502.03671","snapshot_observed_at":"2026-07-04T19:27:54.738193Z","title":"Phrase-based image captioning","venue":null,"work_id":"ce748b0a-430b-417c-b47e-f9bc340ffdf4","year":2015},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1502.03671","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:35306db747bacb32f0b029e8322ee3ed321a8efd823fced7ce4f0127efffade1","observation_id":"c907f701-2f57-43e2-aea5-024fe507cafd","resolution":{"observed_at":"2026-07-04T19:27:54.738193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.8419","last_updated":"2015-04-11T03:53:26Z","snapshot_observed_at":"2026-07-06T04:04:55.167012Z","submitted_at":"2014-12-29T18:43:10Z","title":"Simple Image Description Generator via a Linear Phrase-Based Approach","version":3},"cited_work":{"arxiv_id":"1412.8419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1412.8419","snapshot_observed_at":"2026-07-04T19:28:08.033637Z","title":"Simple image description generator via a linear phrase- based approach","venue":null,"work_id":"b7fd7441-b641-4080-9b97-fc15874603f2","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1412.8419","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:053fc385154762000fa5f5e820f14f3a0265c43f8f4d3aca349a806409ca392c","observation_id":"de81183b-7de0-4072-bac2-9168a8ed40dd","resolution":{"observed_at":"2026-07-04T19:28:08.033637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1501.02598","last_updated":"2015-03-12T09:47:33Z","snapshot_observed_at":"2026-07-06T04:05:56.379487Z","submitted_at":"2015-01-12T10:48:32Z","title":"Combining Language and Vision with a Multimodal Skip-gram Model","version":3},"cited_work":{"arxiv_id":"1501.02598","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1501.02598","snapshot_observed_at":"2026-07-04T19:22:41.881735Z","title":"Combining language and vision with a multimodal skip-gram model","venue":null,"work_id":"741b7dd4-b69c-4338-b848-464a83a39805","year":2015},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1501.02598","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:3ef65d1f7d837263bab72dfa2b3a6abed01e752ac9a46e0e465bfe0a70137ed2","observation_id":"1d77adc9-3c10-4059-899d-bced179f77a5","resolution":{"observed_at":"2026-07-04T19:22:41.881735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ImageNet classiﬁca- tion with deep convolutional neural networks","venue":null,"work_id":"a5247f2a-0789-401a-9a08-261323f6b29f","year":2012},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:6ba53196bfb822ff2443b57f160ce5c067d8870471dfced12950dccc8d93b625","observation_id":"2f0568ad-78e0-42f0-9f7f-c3896dd6c5d6","resolution":{"observed_at":"2026-05-12T21:38:19.632663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long short-term memory","venue":null,"work_id":"e2e2b73e-d045-4cf9-b72a-1231c28cab2f","year":1997},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:5cdf8d1457f453cc499d21618a726d56324ec4b11a2e733ccb05e49d3a692ab7","observation_id":"428d2919-29c5-437d-a0f9-285d189e2cd5","resolution":{"observed_at":"2026-05-12T21:38:19.636676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- ageNet: A Large-Scale Hierarchical Image Database","venue":null,"work_id":"cff38a69-93b4-416f-81b6-ba490a3de052","year":2009},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:7bc43e1ac609ccbaf8c09e0d43a3c314e524b4feb3a711d240243b42f64bdfa9","observation_id":"33aff716-cbf6-49d1-a04c-c274e441e07a","resolution":{"observed_at":"2026-05-12T21:38:19.641273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The iapr tc- 12 benchmark: A new evaluation resource for visual information systems","venue":null,"work_id":"94c7692e-7384-4317-8d37-1fce7527a48d","year":2006},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:6fa85d8e5f3e66df1653d2634d0867a811c9020bf08575723fcd05801bb8ddfa","observation_id":"4b252d52-dfa3-42a1-92b5-78623237dee2","resolution":{"observed_at":"2026-05-12T21:38:19.645070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im2text: Describing images using 1 million captioned photographs","venue":null,"work_id":"7069d373-f708-457c-8304-34ff4f218916","year":2011},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:6547fee7278b56cf3c32d1eb0ea724f5f858d48006c0e686f4e3dbb7bc54db49","observation_id":"4750ed89-1a4c-4fbe-b071-67072afa8a9f","resolution":{"observed_at":"2026-05-12T21:38:19.649158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":"6004e0fb-4607-4b9c-8fb7-e04fea9edcde","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:184bd5b7b1f054a545dc210e155ad08f428e9734cbcadfaa1e79d9634ffa872f","observation_id":"7653d2c6-a9dd-4254-9bac-275b183e821e","resolution":{"observed_at":"2026-05-12T21:38:19.652571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D ´ej´a image- captions: A corpus of expressive image descriptions in repetition","venue":null,"work_id":"f8f672c4-1ce7-4aa6-89c1-b46b2193316d","year":2015},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:f8b5aad8646bb35d706dd185295761e7d1fd88030387a6116f922376ef652782","observation_id":"277e00be-035a-44ed-96fe-62a9c5efa986","resolution":{"observed_at":"2026-05-12T21:38:19.656751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"7862b35f-8937-4864-8d0a-06505f687259","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:9b25f135c605d82f89f56b76b348e2d260242258f031e48c06a6d53e83c2b8f4","observation_id":"f2aada12-4605-4731-86b1-874c5a757062","resolution":{"observed_at":"2026-05-12T21:38:19.661376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"39429f04-c5f8-4ac5-953a-d427e118f783","year":2002},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:042cac099fe13daa22e5b2e2ab3e613e180242dd50ef57ba7661d8ce414f9a73","observation_id":"5d661a79-cba0-487d-83f6-da0887741bd7","resolution":{"observed_at":"2026-05-12T21:38:19.665127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rouge: A package for automatic evaluation of sum- maries","venue":null,"work_id":"7758ec9c-21a8-4389-93e5-d50b17c4a681","year":2004},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:415181f964e1c5f0b33994a892fd6613dca7bab6220e74b3365e1c9def02743c","observation_id":"9fad988b-6649-4ac1-8c8c-290c1edb26f9","resolution":{"observed_at":"2026-05-12T21:38:19.669743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meteor universal: Language spe- ciﬁc translation evaluation for any target language","venue":null,"work_id":"62aec74c-43ee-463e-92e6-332bafa7db9e","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:cb75dca2e3c30bb0183cd1a73954cebdc6bb95e954328e4f98a0f87a4f91b3cb","observation_id":"7ecf7082-9ca8-453d-9202-242a72b1091b","resolution":{"observed_at":"2026-05-12T21:38:19.674306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-07-31T18:36:17.568080Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":"1411.5726","doi":null,"metadata_source":"pith","pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-07-03T15:38:33.136346Z","title":"CIDEr: Consensus-based Image Description Evaluation","venue":"cs.CV","work_id":"3f118560-22c7-4ecb-bd31-f507d2fa38b7","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:1454fa98e3543c22ae47514a2654e4978054a9882c7cf3895ac199cd2936af1e","observation_id":"23314617-5ffd-4bbe-bf18-80548dae3b04","resolution":{"observed_at":"2026-05-12T21:38:19.553333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Stanford CoreNLP natural language processing toolkit","venue":null,"work_id":"188cb6a2-174d-419a-9486-5186ad8ab646","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:59c59552b1e0e96362cd9ae6f6de84494f7b629b6b88e911c61b0ca51797168b","observation_id":"085283e9-723e-4202-8f9a-9e8580326e13","resolution":{"observed_at":"2026-05-12T21:38:19.677996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wordnet: a lexical database for english","venue":null,"work_id":"9ca2de9d-ca54-46a2-855a-57ff308e4c1c","year":1995},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:81d1b3fd8e35a2d6308cf6b769ba5630ead511de3daf1cdd1f7240c381c1344c","observation_id":"da1ed1de-4fd7-4090-8531-4c881a5bad70","resolution":{"observed_at":"2026-05-12T21:38:19.681870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comparing automatic evaluation mea- sures for image description","venue":null,"work_id":"670fa9f2-12f6-47d5-a24e-6fa0c2620208","year":2014},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:2771da4cfa2a00a50819960f51b205272867882795fded43c8f15ff5a6271006","observation_id":"db021f40-3aea-4ed4-9790-b371a21ff1bc","resolution":{"observed_at":"2026-05-12T21:38:19.685652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-evaluation the role of bleu in machine translation research","venue":null,"work_id":"83b69404-c794-4d59-944b-50a7f115896b","year":2006},"citing_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T21:38:19.467233Z"},"links":{"citing_paper":"/paper/1504.00325"},"observation_digest":"sha256:1bd50d76139d82d63ed4d3035efd727f3e01aa888423c171335ac6daadfda061","observation_id":"2176ac8b-8262-4b6d-a8c0-908ffcd2eb8f","resolution":{"observed_at":"2026-05-12T21:38:19.694427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 100 inbound Pith citation observations for arXiv:1504.00325."}