{"as_of":"2026-08-18T17:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b11af9cc265beeba99ae417ac69312f54ce2f2a9af41cecbce37d09d737a285","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:54:41.910373Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:43:42.788616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1675,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T23:59:37.636404Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.03557"},"observation_digest":"sha256:6a75b4f9cfdc1a595c4b786b7ae5b72b7b274a936920a338375e8d0de62bbb46","observation_id":"ff96a687-5a8e-4fbb-971e-7ba9a2fcfec8","resolution":{"observed_at":"2026-05-15T23:59:37.786807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T14:10:16.637749Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic represen- tations for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-16T04:18:15.090014Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.637749Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:185b3584d9c18789b26c4423a7f4104fa79b478f194ff0b3c3108c0de6284ff5","observation_id":"fe831b02-d01a-4554-b47e-7eee89b55662","resolution":{"observed_at":"2026-08-14T14:10:16.637749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T13:30:37.367264Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.367264Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:5a1d2cd375e1aebcbe22aeb56868fc21f69761fe628fe580eb1305f8e9a2e189","observation_id":"22ca41b3-de21-4c32-925f-6933a0f7f51a","resolution":{"observed_at":"2026-08-14T13:30:37.367264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T13:01:13.266000Z","title":"arXiv preprint arXiv:1908.02265","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-17T22:34:43.115205Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.266000Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:e8ef28bf25722407d909d6300190ca54f4c84eec0cc8add0efd3c127464204c5","observation_id":"0ee6b0e0-0cef-45be-b6ad-9436b121f399","resolution":{"observed_at":"2026-08-14T13:01:13.266000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T12:22:25.590947Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-17T10:15:40.814612Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T12:22:25.590947Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.07490"},"observation_digest":"sha256:6d95258ced177b3231f0e551d7b387477e39064ce2a254d8616ece2597c86208","observation_id":"18ccb43a-3cd4-4824-9e2b-eec14122377e","resolution":{"observed_at":"2026-08-14T12:22:25.590947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T11:42:19.107745Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T11:42:19.107745Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.08530"},"observation_digest":"sha256:62d0486b157f51c38c8214e36c5cb079892b27eaa50421ab5549972553a1dc6a","observation_id":"ea78c704-dae8-4dad-b4a5-705cab9935d2","resolution":{"observed_at":"2026-08-14T11:42:19.107745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"2201.10005","last_updated":"2022-01-24T23:36:20Z","snapshot_observed_at":"2026-07-06T12:30:51.934079Z","submitted_at":"2022-01-24T23:36:20Z","title":"Text and Code Embeddings by Contrastive Pre-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T19:24:11.907204Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2201.10005"},"observation_digest":"sha256:fcab6372f8770cce854e331342a7f4b173eb3f9ceecf10194607540318ab1c66","observation_id":"dde256fc-9f6d-475a-9589-44e54120cb74","resolution":{"observed_at":"2026-05-15T19:24:12.008090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-12T18:54:50.223310Z","title":"Vilbert: Pretrain- ing task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.11150","last_updated":"2024-11-17T18:52:06Z","snapshot_observed_at":"2026-08-16T11:06:30.381534Z","submitted_at":"2024-11-17T18:52:06Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T18:54:50.223310Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2411.11150"},"observation_digest":"sha256:6cca62e4b28255f979ebb255eb9afc60b85d407c2905a0b89dfe965dd69b08e6","observation_id":"2afcd137-29e2-48ca-ab18-d7b7ebbb7240","resolution":{"observed_at":"2026-08-12T18:54:50.223310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-12T14:52:57.089001Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14832","last_updated":"2024-11-22T10:10:53Z","snapshot_observed_at":"2026-08-16T12:34:15.820992Z","submitted_at":"2024-11-22T10:10:53Z","title":"VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:52:57.089001Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2411.14832"},"observation_digest":"sha256:9212a5bb37639b1988d9ba843ef7bb9788ec4110b091fa24aa10029b0ece0b84","observation_id":"33a53c64-c86b-403a-a2be-a5762bb1a7d3","resolution":{"observed_at":"2026-08-12T14:52:57.089001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-12T11:31:54.596220Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18162","last_updated":"2024-11-27T09:18:26Z","snapshot_observed_at":"2026-08-18T11:19:22.365461Z","submitted_at":"2024-11-27T09:18:26Z","title":"SentiXRL: An advanced large language Model Framework for Multilingual Fine-Grained Emotion Classification in Complex Text Environment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T11:31:54.596220Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2411.18162"},"observation_digest":"sha256:c5b63baeb51a4ce6463b7dafc17903621bfce9545b86cebd213b21a46305e517","observation_id":"f9d4fabe-2f81-400e-8c38-39e7c695f6e8","resolution":{"observed_at":"2026-08-12T11:31:54.596220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-10T21:42:24.403171Z","title":"Question Category Train Val F1 Score YesNo 6492 828 0.698 Number 1859 259 0.803 Color 1651 179 0.735 Choose 3718 502 0.717 Others 4743 669 0.737 Shape 491 74 0.742 Table","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.04173","last_updated":"2025-01-07T22:53:56Z","snapshot_observed_at":"2026-08-15T18:56:00.231772Z","submitted_at":"2025-01-07T22:53:56Z","title":"Multimodal Multihop Source Retrieval for Web Question Answering","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:24.403171Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2501.04173"},"observation_digest":"sha256:99b5ced8afff54754f585928a535e99559b2fd827d85fd5038d0853ac42759a8","observation_id":"c76cf31f-1383-49d6-8c21-87bd74ed90a1","resolution":{"observed_at":"2026-08-10T21:42:24.403171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-10T21:47:58.978874Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05478","last_updated":"2025-06-17T16:28:39Z","snapshot_observed_at":"2026-08-18T08:47:29.483644Z","submitted_at":"2025-01-07T16:01:25Z","title":"Language and Planning in Robotic Navigation: A Multilingual Evaluation of State-of-the-Art Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:47:58.978874Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2501.05478"},"observation_digest":"sha256:f1859015caa9416cc0ee1c53f8eac8ab9bd1b7a77e0a1cb0d1bef1555732a6bd","observation_id":"d91dae2a-3456-4a2f-ad03-b7eae883678c","resolution":{"observed_at":"2026-08-10T21:47:58.978874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-10T20:51:53.740176Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-15T13:15:51.455914Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.740176Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:5202f6123466a58141b5a292737ae96d62e3a271d4f69751d074aa13d446e5e7","observation_id":"883a7e11-56e0-4ad0-bde5-c29ede8dd36a","resolution":{"observed_at":"2026-08-10T20:51:53.740176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-08T18:10:38.323443Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.05738","last_updated":"2025-02-09T01:47:59Z","snapshot_observed_at":"2026-08-17T12:54:01.375805Z","submitted_at":"2025-02-09T01:47:59Z","title":"Performance Analysis of Traditional VQA Models Under Limited Computational Resources","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:38.323443Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2502.05738"},"observation_digest":"sha256:4842e12ea2e7a92f76307ed10be10740dd439ceb91dbf439862aef13ff065403","observation_id":"5b875199-5513-4653-99ad-c25625dfa6a5","resolution":{"observed_at":"2026-08-08T18:10:38.323443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-08T12:20:08.315864Z","title":"Vilbert: Pretraining task- agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.07855","last_updated":"2025-06-13T12:20:30Z","snapshot_observed_at":"2026-08-13T21:16:14.932934Z","submitted_at":"2025-02-11T14:04:43Z","title":"Vision-Language Models for Edge Networks: A Comprehensive Survey","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:08.315864Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2502.07855"},"observation_digest":"sha256:cb21258c7563abee82f0a856ebbfa2c7fcdd2b60741dfe1ffd675f93c9a24275","observation_id":"87ea1a9c-bf48-4b70-a47a-df80579b30b7","resolution":{"observed_at":"2026-08-08T12:20:08.315864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-16T05:43:42.788616Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representa- tions for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-18T17:26:52.655453Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.788616Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:29674edd5fac019b7afa26b8d86fa705ba33a086e901dabf2d9c827301e88b4f","observation_id":"2f6bb367-4920-4ce2-9860-cea82207a6a0","resolution":{"observed_at":"2026-08-16T05:43:42.788616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-16T04:55:28.198790Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.198790Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:66a5fd413df619d6778ce8af7a4cc01a81ed8bd9f05f75bd507cb062c6b5785c","observation_id":"16d433d1-594f-41b7-90f4-22b6da9fb43c","resolution":{"observed_at":"2026-08-16T04:55:28.198790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-07T14:59:40.942765Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16756","last_updated":"2025-05-22T14:59:30Z","snapshot_observed_at":"2026-08-12T18:33:12.606086Z","submitted_at":"2025-05-22T14:59:30Z","title":"Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:40.942765Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2505.16756"},"observation_digest":"sha256:7fd51fffd2580f357ea45d8a67927b0f9d63db30ff48be5103e868c869c97a2c","observation_id":"18d9656d-e6ea-45f0-9bac-d593c441cf48","resolution":{"observed_at":"2026-08-07T14:59:40.942765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T23:42:13.773647Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks.arXiv preprint arXiv:1908.02265, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-17T01:14:16.847511Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.773647Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:890c76f55ea94980e9db8f9f32c5d68d0bbaa1d3b01ac599f15c52fa5cb030a3","observation_id":"8519c36c-eef2-429e-aa49-9d5a12ae840e","resolution":{"observed_at":"2026-08-06T23:42:13.773647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T21:48:13.121047Z","title":"Vilbert: Pretraining task- agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.23350","last_updated":"2025-06-29T17:54:00Z","snapshot_observed_at":"2026-08-13T16:06:47.202122Z","submitted_at":"2025-06-29T17:54:00Z","title":"On the Resilience of Underwater Semantic Wireless Communications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:48:13.121047Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2506.23350"},"observation_digest":"sha256:78ea56e67b7801e6c2a42ad94302f45d204b6db135b3733ff88bf29709028b26","observation_id":"18a56846-eb1f-4f9e-8a8b-53be205dc05b","resolution":{"observed_at":"2026-08-06T21:48:13.121047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T12:21:22.540405Z","title":"T., Pan, B., Jin, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21871","last_updated":"2025-07-29T14:42:31Z","snapshot_observed_at":"2026-08-17T21:07:27.242954Z","submitted_at":"2025-07-29T14:42:31Z","title":"Representations in vision and language converge in a shared, multidimensional space of perceived similarities","version":1},"reference_index":6241,"source":"pdf_text","source_observed_at":"2026-08-06T12:21:22.540405Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2507.21871"},"observation_digest":"sha256:db29c41e138355b978e88557812f5dcfb61c156e5c540efac3dc8d5c62829c5b","observation_id":"233de5ba-3820-4e13-b61c-6c4c11479083","resolution":{"observed_at":"2026-08-06T12:21:22.540405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-15T17:42:20.512268Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.08644","last_updated":"2025-08-12T05:16:00Z","snapshot_observed_at":"2026-08-17T11:24:21.654138Z","submitted_at":"2025-08-12T05:16:00Z","title":"AME: Aligned Manifold Entropy for Robust Vision-Language Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:20.512268Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2508.08644"},"observation_digest":"sha256:6ecc8423428305b26494a5639ed6c02f22ff05239e272d26980401d5e376deec","observation_id":"691bee43-3208-4384-888e-71ed7341d524","resolution":{"observed_at":"2026-08-15T17:42:20.512268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T10:27:39.329615Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-17T21:04:19.376818Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.329615Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:46d5514f354a327172f0e2347d95ad9084723ce760a00484023f80690d37ed9b","observation_id":"e585f74d-cd12-4a2c-a89d-fea58f28007f","resolution":{"observed_at":"2026-08-06T10:27:39.329615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"2604.07338","last_updated":"2026-04-08T17:53:26Z","snapshot_observed_at":"2026-08-11T12:41:43.815777Z","submitted_at":"2026-04-08T17:53:26Z","title":"Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:25.227568Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2604.07338"},"observation_digest":"sha256:e5df2bfece4cb00b25c1dbb534a3e33057c3c9e226c15da82bbaf64e75fc0225","observation_id":"96d59a51-e9ae-4059-99ad-9723eee7f085","resolution":{"observed_at":"2026-05-11T06:05:55.502242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"2605.24020","last_updated":"2026-05-20T06:11:25Z","snapshot_observed_at":"2026-08-15T04:05:13.774809Z","submitted_at":"2026-05-20T06:11:25Z","title":"Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-30T17:40:33.082748Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2605.24020"},"observation_digest":"sha256:31861be186aafb1fe072772d9e4c01035f4526909437462f86c1c51b4e29264f","observation_id":"09885d11-81f9-41f3-bb38-1cec11183d43","resolution":{"observed_at":"2026-06-30T17:44:57.769037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"2606.11074","last_updated":"2026-06-10T03:48:53Z","snapshot_observed_at":"2026-08-12T08:49:59.183581Z","submitted_at":"2026-06-09T16:34:37Z","title":"Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T13:04:14.886733Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2606.11074"},"observation_digest":"sha256:94eaf60d0568b4d0fd8b1ab6709c0310655f665ca03b96168a3f53aa819d66f5","observation_id":"4dfd39e3-fc51-48b1-9eb4-04611f821c0f","resolution":{"observed_at":"2026-07-03T05:47:41.805103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"2606.26179","last_updated":"2026-06-24T12:35:18Z","snapshot_observed_at":"2026-08-14T22:08:44.324904Z","submitted_at":"2026-06-24T12:35:18Z","title":"KG-TRACE: A Neuro-Symbolic Framework for Mechanistic Grounding in Antimicrobial Resistance Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T01:56:35.760918Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2606.26179"},"observation_digest":"sha256:26598d409f1d1ca17ab113f7b99e0b635de91628af2e6529d4c7f45b33213f11","observation_id":"878188b0-7386-4b73-9b97-e531469b0240","resolution":{"observed_at":"2026-06-26T01:58:54.073345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":"1908.02265","doi":"10.48550/arxiv.1908.02265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ViLBERT : Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":"arXiv (Cornell University)","work_id":"aa70aacc-bf05-4fe4-aee3-f17c4bf0778e","year":2019},"citing_paper":{"arxiv_id":"2606.27886","last_updated":"2026-06-26T09:30:30Z","snapshot_observed_at":"2026-08-13T11:07:23.542498Z","submitted_at":"2026-06-26T09:30:30Z","title":"A Comparison of Fusion Techniques for Multi-Modal Human Activity Recognition on the HARMES Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T04:32:39.678440Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2606.27886"},"observation_digest":"sha256:02683d6cc58f927b60f91e4483224d6d2bbc6e1abf8da0c8735f4dc42dd6c112","observation_id":"e1deed52-e357-4079-9b7e-30134d9c6f08","resolution":{"observed_at":"2026-06-29T04:33:06.216866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.784289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-12T00:26:30.762901Z","title":"doi:10.48550/arXiv.1908.02265 , shorttitle =","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.08132","last_updated":"2026-08-08T13:39:28Z","snapshot_observed_at":"2026-08-16T02:04:31.794910Z","submitted_at":"2026-08-08T13:39:28Z","title":"When Does An Extra View Help? Adapting Single-View 3D Reconstruction with Extra Imagery","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-08-12T00:26:30.762901Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2608.08132"},"observation_digest":"sha256:eaf0fd0d84437c055214caf602761c36ed1909400129fda0c049654ae44477c0","observation_id":"c2c49c0a-a86a-4b2d-82cd-01515858c4fb","resolution":{"observed_at":"2026-08-12T00:26:30.762901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1908.02265/citation-record","integrity":"/paper/1908.02265/integrity","json":"/paper/1908.02265/citation-record.json","paper":"/paper/1908.02265"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.523704Z","title":null,"venue":null,"work_id":"d9d13c4d-87d5-47b5-beeb-e19c253d6735","year":2008},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.715981Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:262a09887d3815816c74bb696f4234b584ec07e6c7a2831502255f59133a52cf","observation_id":"b8fae9c0-6b9c-4390-b0be-a5f30ffae3f0","resolution":{"observed_at":"2026-08-14T14:54:42.527937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.721129Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.721129Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:c76c2faa3ba92626b23d72cae0815af8df03c92de28b69be13aaca7623c81873","observation_id":"1fa016a7-422d-4cba-8bd5-0e8e5ff667e9","resolution":{"observed_at":"2026-08-14T14:54:41.721129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.500853Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"e66f420d-ba8c-4286-ae51-944989f8aca5","year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.725405Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:dad48cbe71f70dc1a70c521e4c1cb4a50050137d073963c3dcadcab8cbd0c62d","observation_id":"405e9517-e5a1-4f83-a976-2fb3e3f4af00","resolution":{"observed_at":"2026-08-14T14:54:42.505305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.487197Z","title":null,"venue":null,"work_id":"4ef3dce7-a22c-48fc-8ade-9669aeb98afe","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.730077Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:11b5fb8170b42a52aebc089474b9e11baad2301563faf5ac254b914cf64ca176","observation_id":"7a95221d-8e15-4709-b46a-7c8810a23519","resolution":{"observed_at":"2026-08-14T14:54:42.491585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T14:54:41.734742Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.734742Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:472f3e38ac8b2b9afc125e67baef2737a11d0461a34fb604f02f2a78d51a1a45","observation_id":"3c67ad70-a369-49f9-99d6-58153b0cd641","resolution":{"observed_at":"2026-08-14T14:54:41.734742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.473054Z","title":"foil it! ﬁnd one mismatch between image and language caption","venue":null,"work_id":"01d8cc79-79ab-43be-9599-5a335be3a026","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.739613Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:303d6f8e1ab98ae8dbd9603e076ad6c9e3e052c7bc64342c939690fdfd3ddea0","observation_id":"e75e8e42-e1ab-4f93-aa03-248e64581f24","resolution":{"observed_at":"2026-08-14T14:54:42.477685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.744340Z","title":"Embodied Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.744340Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:56247ebf7df59b04a2b7b97fe8677c64777dacb5d86328bfe2a172c3861aadfa","observation_id":"27ab7fd0-c77c-4ec6-93ce-0865b1f768ca","resolution":{"observed_at":"2026-08-14T14:54:41.744340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.450062Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"58838516-0755-4d3a-92f4-7c6f3003277b","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.748498Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:633cfc4daf554c13f7b0961a31aacaa2665536bef3451d166db6b897a02223c3","observation_id":"3589cdaf-866d-4745-9e10-7d0d480c7bb9","resolution":{"observed_at":"2026-08-14T14:54:42.455218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.436008Z","title":"Don’t just assume; look and answer: Overcoming priors for visual question answering","venue":null,"work_id":"d927479e-11e4-4244-a5e7-0e7651c8a464","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.752931Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:6a1fca3ff853abe12ff3f4c4642834e3242cf8217f3084099c89e0802fd575bf","observation_id":"d6e2e915-46ed-455d-947e-f9c7b94ce0ff","resolution":{"observed_at":"2026-08-14T14:54:42.440601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08658","last_updated":"2019-09-30T20:10:33Z","snapshot_observed_at":"2026-08-14T17:40:26.960266Z","submitted_at":"2018-12-20T16:04:05Z","title":"nocaps: novel object captioning at scale","version":3},"cited_work":{"arxiv_id":"1812.08658","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.08658","snapshot_observed_at":"2026-08-14T14:54:42.041529Z","title":"nocaps: novel object captioning at scale","venue":"cs.CV","work_id":"454cf8a4-57ab-4aad-90e6-977f2a5e6184","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.757219Z"},"links":{"cited_paper":"/paper/1812.08658","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:96d6f723b4f15d3bc85c80a0b96dc528f8b7ec432db1e4ce7d7a2e79fc5ab706","observation_id":"d98e4f41-c2bc-4011-8377-39a3080dbbd4","resolution":{"observed_at":"2026-08-14T14:54:42.048363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.761689Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.761689Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:b05f873c27bef127c29e5c2f7de095097c486b8ea22bbf3a50573489d8385dbf","observation_id":"6c76b031-dcbe-45a3-a7f7-899775b61797","resolution":{"observed_at":"2026-08-14T14:54:41.761689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T14:54:41.765854Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.765854Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:24b69fce36c2211794a47318febb983655e18f404bbf5686c7ffc6281334c52f","observation_id":"729e08fb-c372-4219-8db9-5453e054af65","resolution":{"observed_at":"2026-08-14T14:54:41.765854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.413163Z","title":"Peters, Mark Neumann, Mohit Iyyer, Matt Gardner, Christopher Clark, Kenton Lee, and Luke Zettlemoyer","venue":null,"work_id":"30b453cf-71f1-4b90-9ee7-bad77e6e558a","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.770843Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:45cbf1fd82bb69dca2a8523d11f215a2825c84bedf6e72c854b9f540747982ad","observation_id":"bede3cb3-c9f0-4199-8aea-471431a0a59e","resolution":{"observed_at":"2026-08-14T14:54:42.417597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.398879Z","title":"Improving language understanding with unsupervised learning","venue":null,"work_id":"6af8b426-2da7-433c-b612-3d076d26042c","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.775087Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:a8cd15bb41be6e0dbf3b35c48c5977819c5d60f480367aecd92c3c0fd9fb416c","observation_id":"c4977e9b-8f1f-483f-8838-3a155826a247","resolution":{"observed_at":"2026-08-14T14:54:42.403348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.779434Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.779434Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:336fc636702edaf0c2ddd4fa9e7911658fbaa3cd563d0eec2e7c6d05b61ba113","observation_id":"fd8d8339-eb10-4cec-a6a3-60aa5660ff73","resolution":{"observed_at":"2026-08-14T14:54:41.779434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-08-14T22:09:05.495219Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-14T14:54:41.783733Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.783733Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:5ce8091f5fe5b592fa341a79da685b0cf986af5483f9e583775b9b6abf1b3018","observation_id":"44c8df1b-c7ff-47d1-ae94-4e94ac6e09fd","resolution":{"observed_at":"2026-08-14T14:54:41.783733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.374274Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":"457d1cf7-a5de-4a28-b1cb-07c0194011b7","year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.788156Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:de47486337300d7f4d3267ab31ba422558e209ea5d1f9cc28687cafc2948655a","observation_id":"4a931e69-6555-4cb6-bef2-a8d7bb5b2719","resolution":{"observed_at":"2026-08-14T14:54:42.379199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.360074Z","title":"URL https://en.wikipedia.org/","venue":null,"work_id":"49d491ce-7981-42cb-b881-0ad657ad21c8","year":2019},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.792364Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:96e178038c735d855da7e0c6a4dd23023fa7475f2807a8334d5ced9d3f5a8410","observation_id":"cc52f0f3-3bb0-4761-8ec2-e57fad484d82","resolution":{"observed_at":"2026-08-14T14:54:42.364622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.345064Z","title":"One billion word benchmark for measuring progress in statistical language modeling","venue":null,"work_id":"c2e8a856-9c53-4f05-bedf-9ec261ef9f75","year":2014},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.796867Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:be0cd59c762f9dc26d207f0ec14d90ea3dc9f9f07f1c34490e8bb77e9e8e83c7","observation_id":"3d237df6-a9d9-4524-b513-dd37c38d4592","resolution":{"observed_at":"2026-08-14T14:54:42.349631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.330702Z","title":"Colorization as a proxy task for visual understanding","venue":null,"work_id":"6ab6e9d3-28d7-474e-99e7-ef26405db5e5","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.801205Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:571be01f8f30c21fa6c63626d164c3f8b7ee987354eddbc0a148b1de5a1a69c0","observation_id":"ea437fef-cd26-4a3b-8feb-dfc3f86daa18","resolution":{"observed_at":"2026-08-14T14:54:42.335581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.316539Z","title":"Shapecodes: self-supervised feature learning by lifting views to viewgrids","venue":null,"work_id":"4cd2224b-8dd4-4440-a397-da0086320563","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.806094Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:85da395bf97229539f83a80e44b75dacc0bb72d55fb6fbcca82cf09ce23ac6b3","observation_id":"18dcce10-bc79-4977-9c3d-3252c8e6af42","resolution":{"observed_at":"2026-08-14T14:54:42.321415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.300612Z","title":"Look, listen and learn","venue":null,"work_id":"78c033e5-ab6a-4d7f-b0f4-a8c6033deeb9","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.810443Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:a03b909e7307beda148eaab97674267ac41af2e5f64ae49915386dac2a5a5dc7","observation_id":"dd8d5424-451d-49a5-b858-18ead5c46d8a","resolution":{"observed_at":"2026-08-14T14:54:42.307014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.285748Z","title":"Learning features by watching objects move","venue":null,"work_id":"6370b139-c85a-4583-af4a-ae1571b57125","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.814544Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:a1991bb9071e23d7a64d3472689698449e4e382e5a21a805ee6783b11a85d94a","observation_id":"7f047bb8-390d-4482-904e-be35fe57c304","resolution":{"observed_at":"2026-08-14T14:54:42.290416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.818952Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.818952Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:90c27b68c8c3b5fed9d58c7707a9f710ea14f7380d43d273b8684b154d22a595","observation_id":"99e38133-ad65-4215-9531-35d2080f0e34","resolution":{"observed_at":"2026-08-14T14:54:41.818952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.822905Z","title":"From recognition to cognition: Visual commonsense reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.822905Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:59bebbe6a252edd604437601b5685cdf6d6e81a02fa6e29fdf57a60aa072e782","observation_id":"5cebbe19-81d2-4467-a158-ebb002609938","resolution":{"observed_at":"2026-08-14T14:54:41.822905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.827134Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.827134Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:440658b1f637f6447219feae1da863b6ec42bb239211487c7dbb7819f035c060","observation_id":"cd8edebe-f4bb-49fe-a9e0-129127aa1104","resolution":{"observed_at":"2026-08-14T14:54:41.827134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.831210Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.831210Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:7e7cf6c2856a191902f40138c71974bb00a9fa499376ee157b0b1f4c356e8726","observation_id":"aecd10d1-5847-46e2-9aa3-ba19f2aa93cd","resolution":{"observed_at":"2026-08-14T14:54:41.831210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-14T14:54:41.835507Z","title":"Google’s neural machine translation system: Bridging the gap between human and machine translation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.835507Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:a044fe56b78b8ccd4e1c9a5622421a4ad896103201302bd9055a15d22a0f42d1","observation_id":"ac8f1a2f-9a10-47d5-bc4a-d0afdfe82cf4","resolution":{"observed_at":"2026-08-14T14:54:41.835507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-08-18T00:42:50.080561Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-14T14:54:41.840774Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.840774Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:65c30196a972391f75a7a426c90e649d24f4c6b7432ffb98316d38b1ca29505a","observation_id":"0e96ad61-628f-4e10-8e03-2e6cf31489c0","resolution":{"observed_at":"2026-08-14T14:54:41.840774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.845410Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.845410Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:7bb11fc07d721e1db1fcfa605011d3668025be31fdd13e0eab4d5c9c3b8c85a6","observation_id":"14aab524-892e-41c8-affd-f3078120b476","resolution":{"observed_at":"2026-08-14T14:54:41.845410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.226127Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"9483e32a-cdb9-4e2c-be8e-f863e4d2a968","year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.849617Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:601fc7af0159d8bdcfe816163b36129b9ce0a7e564bb0a151c7107920a568c82","observation_id":"1fb83a2d-8745-4d42-9ed8-88462481760e","resolution":{"observed_at":"2026-08-14T14:54:42.230555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.212381Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"0a18b3c7-93c3-494d-9ab5-5a4a6e207d28","year":2014},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.853703Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:b51481fb9543944fca7c9ea0926ea77aef4e00fed7a997699c9237b7597deb67","observation_id":"e857b7d4-7934-4897-8e8c-1273306c134b","resolution":{"observed_at":"2026-08-14T14:54:42.216875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.197149Z","title":"Mattnet: Modular attention network for referring expression comprehension","venue":null,"work_id":"4d26a3e5-a9a0-4bdd-bd34-3e7c85589374","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.858106Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:aa628bef048e8deb9cdd7415f7cf4c5f03d8feb57dac284ea0904272c6945f50","observation_id":"7dad33ac-6be7-455a-9c84-8837ddbc74ae","resolution":{"observed_at":"2026-08-14T14:54:42.202206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.182069Z","title":"Mask r-cnn","venue":null,"work_id":"8b94e371-5d9e-4c23-868b-c9250a5776be","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.862141Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:261d7f62ee94f5cdd682291f025b2573c055b702fdfb922500a6666d95a157cc","observation_id":"6a66df2f-075a-4e3c-b7ba-c46c540614d0","resolution":{"observed_at":"2026-08-14T14:54:42.186388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.166836Z","title":"Stacked cross attention for image-text matching","venue":null,"work_id":"eb139ad4-9a5c-42b7-b035-a9fb1e032a12","year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.866210Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:bbb1958bd43306eb36fed66ac0519b7f4545a023642ce2538dd5f072ef6cd696","observation_id":"7e59628b-d5b8-49b3-8cee-a0b6dfe14169","resolution":{"observed_at":"2026-08-14T14:54:42.172389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05252","last_updated":"2019-08-23T19:25:25Z","snapshot_observed_at":"2026-08-15T20:19:06.192027Z","submitted_at":"2018-12-13T03:41:18Z","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05252","snapshot_observed_at":"2026-08-14T14:54:41.870680Z","title":"Dynamic fusion with intra-and inter-modality attention ﬂow for visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.870680Z"},"links":{"cited_paper":"/paper/1812.05252","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:2c423971818c23cb63f5cedfc9570d4addf3b0d2fb362869e4fadca448f303f8","observation_id":"c77166b2-c5d1-4e60-9b1d-7334467c6ed2","resolution":{"observed_at":"2026-08-14T14:54:41.870680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04094","last_updated":"2019-04-09T18:01:28Z","snapshot_observed_at":"2026-08-14T17:17:54.548176Z","submitted_at":"2019-02-11T19:02:27Z","title":"BERT has a Mouth, and It Must Speak: BERT as a Markov Random Field Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04094","snapshot_observed_at":"2026-08-14T14:54:41.875322Z","title":"Bert has a mouth, and it must speak: Bert as a markov random ﬁeld language model","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.875322Z"},"links":{"cited_paper":"/paper/1902.04094","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:d5996de900a13ab4af8e8d0bbf8216897e4daf683d5d1a27203da04f9962fd13","observation_id":"411ea18a-47e1-432f-b2df-a10478bbd2db","resolution":{"observed_at":"2026-08-14T14:54:41.875322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.152318Z","title":"Unsupervised visual representation learning by context prediction","venue":null,"work_id":"5660f009-31ff-4086-8d9c-17787f458477","year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.879689Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:e26ab3575bee9c3c98236c8577d9f50d57c71a06b2900760465dd974540c74ae","observation_id":"a1486f96-6943-4e04-b33e-8eddb4b02df5","resolution":{"observed_at":"2026-08-14T14:54:42.156813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.138360Z","title":"Colorful image colorization","venue":null,"work_id":"f7f6526a-ef8b-458f-a577-b519d2233e8f","year":2016},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.884569Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:d355fdc81fae48beef9f3d96e443e30383a3118ce3bb166521c9a0560d8279cc","observation_id":"71a9d6fa-5b50-4038-8fb8-8bb3039410a6","resolution":{"observed_at":"2026-08-14T14:54:42.142864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.123895Z","title":"Discriminative unsupervised feature learning with exemplar convolutional neural networks","venue":null,"work_id":"15cb0ab8-9e94-4827-99d1-130d7c8f5363","year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.888833Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:e493f6dabf8ec3aaa893b00d7ac21cdba7e08f66e9808d0de5031ab473d379cb","observation_id":"e46e166b-584a-4b27-81d6-e61180a2d4b8","resolution":{"observed_at":"2026-08-14T14:54:42.128503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:41.892878Z","title":"Context encoders: Feature learning by inpainting","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.892878Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:b6df591da33392ed8c03e8dceebe39bc6c4575e911f9ef65dc28f7cfe4fe250a","observation_id":"6be4d9c9-cc7c-43c8-8403-8b064124c98c","resolution":{"observed_at":"2026-08-14T14:54:41.892878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.100849Z","title":"Learning image representations tied to ego-motion","venue":null,"work_id":"59d9cffa-2920-4847-ba92-0fc66edaaf29","year":2015},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.897142Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:0a082120eb17a0e52a62a4be3dff561e6afbe0af4c3aeaf42a26ef1765f52261","observation_id":"0e43164d-2b37-4ba6-9ef9-e83ad7cfeaa0","resolution":{"observed_at":"2026-08-14T14:54:42.105716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.086942Z","title":"Shufﬂe and learn: unsupervised learning using temporal order veriﬁcation","venue":null,"work_id":"d0d7f96f-ddf2-481e-8587-7bca0e8f4cf3","year":2016},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.901553Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:238020ff67a153ab29af809bd082e59aa37f483bd99ca71c15e30a3ecbcf35f4","observation_id":"90800b48-2a7b-473a-ae9a-2bc9413ba1a5","resolution":{"observed_at":"2026-08-14T14:54:42.091551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07291","last_updated":"2019-01-22T13:22:34Z","snapshot_observed_at":"2026-08-14T17:27:41.965844Z","submitted_at":"2019-01-22T13:22:34Z","title":"Cross-lingual Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07291","snapshot_observed_at":"2026-08-14T14:54:41.905995Z","title":"Cross-lingual language model pretraining","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.905995Z"},"links":{"cited_paper":"/paper/1901.07291","citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:a644fb27aedb5a3c25a653a3343242bf599be48dce156820b30cf62f849dbb7f","observation_id":"1418ecdb-7534-4fc7-af88-9bd735f8adba","resolution":{"observed_at":"2026-08-14T14:54:41.905995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:54:42.072750Z","title":"Courville","venue":null,"work_id":"6aaa18b9-4ac0-462b-b237-8d8636d3f56e","year":2017},"citing_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:54:41.910373Z"},"links":{"citing_paper":"/paper/1908.02265"},"observation_digest":"sha256:7b94cf8010d47a187c25ca9c6c944e69165572116af4f21f892769f26e3abb06","observation_id":"bfcc0816-f708-4cf1-88f2-24e2ba26c6a1","resolution":{"observed_at":"2026-08-14T14:54:42.077360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 29 inbound Pith citation observations for arXiv:1908.02265."}