{"as_of":"2026-08-17T15:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b893b0f11bc30d51083819cfa5974d19263b231e631029064171416dcae4183","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:39:57.120440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T02:13:52.177920Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation","version":2},"cited_work":{"arxiv_id":"2102.02779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.02779","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":"ab78dbde-d3df-403e-8fd0-2135d23dc165","year":2021},"citing_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T00:10:48.610351Z"},"links":{"cited_paper":"/paper/2102.02779","citing_paper":"/paper/2301.12597"},"observation_digest":"sha256:85998823d42eeab56ae25647e84c6f2bba51b669beead600835cb76d340023ae","observation_id":"0b755161-29c7-41e2-9d9d-841baa9d06fa","resolution":{"observed_at":"2026-05-12T00:10:49.032939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation","version":2},"cited_work":{"arxiv_id":"2102.02779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.02779","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":"ab78dbde-d3df-403e-8fd0-2135d23dc165","year":2021},"citing_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:13:52.097263Z"},"links":{"cited_paper":"/paper/2102.02779","citing_paper":"/paper/2305.06500"},"observation_digest":"sha256:56a6cc6dd170ee6dbdd37386ff22a0c13c70d04d9edcd1544310c023f563ea81","observation_id":"02a3adda-1471-46e1-b6c2-21b3311a8c23","resolution":{"observed_at":"2026-05-13T02:13:52.181936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02779","snapshot_observed_at":"2026-08-16T12:39:57.120440Z","title":"and Bansal, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12256","last_updated":"2025-04-16T17:07:16Z","snapshot_observed_at":"2026-08-17T00:24:36.591851Z","submitted_at":"2025-04-16T17:07:16Z","title":"FLIP Reasoning Challenge","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:39:57.120440Z"},"links":{"cited_paper":"/paper/2102.02779","citing_paper":"/paper/2504.12256"},"observation_digest":"sha256:4f34bff2a637d70a53622384113664270a620708b4bde6eb12863c8e13fc4538","observation_id":"6b33a499-2173-4ca7-89a1-638fce6d92f6","resolution":{"observed_at":"2026-08-16T12:39:57.120440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02779","snapshot_observed_at":"2026-08-16T12:19:57.017796Z","title":"Unifying Vision -and- Language Tasks via Text Generation , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13049","last_updated":"2025-04-17T16:05:59Z","snapshot_observed_at":"2026-08-17T00:23:47.255505Z","submitted_at":"2025-04-17T16:05:59Z","title":"Multi-modal single-cell foundation models via dynamic token adaptation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:57.017796Z"},"links":{"cited_paper":"/paper/2102.02779","citing_paper":"/paper/2504.13049"},"observation_digest":"sha256:5b69edcbabac50de57f7f2483d55c6820ac19b5809610468ffdb603ac24b07a8","observation_id":"5824ec6d-c163-485b-85a7-6c84408a0665","resolution":{"observed_at":"2026-08-16T12:19:57.017796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02779","snapshot_observed_at":"2026-08-15T19:58:00.486496Z","title":"Unifying vision-and-language tasks via text genera- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14096","last_updated":"2025-09-05T22:03:39Z","snapshot_observed_at":"2026-08-17T00:24:39.245252Z","submitted_at":"2025-06-17T01:20:50Z","title":"Image Segmentation with Large Language Models: A Survey with Perspectives for Intelligent Transportation Systems","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:00.486496Z"},"links":{"cited_paper":"/paper/2102.02779","citing_paper":"/paper/2506.14096"},"observation_digest":"sha256:9189e4e6cef9ab93c0f8a6956213457f2d8fead95ab426b7fb253ee24ff1bea6","observation_id":"4701650d-827b-4e98-8b9d-2bb1acff2070","resolution":{"observed_at":"2026-08-15T19:58:00.486496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation","version":2},"cited_work":{"arxiv_id":"2102.02779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.02779","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":"ab78dbde-d3df-403e-8fd0-2135d23dc165","year":2021},"citing_paper":{"arxiv_id":"2604.14779","last_updated":"2026-04-16T08:39:02Z","snapshot_observed_at":"2026-08-12T23:31:08.348262Z","submitted_at":"2026-04-16T08:39:02Z","title":"AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:52.705187Z"},"links":{"cited_paper":"/paper/2102.02779","citing_paper":"/paper/2604.14779"},"observation_digest":"sha256:da799b24c0524729d0f7ab0efb0fc9c3d5189b005854d905b71d316ad8f614d5","observation_id":"95752b53-1ad2-42a0-bedd-60e424aee94d","resolution":{"observed_at":"2026-05-10T11:15:10.224300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2102.02779/citation-record","integrity":"/paper/2102.02779/integrity","json":"/paper/2102.02779/citation-record.json","paper":"/paper/2102.02779"},"outbound":[],"paper":{"arxiv_id":"2102.02779","last_updated":"2021-05-23T23:12:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T00:24:12.793055Z","submitted_at":"2021-02-04T17:59:30Z","title":"Unifying Vision-and-Language Tasks via Text Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2102.02779."}