{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66339feb3d862e3a2fa09e531d548a7af301358654883fcfbc6e6c2bcd38fbef","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:56:03.635888Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.402938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T19:53:25.499901Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2203.03605"},"observation_digest":"sha256:3dbd7e3f2f3d284feef5f92305532e0ebd3c4f34f8d5c5c95a24f526b9e68012","observation_id":"86f17117-d3bc-48a2-91f2-640f9d3e1395","resolution":{"observed_at":"2026-05-12T19:53:25.615542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T11:11:36.847364Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2303.05499"},"observation_digest":"sha256:3f58782971e0630d20cc6f25825a2b3f6ce9491d829a3d9397d5dcb2e97d83ea","observation_id":"6bb2a822-2dd6-4d1f-9f61-118a475adaa1","resolution":{"observed_at":"2026-05-11T11:11:37.002347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T19:47:29.252026Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2308.06571"},"observation_digest":"sha256:f915509850d436c47c3d7437f3f4e6c7fe14170f7bdd7462fc56fe5ee63cddd6","observation_id":"aa0acacf-0303-4e8c-9f62-adc4666fde93","resolution":{"observed_at":"2026-05-12T19:47:29.431343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:caa34e25ed02e965bd5636aa1eada65b7648518a7bb14dea196c5d6bdfa9f4d6","observation_id":"21c500b0-dcb6-4b5b-9e6f-71304dbc628b","resolution":{"observed_at":"2026-05-10T17:54:03.392121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-08-06T17:56:03.635888Z","title":"Grounded Language-Image Pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09562","last_updated":"2025-07-13T10:10:17Z","snapshot_observed_at":"2026-08-08T01:35:34.848920Z","submitted_at":"2025-07-13T10:10:17Z","title":"Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:56:03.635888Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2507.09562"},"observation_digest":"sha256:32eb5bd2e88f3cdbf0340eeefec0ab3d6c452a79c4d66a5534b61822bb5bba6c","observation_id":"88b9d180-4932-4cf0-aa7f-acb343543d6e","resolution":{"observed_at":"2026-08-06T17:56:03.635888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-08-04T13:27:41.049003Z","title":"Grounded language-image pre-training, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.00458","last_updated":"2026-07-02T20:01:06Z","snapshot_observed_at":"2026-08-04T13:27:37.483821Z","submitted_at":"2025-10-01T03:17:56Z","title":"VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:27:41.049003Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2510.00458"},"observation_digest":"sha256:3f4c3b95ecbe088b64fa8eb3d698b9bf907d541e891970e52e7751f229045e06","observation_id":"d4062fe0-24b2-4e5a-b399-703b44b10853","resolution":{"observed_at":"2026-08-04T13:27:41.049003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2604.11042","last_updated":"2026-04-13T06:14:20Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:14:20Z","title":"Improving Layout Representation Learning Across Inconsistently Annotated Datasets via Agentic Harmonization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:28:16.315767Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2604.11042"},"observation_digest":"sha256:5a14c0e7713765a7446a070d0aec71ec4e17764dc7994caf29df8917b311c6cd","observation_id":"82fa369c-e229-4011-b097-3e77bb0bb4dd","resolution":{"observed_at":"2026-05-11T08:50:58.396639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2112.03857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-07-03T14:48:32.402938Z","title":"Grounded language-image pre-training","venue":null,"work_id":"494303c9-754a-4a32-ad24-01c46aa2a202","year":2022},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:b2d1a644fbdb6a2dc297746b9ac8ad9751f97832626e81e0530924c41f976c4e","observation_id":"a3fda91e-4579-49fd-83b4-957e2ab7d4a4","resolution":{"observed_at":"2026-07-03T14:48:32.404466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03857","snapshot_observed_at":"2026-08-06T17:14:44.905839Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04766","last_updated":"2026-08-05T12:33:07Z","snapshot_observed_at":"2026-08-08T03:11:50.896315Z","submitted_at":"2026-08-05T12:33:07Z","title":"FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:44.905839Z"},"links":{"cited_paper":"/paper/2112.03857","citing_paper":"/paper/2608.04766"},"observation_digest":"sha256:913a8dd4db4d5410cec47607fd77b73cbcd540489e7e3ee182b8322fa6a75eda","observation_id":"59b2b48a-f871-464f-a8c8-3b16ce57a593","resolution":{"observed_at":"2026-08-06T17:14:44.905839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.03857/citation-record","integrity":"/paper/2112.03857/integrity","json":"/paper/2112.03857/citation-record.json","paper":"/paper/2112.03857"},"outbound":[],"paper":{"arxiv_id":"2112.03857","last_updated":"2022-06-17T10:32:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:16:15.735863Z","submitted_at":"2021-12-07T17:47:50Z","title":"Grounded Language-Image Pre-training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2112.03857."}