{"as_of":"2026-08-07T21:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a20cfeda932aa8361f6974cd701e9a3e119368da59e70814e45d8f889c62b3cf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:41.630304Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.509967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:b819e2671e463ff1923436eecca50ed5be8fbf0ab6ce6cd4b29624535378f771","observation_id":"b2bc0035-cad0-45d2-9898-aa2b889484f4","resolution":{"observed_at":"2026-05-16T09:29:06.060099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T05:19:47.907355Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2306.14824"},"observation_digest":"sha256:482fc19ddd309ad35f89c447fa163983c4bb57f28bff766fa0a9418a44fe6163","observation_id":"f64e0af2-a489-4db7-8691-5181f8745e60","resolution":{"observed_at":"2026-05-12T05:19:47.994723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:31.928650Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2310.01415"},"observation_digest":"sha256:0ffff48daf5e5fd494f8372cbb060a4438e05014a8132aebdc3ae9cb022bb774","observation_id":"8983684b-913a-40e2-a290-e8fafe5acfde","resolution":{"observed_at":"2026-05-15T15:05:32.021160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T10:09:46.447508Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2401.10935"},"observation_digest":"sha256:7de247364ab1b4d48af1d9e09b0aa741e6393347a401212a96d2a0eae08dc217","observation_id":"b5e2380d-d81a-4911-813b-a6c92648deb8","resolution":{"observed_at":"2026-05-17T10:09:46.513448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T06:20:15.656356Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2401.14159"},"observation_digest":"sha256:d98f29ac94cc6428a066e93906ef5e0a01718a34599fce590f9e744d7a58f907","observation_id":"dd8a690e-70a4-437f-85bd-de50ae779a77","resolution":{"observed_at":"2026-05-11T06:20:16.170336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T16:12:25.980853Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2409.12514"},"observation_digest":"sha256:337cb81a690210aaf6ad6fd36aee79602429b9af9cd6df6778dd8cac2e33ff5e","observation_id":"7b6af6b5-3c5b-452f-bc2f-01a6769cbc49","resolution":{"observed_at":"2026-05-17T16:12:26.047201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T14:25:41.630304Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.630304Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:097564978e1927dc6e3cedfb0597ffa662fe8dca0f5012044b27894b50a44ea3","observation_id":"7695381b-dbd6-445b-acb7-586bd352201e","resolution":{"observed_at":"2026-08-07T14:25:41.630304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T10:55:14.624177Z","title":"Pix2seq: A language modeling framework for object detection.arXiv preprint arXiv:2109.10852, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.624177Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:f1f3651703f38267e1f09c0f62c3a4ab7b193276a33bc3f8146e44fc87150d34","observation_id":"f4ebd5fc-10b3-48ac-9858-681f8a890aab","resolution":{"observed_at":"2026-08-07T10:55:14.624177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T23:42:22.232547Z","title":"”Pix2seq: A language modeling framework for object detection.” arXiv preprint arXiv:2109.10852 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16856","last_updated":"2025-06-20T09:14:09Z","snapshot_observed_at":"2026-08-07T09:31:28.762013Z","submitted_at":"2025-06-20T09:14:09Z","title":"ParkFormer: A Transformer-Based Parking Policy with Goal Embedding and Pedestrian-Aware Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:22.232547Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2506.16856"},"observation_digest":"sha256:ff9a565cfff6d2852c4ce27ff6afb63c21c02dff092898917f4eeb63b53f2fb5","observation_id":"1ed01301-9445-4456-81db-66c82418bb95","resolution":{"observed_at":"2026-08-06T23:42:22.232547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T23:13:27.661151Z","title":"Pix2seq: A language modeling framework for object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19278","last_updated":"2025-06-24T03:17:18Z","snapshot_observed_at":"2026-08-06T23:04:50.584749Z","submitted_at":"2025-06-24T03:17:18Z","title":"Style Transfer: A Decade Survey","version":1},"reference_index":259,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:27.661151Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2506.19278"},"observation_digest":"sha256:f487f6746333af67a4e2f60ee509be27417a8a590cc1162931c8cbc0a617a1b2","observation_id":"e6316a38-2a01-46b3-ba27-c207979b9568","resolution":{"observed_at":"2026-08-06T23:13:27.661151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T19:43:44.541549Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04822","last_updated":"2025-07-07T09:42:37Z","snapshot_observed_at":"2026-08-06T19:36:13.331026Z","submitted_at":"2025-07-07T09:42:37Z","title":"SeqGrowGraph: Learning Lane Topology as a Chain of Graph Expansions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.541549Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2507.04822"},"observation_digest":"sha256:9ab7a900d4f2cd405b83dd4f0fd6a40afadaf1ec8fd9e1a96448a4e13bc99b49","observation_id":"38abb5b1-7265-4560-99b6-0bb37bca9d5c","resolution":{"observed_at":"2026-08-06T19:43:44.541549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T19:40:15.056216Z","title":"arXiv preprint arXiv:2109.10852 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04978","last_updated":"2025-07-07T13:22:35Z","snapshot_observed_at":"2026-08-06T19:32:19.774485Z","submitted_at":"2025-07-07T13:22:35Z","title":"Parameterized Diffusion Optimization enabled Autoregressive Ordinal Regression for Diabetic Retinopathy Grading","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:15.056216Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2507.04978"},"observation_digest":"sha256:2d70e21a83b605b60b41719d8013af3df81d756770b246705f13a9ca22f0638f","observation_id":"ae263cd5-40e8-4095-b55b-521668b566e7","resolution":{"observed_at":"2026-08-06T19:40:15.056216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T15:33:28.819122Z","title":"Multilingual code generation with knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00013","last_updated":"2025-07-21T11:33:57Z","snapshot_observed_at":"2026-08-06T15:27:46.136316Z","submitted_at":"2025-07-21T11:33:57Z","title":"From Provable Correctness to Probabilistic Generation: A Comparative Review of Program Synthesis Paradigms","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:28.819122Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2508.00013"},"observation_digest":"sha256:5e822505a94ebfef3f9c3775b3fffb25fcf812f7990c352b1505100e74123f6c","observation_id":"e938ce05-d126-40cc-b325-8a904404d84e","resolution":{"observed_at":"2026-08-06T15:33:28.819122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-05T13:58:05.084880Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21824","last_updated":"2025-08-29T17:59:53Z","snapshot_observed_at":"2026-08-05T13:58:03.024516Z","submitted_at":"2025-08-29T17:59:53Z","title":"DriveQA: Passing the Driving Knowledge Test","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:58:05.084880Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2508.21824"},"observation_digest":"sha256:837b039874454d8d34b6baeff6e53cd80f4ec3ba4c76e514f72fe74bb664028d","observation_id":"6e42424b-8660-4faa-8e99-a0a2f5d10226","resolution":{"observed_at":"2026-08-05T13:58:05.084880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2510.18822","last_updated":"2026-05-18T02:07:26Z","snapshot_observed_at":"2026-08-03T04:29:55.338053Z","submitted_at":"2025-10-21T17:20:15Z","title":"SAM 2++: Tracking Anything at Any Granularity","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:56.047515Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2510.18822"},"observation_digest":"sha256:c6fb1a9ad9ce4ceca8686dad90ace4ac3689eaee42723074b91991b499982e79","observation_id":"ba5068a3-5aaf-420b-90f0-38c5ea1dae20","resolution":{"observed_at":"2026-05-21T19:54:20.148463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2602.09016","last_updated":"2026-05-11T03:15:33Z","snapshot_observed_at":"2026-07-06T22:45:11.110274Z","submitted_at":"2026-02-09T18:58:46Z","title":"Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:19:11.066723Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2602.09016"},"observation_digest":"sha256:4aa1bb58c1d0247d980f5fe6536c9bff8b27b260ff819b720c51050a2a58110c","observation_id":"15121c37-d0da-49a1-beba-ad9b4eb35cab","resolution":{"observed_at":"2026-05-16T05:20:39.247034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2604.02593","last_updated":"2026-04-03T00:09:14Z","snapshot_observed_at":"2026-08-05T18:03:52.271482Z","submitted_at":"2026-04-03T00:09:14Z","title":"Moondream Segmentation: From Words to Masks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:14:45.629804Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2604.02593"},"observation_digest":"sha256:4ff1596211109851fed97dd63fe44bceb9b778d6c7f5bbfd2392b3622b51b5e5","observation_id":"b24b4937-78e6-4a7f-b973-f6ea9009dc61","resolution":{"observed_at":"2026-05-13T20:18:13.726512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2604.08921","last_updated":"2026-04-10T03:33:51Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:33:51Z","title":"TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:37:44.436873Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2604.08921"},"observation_digest":"sha256:8509a1555aa0a508bf165e18f6da8a6eb862265237763f46a1816b42bbe7c6de","observation_id":"d457d7e0-47e5-4d30-917a-fbac837d9dfd","resolution":{"observed_at":"2026-05-11T06:30:58.362347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2605.14923","last_updated":"2026-05-14T14:58:46Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T14:58:46Z","title":"SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T20:51:56.131205Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2605.14923"},"observation_digest":"sha256:0dc419fffd5b9566949f1f4b34df2b564cfe2ae271780bf0afbe55ad93605f64","observation_id":"8caedca2-b4bf-4222-b853-4cf29b8abe56","resolution":{"observed_at":"2026-06-30T20:55:04.158931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2605.25427","last_updated":"2026-05-25T04:58:23Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T04:58:23Z","title":"Binding Visual Features Point by Point","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:44.793896Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2605.25427"},"observation_digest":"sha256:f37e0f367154f1604126de85972e6b517a0cf6782c9fc14795cdd1f5dd9ee5ea","observation_id":"0f3ea96d-766d-4ff2-b6fe-5f803b2ac123","resolution":{"observed_at":"2026-06-29T23:44:03.328300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:5bbf7707302e2aed7bb4c387706bd6c6bf6c3b06f3ff56bedb3ecda7c74f8484","observation_id":"69a5ac09-a4ce-4260-8892-aa5fe563d0e6","resolution":{"observed_at":"2026-06-29T08:23:15.904809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.08420","last_updated":"2026-06-25T03:34:20Z","snapshot_observed_at":"2026-07-06T23:47:57.376596Z","submitted_at":"2026-06-07T02:41:05Z","title":"CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T19:01:14.023587Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.08420"},"observation_digest":"sha256:4db5f0151dde383a9f7a6b6add6412535717736286de71abcd1a7b040e5ed14e","observation_id":"7acf2eb3-5cee-41dc-bae7-1311d46255e9","resolution":{"observed_at":"2026-07-02T22:17:26.311197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-26T00:35:32.041041Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:33b2af9bcd276290cccc3d15c4c5face599534ba671b8a370020ebe98e4d40fd","observation_id":"1459c1ca-0239-47d2-8ea5-58544990856c","resolution":{"observed_at":"2026-07-04T16:29:57.511404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-01T06:52:18.115419Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:d20b010ad975aba911913d06aa682988c89cf8e3059974ae62b3ca721628ead3","observation_id":"ce44e7aa-d473-4b4c-950b-afbec0d58511","resolution":{"observed_at":"2026-07-01T06:55:29.063968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-02T21:15:38.699918Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:3ac87e6160e357c936892367d2cc2df6cf29efa8acfeab13620a814c502a2f14","observation_id":"679ce7b8-e97c-4fbd-999e-cd951a478da2","resolution":{"observed_at":"2026-07-02T21:17:23.693746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":5},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-03T22:54:21.356538Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:8688e2610f45c6f1e03243a29387c6831dcd5b56ad8548f5a6d58e72e6fc4d2d","observation_id":"417e40cd-1d1d-48b8-8569-3011bd7c57b8","resolution":{"observed_at":"2026-07-03T22:59:02.648707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2607.02083","last_updated":"2026-07-02T12:25:45Z","snapshot_observed_at":"2026-08-01T16:38:47.544758Z","submitted_at":"2026-07-02T12:25:45Z","title":"DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T15:49:17.217482Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2607.02083"},"observation_digest":"sha256:74ed4e40df1423fc0adca2fe26937cb501bf029a8b94fa77e6f5089c15c9522d","observation_id":"694233de-d16d-4ad9-bde4-cfad591daac5","resolution":{"observed_at":"2026-07-03T15:58:37.580647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-05T10:23:59.183387Z","title":"arXiv preprint arXiv:2109.10852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03890","last_updated":"2026-08-04T16:23:39Z","snapshot_observed_at":"2026-08-07T21:13:51.375897Z","submitted_at":"2026-08-04T16:23:39Z","title":"CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-08-05T10:23:59.183387Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2608.03890"},"observation_digest":"sha256:9f11637e31bd0a10d283488f132b826531f398b313fcf7011ea1cf2722a33c3c","observation_id":"07a0372d-df47-44a6-ba5e-1cc3835d7c86","resolution":{"observed_at":"2026-08-05T10:23:59.183387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2109.10852/citation-record","integrity":"/paper/2109.10852/integrity","json":"/paper/2109.10852/citation-record.json","paper":"/paper/2109.10852"},"outbound":[],"paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2109.10852."}