{"as_of":"2026-08-20T07:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84d99be1468165d29b28b5b66c81177fe7ee05a6cced2066b5594b70a7cd0702","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:17:57.383936Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:56:35.167882Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:146131ecb319fd69fcaffbabd07d124dd766ea91e7888e99183927dbb21d9fd3","observation_id":"197ddb6a-225a-41f0-a0b0-87643d848315","resolution":{"observed_at":"2026-05-10T14:46:36.300773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:3a77862b20e9f3323221deb1c734b2581f8a5ec783127411d229acfd056471d3","observation_id":"0123981b-f859-4870-8551-d2729f5609ca","resolution":{"observed_at":"2026-05-11T13:10:21.162525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:3d00437be2863efe65b1fb29615c98fdb041dd9249c89f9f0b807a260f839cc6","observation_id":"c9085aad-b652-4417-917f-ead2dd30e829","resolution":{"observed_at":"2026-05-15T01:55:12.585432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-12T18:51:16.340460Z","title":"Pali-3 vision language models: Smaller, faster, stronger.arXiv preprint arXiv:2310.09199, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13587","last_updated":"2025-08-01T03:41:06Z","snapshot_observed_at":"2026-08-17T20:09:13.857157Z","submitted_at":"2024-11-18T01:52:20Z","title":"Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:16.340460Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2411.13587"},"observation_digest":"sha256:eb7c22940eb4aafc15acd2c3d1d6dbd0dab73c77b92512c2a506fb2ffe997ef6","observation_id":"4fba7893-3477-4fa5-9ad8-fb06bb1015ce","resolution":{"observed_at":"2026-08-12T18:51:16.340460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:07.523565Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.03555"},"observation_digest":"sha256:38a069ac5621fc54a70881298ffbe21b5ecbd63560b274d36ca5477b84ea899d","observation_id":"02ae1770-1abe-4fc2-8916-527203cf8e6e","resolution":{"observed_at":"2026-05-15T09:15:07.620366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T19:26:41.737682Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06779","last_updated":"2025-03-27T02:34:48Z","snapshot_observed_at":"2026-08-17T11:43:21.094796Z","submitted_at":"2024-12-09T18:58:43Z","title":"AnyBimanual: Transferring Unimanual Policy for General Bimanual Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:26:41.737682Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.06779"},"observation_digest":"sha256:2072d0c8cc851e0823d70d323b39749d95f6af88444b5e2b94672ca3de60b912","observation_id":"4dfe4c90-b52b-453b-8d31-5c68720cd02e","resolution":{"observed_at":"2026-08-11T19:26:41.737682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T20:27:18.498337Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.498337Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:7c3c7a37ed18447cac0829efdacb2318230f75a2a04a1ba9e413fdbf434bd72b","observation_id":"36c54bed-25d8-4b12-8d24-137be9caaf0a","resolution":{"observed_at":"2026-08-11T20:27:18.498337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T17:42:14.716518Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-17T16:42:43.980152Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.716518Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:41df98086b204a43446d8bfb4a22a40d09eae4b376feb4520fb75c7ef86ad65d","observation_id":"0db02ade-4d5c-4fc9-80c0-dd8a8cc24eb9","resolution":{"observed_at":"2026-08-11T17:42:14.716518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T16:58:28.603722Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09582","last_updated":"2025-01-18T00:52:42Z","snapshot_observed_at":"2026-08-17T06:39:08.796450Z","submitted_at":"2024-12-12T18:54:48Z","title":"Neptune: The Long Orbit to Benchmarking Long Video Understanding","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:58:28.603722Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.09582"},"observation_digest":"sha256:71dc65a6609ff5d94350741a3081fe2f2fc8d7afbc541447625c8593a02a4ad0","observation_id":"00211690-4b76-43c9-af30-58d775ede52b","resolution":{"observed_at":"2026-08-11T16:58:28.603722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-12T18:17:40.083518Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:0b9b6013c61c65031c35aedcd1e6250294e736850128972d0c5b808e7bd4b4a6","observation_id":"77c68856-9872-4508-9a4a-6ba6bc4232ca","resolution":{"observed_at":"2026-05-15T18:27:22.842553Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T16:51:15.076893Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10471","last_updated":"2025-03-10T03:35:16Z","snapshot_observed_at":"2026-08-17T17:41:07.728217Z","submitted_at":"2024-12-12T23:39:54Z","title":"VCA: Video Curious Agent for Long Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:51:15.076893Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.10471"},"observation_digest":"sha256:7612aa9cc3cd0c6ce0f2ddb6595157b704a840d15f1c2b7d373e1cc0da2a93d9","observation_id":"ef648ba7-9177-4563-a7ce-4c4bc552e631","resolution":{"observed_at":"2026-08-11T16:51:15.076893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T04:51:41.479694Z","title":"Pali-3 vision language models: Smaller, faster, stronger,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-14T22:34:52.804170Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.479694Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:5c77e7ed3140a3af1a7ec75058402913da8554014479ca8a250a96f9b866d27f","observation_id":"41fc879e-a193-4ee4-a796-5aae5b8012bf","resolution":{"observed_at":"2026-08-11T04:51:41.479694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-10T18:04:34.948642Z","title":"PaLI-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.948642Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:aa876a8896ca08cb23f461a58d4d17ba15f3df920aa1409421a61764da17f9ba","observation_id":"9cf15b16-9dd9-4d6f-b357-9ebd2a45c8fd","resolution":{"observed_at":"2026-08-10T18:04:34.948642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-10T13:12:46.368082Z","title":"Pali-3 vision language models: Smaller, faster, stronger,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16458","last_updated":"2025-06-16T09:20:38Z","snapshot_observed_at":"2026-08-15T07:02:37.125865Z","submitted_at":"2025-01-27T19:37:18Z","title":"BiFold: Bimanual Cloth Folding with Language Guidance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T13:12:46.368082Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2501.16458"},"observation_digest":"sha256:2d7a96eedf923ae520b1e4a958b35d638fc9b8da45497e2ac1a526ff08356bed","observation_id":"1fd1c37b-bf4b-4494-80a9-446b801a26ed","resolution":{"observed_at":"2026-08-10T13:12:46.368082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T14:10:55.182071Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-16T11:04:22.814192Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.182071Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:380572e7151686153c1c61f6d9e7e94a9f8dbc0b800e8937fe0cdb0566fe413d","observation_id":"62146370-3bbb-4834-85ed-c1be60865c89","resolution":{"observed_at":"2026-08-08T14:10:55.182071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T12:12:30.662861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-08-17T13:43:29.791103Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:12:30.662861Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.07617"},"observation_digest":"sha256:ad1350eec900fa41552e9f4dbfbf4ffa98e4883a4191d49745dfd6a44cec34a1","observation_id":"1cb02f62-f99a-4e2e-9ece-1e73d1980bd6","resolution":{"observed_at":"2026-08-08T12:12:30.662861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T05:54:15.853944Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-18T03:47:13.063220Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.853944Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1aa1153e88cda65b45a144baf66a047e6aa97bb39e00034164e9268f255fa9b4","observation_id":"1369fc8e-ca41-41cd-ab5d-3da27cc877e4","resolution":{"observed_at":"2026-08-08T05:54:15.853944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:0a820d761e8c7e66ea1a1581abf427952d96257c69b88339501f6e3931fa939f","observation_id":"e559251c-59cf-49e4-a982-993066342d07","resolution":{"observed_at":"2026-05-16T05:21:45.212918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-16T12:17:57.383936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13069","last_updated":"2025-04-17T16:31:05Z","snapshot_observed_at":"2026-08-19T05:34:11.674325Z","submitted_at":"2025-04-17T16:31:05Z","title":"Early Accessibility: Automating Alt-Text Generation for UI Icons During App Development","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:57.383936Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2504.13069"},"observation_digest":"sha256:adcd04acf02b3800bc5a843fe60c045ee21e2a45ce1cdb29b3a3d6ffb869c26a","observation_id":"ca28d16d-5870-4756-92d0-de895c98bbbc","resolution":{"observed_at":"2026-08-16T12:17:57.383936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2505.16025","last_updated":"2026-05-09T03:22:30Z","snapshot_observed_at":"2026-08-15T02:18:43.712438Z","submitted_at":"2025-05-21T21:13:19Z","title":"Context and Pixel Aware Large Language Model for Video Quality Assessment","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T13:20:59.840347Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2505.16025"},"observation_digest":"sha256:5830fa7326c295ecd9dfbe6fde71d70ec64973db5b615738d444b113c944f4b6","observation_id":"21c85dcd-64af-4bee-9355-dd6fd3ba3694","resolution":{"observed_at":"2026-05-22T13:21:35.454864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-07T12:38:39.786935Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24139","last_updated":"2025-06-03T17:03:22Z","snapshot_observed_at":"2026-08-16T05:10:04.192057Z","submitted_at":"2025-05-30T02:20:14Z","title":"S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.786935Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2505.24139"},"observation_digest":"sha256:e3f2f25cdb314a9689a4d2ebf821fb0435dd721bbaba0b70fbfd384aec13d18e","observation_id":"7ef6ce2e-1f01-4d44-aac5-6835a73a4daa","resolution":{"observed_at":"2026-08-07T12:38:39.786935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-07T12:11:51.104029Z","title":"Pali-3 vision language models: Smaller, faster, stronger.arXiv preprint arXiv:2310.09199, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-17T18:31:50.392129Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.104029Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:091b8f7c24fe1f9e657cdcf703a3e1edc91a641c412a79fda1f5c948fdb33144","observation_id":"e027e3ac-455f-4719-bcb7-ec0c4b1b4b45","resolution":{"observed_at":"2026-08-07T12:11:51.104029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-18T04:25:30.115862Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:85fadca0182d785f6ea571933b7eeb01614e2f324a8a02296561b0b24fe59e98","observation_id":"f73bcae5-be14-4df6-9a04-4a9e7ad0463b","resolution":{"observed_at":"2026-05-11T21:22:37.260193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-06T23:21:06.067923Z","title":"Pali-3 vision language models: Smaller, faster, stronger,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":290,"source":"pdf_text","source_observed_at":"2026-08-06T23:21:06.067923Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:c36c263d1db0f2a46c7db8ef16c5ef9d2d4d39c97180742fa88aec55167f85c4","observation_id":"62903617-4d48-4494-b541-78cd6317ea22","resolution":{"observed_at":"2026-08-06T23:21:06.067923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-15T18:59:54.338478Z","title":"PaLI-3: Vision Language Models—Smaller, Faster, Stronger,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18943","last_updated":"2025-06-22T23:48:02Z","snapshot_observed_at":"2026-08-20T02:06:37.955147Z","submitted_at":"2025-06-22T23:48:02Z","title":"From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:59:54.338478Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2506.18943"},"observation_digest":"sha256:99a5893cf261102111f49b4910a4b79444a0746d6fc930158d0f02ed4ddd4761","observation_id":"579e83de-05a9-4ea4-bd85-97c9bf19cca7","resolution":{"observed_at":"2026-08-15T18:59:54.338478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-06T19:25:02.592591Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-20T04:52:51.041978Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.592591Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ea024d6c6a78f2003f3e9362008000e2ced8cff86132b20090a4888d16be2725","observation_id":"946f5be3-94c9-4f85-bc6b-7c95eeeabba7","resolution":{"observed_at":"2026-08-06T19:25:02.592591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-18T11:53:44.017837Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:19a32a89091765532833c5ec88958a5448974af48c67ab5c20065bfa7b796843","observation_id":"e906fc2b-413a-4ce2-bdcc-f17a0a8e76e9","resolution":{"observed_at":"2026-05-17T06:29:09.886292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2601.09512","last_updated":"2026-05-15T10:27:07Z","snapshot_observed_at":"2026-08-15T10:34:25.819072Z","submitted_at":"2026-01-14T14:23:42Z","title":"CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T15:53:44.767068Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2601.09512"},"observation_digest":"sha256:ad35a1809b20a74935dcc32a796200e9263b869602ea29eb5665cc3c3be0cc12","observation_id":"15147e5a-4388-4fdd-916c-7690b0fc2495","resolution":{"observed_at":"2026-05-21T15:54:14.512459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2604.10064","last_updated":"2026-04-11T07:06:33Z","snapshot_observed_at":"2026-08-02T07:52:32.788608Z","submitted_at":"2026-04-11T07:06:33Z","title":"On The Application of Linear Attention in Multimodal Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:49.695614Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2604.10064"},"observation_digest":"sha256:455f0eb7d2fc6b2a115e80f945faa9ce730a596c64faea1a678383775083b98a","observation_id":"01a365a8-5847-4109-a518-e62a857f273d","resolution":{"observed_at":"2026-05-11T07:20:59.530104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2604.15451","last_updated":"2026-04-21T21:08:15Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T18:10:18Z","title":"Weak-to-Strong Knowledge Distillation Accelerates Visual Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:31.161933Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2604.15451"},"observation_digest":"sha256:ab7c084d44994a23e915af2f0404a03b6e5efa5a48ea431097cd38cb0d799181","observation_id":"9805146f-5aef-47fd-b028-9beb53e77963","resolution":{"observed_at":"2026-05-10T11:15:10.317380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2605.10485","last_updated":"2026-05-11T12:44:26Z","snapshot_observed_at":"2026-08-14T14:42:59.902025Z","submitted_at":"2026-05-11T12:44:26Z","title":"VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T05:09:21.028373Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2605.10485"},"observation_digest":"sha256:90cc0751b72133c70b0cc616c04f7ceb1eba8efcfe76cefcb538debe5640ebe2","observation_id":"52b97257-e3af-4ce2-b985-68a1af823548","resolution":{"observed_at":"2026-05-12T05:36:24.871267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2605.21854","last_updated":"2026-06-06T09:58:33Z","snapshot_observed_at":"2026-08-18T16:44:55.901574Z","submitted_at":"2026-05-21T01:02:41Z","title":"CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T08:07:51.697353Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2605.21854"},"observation_digest":"sha256:c2c13845cb3bea919485a958257ec8b75c4487eecc6c7d297c64e67e6b1b6be9","observation_id":"88cbd8bc-e83e-4754-a297-3b68df6a8f80","resolution":{"observed_at":"2026-05-22T08:11:17.230558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2605.21854","last_updated":"2026-06-06T09:58:33Z","snapshot_observed_at":"2026-08-18T16:44:55.901574Z","submitted_at":"2026-05-21T01:02:41Z","title":"CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T17:48:02.228941Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2605.21854"},"observation_digest":"sha256:a215e24bf9a0329b5790a08f5931531d3f224db509af951bcb72111b8149fd9b","observation_id":"cd14ee36-d963-4581-8dd7-b9403db91f00","resolution":{"observed_at":"2026-07-01T15:05:48.000288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:22d4b719005b1434c80e56ec3b96bb49bdfca038249efae4a4a461ba8706fce5","observation_id":"36590b86-5a2b-4ea6-abae-3dbb20de2961","resolution":{"observed_at":"2026-06-29T08:23:15.899095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-08-14T19:14:38.844525Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6d679211a4eb8a138a9e61ab3b3a6d48db571648f4cc859a1dfea4b2ca2c0a94","observation_id":"b69f6fe3-46b2-4bf2-9025-187b05735030","resolution":{"observed_at":"2026-06-28T19:32:35.244445Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2606.20641","last_updated":"2026-06-02T16:07:28Z","snapshot_observed_at":"2026-08-15T08:39:43.756737Z","submitted_at":"2026-06-02T16:07:28Z","title":"MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:56.712360Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2606.20641"},"observation_digest":"sha256:f3af53aa5aa76e872904462cf42c89989d7805e4bd32dc2a4f86b513aab8edc1","observation_id":"db1537cb-77a4-478e-851c-ae1c3c7dcd5e","resolution":{"observed_at":"2026-07-02T03:56:35.169406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.09199/citation-record","integrity":"/paper/2310.09199/integrity","json":"/paper/2310.09199/citation-record.json","paper":"/paper/2310.09199"},"outbound":[],"paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2310.09199."}