{"as_of":"2026-08-08T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13b6d3b8738677042189f3689a91ef3dec5f9de6a839a05a20db4ecee8f6189e","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:57:12.082156Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06154/citation-record","integrity":"/paper/2608.06154/integrity","json":"/paper/2608.06154/citation-record.json","paper":"/paper/2608.06154"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.685543Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"2c259c0e-18f8-4135-b94f-f67bf88afe7a","year":2021},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.270889Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:b6afe79a44ddbfe0d9eb60125312f27098d1c9c9129da6e3f07b4c383f2e0dab","observation_id":"a603f8c3-022b-4147-8169-63fe57346953","resolution":{"observed_at":"2026-08-07T13:57:16.790543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T13:57:08.301524Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.301524Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:bfb4824ade1693ed4583f0604f697aace6093ba678476744abdfaffc7dbe849b","observation_id":"0e43c405-639a-4c5b-b059-ff170912dad6","resolution":{"observed_at":"2026-08-07T13:57:08.301524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:57:08.373123Z","title":"Qwen2-VL: Enhancing vision-language model’s per- ception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.373123Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:94150d1a0fea41a89b54fbcb37a0dcc8976d70dc4a973d1c74b3e097d4bba3ae","observation_id":"4603868a-d4e8-4c73-89f7-1d53b5515177","resolution":{"observed_at":"2026-08-07T13:57:08.373123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:57:08.442796Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.442796Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:9a30369664f36d93957838c4cd877a370461a392d545352c1e3c03cceb5a4214","observation_id":"a1a210d9-32bb-4b99-8083-5b762cb6b2ef","resolution":{"observed_at":"2026-08-07T13:57:08.442796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:57:08.553499Z","title":"MiniCPM-V: A GPT-4V level MLLM on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.553499Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:853d337d4b65beca8ede340ebae3fc2a79fe74cb457ee79c719ed6b7c1551aaf","observation_id":"dbb8b77a-3727-4987-a03a-e8a06282aa5f","resolution":{"observed_at":"2026-08-07T13:57:08.553499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T13:57:08.643309Z","title":"Qwen3-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.643309Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:259b7f0b87edf7df60ccbfbb89e0ea2e24628eff083dba4eec98579339221eb6","observation_id":"fb1a59d1-ed3d-4bad-9ccb-6af984254bd5","resolution":{"observed_at":"2026-08-07T13:57:08.643309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-07T07:26:54.689579Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-07T13:57:08.729258Z","title":"Gemma 4 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.729258Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:66c6f90137b7040a7b15cde2fae36cdc9e3db856a4e8adbb79d9a3c1db977725","observation_id":"4d55ec77-a452-4a5a-becb-390200596896","resolution":{"observed_at":"2026-08-07T13:57:08.729258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.504356Z","title":"Qwen3.5: Towards native multimodal agents,","venue":null,"work_id":"5c4f3b5b-4500-4b13-9918-15dfa61724ac","year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.814585Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6799e3bc38e8a52babb836ce36542c09cf656f2af2e560dd3f459974142d5dc1","observation_id":"ec3159d7-5976-4240-90d2-7389098270cd","resolution":{"observed_at":"2026-08-07T13:57:16.579700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.288638Z","title":"Introducing Mistral 3,","venue":null,"work_id":"7145b049-192d-4841-a075-01d83544c0f8","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.880443Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:c781c9b29546f2711c1752fa211914b3f0792cf517638091dbacd843fd70dde1","observation_id":"f585939b-9dd9-4c7b-88d2-52e812ad10b1","resolution":{"observed_at":"2026-08-07T13:57:16.388390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-07T13:57:08.961126Z","title":"MiniCPM-V 4.5: Cooking efficient MLLMs via architec- ture, data, and training recipe,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.961126Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:f9a2842991674a121e5485db281b2416a52270377d40109b44cf1fe9951feb2e","observation_id":"06420827-4300-4bed-81da-c6f12310a09a","resolution":{"observed_at":"2026-08-07T13:57:08.961126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-07T13:57:09.055707Z","title":"SmolVLM: Redefining small and efficient multi- modal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.055707Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:f7cf676d6b0707ad1020e65dda2f2e38c0f729841e82fa23f652788882f5eba3","observation_id":"9ffb7a4b-5bc3-433f-b84e-657efa32534c","resolution":{"observed_at":"2026-08-07T13:57:09.055707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.106582Z","title":"NavGPT: Explicit reasoning in vision- and-language navigation with large language models,","venue":null,"work_id":"a98ee7bc-1132-4bd1-8c91-1a425c3e61d9","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.150370Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:1aa1d266dbdd2477f903b16f53830c9fc821705203eba6cc245d53f9296db813","observation_id":"2e96abb8-7e75-49cf-bad1-44b987d96f15","resolution":{"observed_at":"2026-08-07T13:57:16.185974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.893590Z","title":"VLM-Social-Nav: Socially aware robot navigation through scoring using vision-language models,","venue":null,"work_id":"5ad1e7da-413f-4a4d-bbc9-eb6996244817","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.191891Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:2fd2da500f5fc6311a0e5bf231f0c2c2d0dc1b6ec6d88ba61aa5631352d327f2","observation_id":"2ac4a8d0-ddbe-4845-83ab-753e13619f30","resolution":{"observed_at":"2026-08-07T13:57:15.988861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.700842Z","title":"VLM-GroNav: Robot navigation using physically grounded vision-language models in outdoor environments,","venue":null,"work_id":"f8136e3b-f5bf-43ca-b99d-43971f237680","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.271864Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:84212a6c6751bba3f03621f0e5f15911d9fa0491cc57042e7949ba8a2fae000c","observation_id":"1617f2b0-e8b3-4d04-a32d-24e9620e142a","resolution":{"observed_at":"2026-08-07T13:57:15.794638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.528957Z","title":"MapNav: A novel memory representation via annotated semantic maps for VLM-based vision-and-language navigation,","venue":null,"work_id":"e34dd467-bd4b-458b-b314-f378a1b452e9","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.376035Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:17c3188b10fd44ec2b081a72e5ed000217dd2f476dfedce7d48b2a45588d1981","observation_id":"f31e68ee-2539-4c67-bb19-0ef0a3340012","resolution":{"observed_at":"2026-08-07T13:57:15.624658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.295007Z","title":"HazardVLM: A video language model for real-time hazard description in automated driving systems,","venue":null,"work_id":"2d1e1ac4-d74c-407a-84f1-b89d06c1dcde","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.469350Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:48796cd99a1e4176f035911d168504819ebfc5acd42e549b863aa846a75e2f62","observation_id":"70fc3451-2ab0-43bf-bfdb-0fc46a2249cf","resolution":{"observed_at":"2026-08-07T13:57:15.405609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.095499Z","title":"LLM-powered cooperative perception framework for mixed UA V-vehicle platoons,","venue":null,"work_id":"1ae7d762-c769-4ae1-b3a0-665d6191b18a","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.543585Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:e45741712493a61297b3e59b78dbf556d4f81f4dddc96b2c8c7575be0b9e4ea1","observation_id":"25951574-ea08-42cf-87f1-209bb847b839","resolution":{"observed_at":"2026-08-07T13:57:15.178944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.862742Z","title":"Semantic scene understand- ing with large language models on unmanned aerial vehicles,","venue":null,"work_id":"a8c99aad-0786-41f1-ac58-e2cc6edaba79","year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.642706Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6fa358fc95b5833e9b07645552268a7c908c3ff5aaccf36340c0d265462bc18d","observation_id":"c5278006-8a5e-4c69-99f3-2bcd668bf024","resolution":{"observed_at":"2026-08-07T13:57:14.962984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:09.715223Z","title":"Shortcut learning in deep neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.715223Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:4117d40d8034537fbdb6d605f824b26c98117c99bb4435169e976cd2956249a0","observation_id":"91026761-6ef7-4e28-b7b5-ce3798e118e0","resolution":{"observed_at":"2026-08-07T13:57:09.715223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.658741Z","title":"Beyond accuracy: Behavioral testing of NLP models with CheckList,","venue":null,"work_id":"97bb3861-005b-4ae6-ba76-17d34e8e8ec8","year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.835083Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:457da5cb26fc966baef083817dd90245ce1c24dae6bbd17f89145fda6cabb999","observation_id":"f29b433f-6864-482b-8456-418ec2180865","resolution":{"observed_at":"2026-08-07T13:57:14.751966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T13:57:09.972585Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.972585Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:a0b3480facfa7054db07df30076e7a6ee08dafc1f096b86ab9fd2585119e76b6","observation_id":"ca7c9e58-04a9-4a16-9f56-56cadde12161","resolution":{"observed_at":"2026-08-07T13:57:09.972585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:10.087742Z","title":"Metamorphic testing: A review of challenges and opportunities,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.087742Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:40dbdc66f6e2ed46f2d8fa2b1178357d62cc0cd1085c598c30c4bef7ab918493","observation_id":"e00c28b0-ce6a-4c24-a854-1d9bf318dca4","resolution":{"observed_at":"2026-08-07T13:57:10.087742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.391443Z","title":"DeepTest: Automated testing of DNN-driven autonomous cars,","venue":null,"work_id":"7eb721e7-a6f7-4617-8720-716234b531a3","year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.174166Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:94bca079115d7485a68e5f2044af3e2ca1e4f8de07c9af48d448ca45a2b6ddfe","observation_id":"c77f0cb6-c974-420b-b245-66d362744f41","resolution":{"observed_at":"2026-08-07T13:57:14.544924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.217308Z","title":"DeepRoad: GAN-based metamorphic testing and input validation framework for autonomous driving systems,","venue":null,"work_id":"0a6a8288-9b16-4e61-bbd2-7e55a7865623","year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.263345Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:0faebd121ca9f99a69c897f6e77f23bdec4cb4611d19cc45a65a850f2522ffd1","observation_id":"7e56556c-58b4-4bdd-8297-6dc57e25b612","resolution":{"observed_at":"2026-08-07T13:57:14.289522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.053953Z","title":"Metamorphic testing for semantic invariance in large language models,","venue":null,"work_id":"b9495180-2069-4f6e-b69d-2227b07eed8d","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.360725Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:33523b2fd673597b62b2b4390da93d36091faae391cd1915d89b2d4e4e9c4ecb","observation_id":"3d13e243-58ed-4600-a09d-910ea348d10e","resolution":{"observed_at":"2026-08-07T13:57:14.128045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.900589Z","title":"Semantic invariance in agentic AI,","venue":null,"work_id":"d18324f7-b244-4c3e-91d7-1f0e7418a3ee","year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.489405Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:ec61238d6c6e8b4d036ada2ed941c25d3dd4b080f1f9bcb4db99fda0142ea1c1","observation_id":"b0ec6d09-d4c1-48cf-8a38-2302de9e0bad","resolution":{"observed_at":"2026-08-07T13:57:13.966883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.714130Z","title":"Energy-aware multilingual evaluation of large language models,","venue":null,"work_id":"9993896e-0647-4066-bcd7-f96092992f61","year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.601401Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:c633041f18c2b358827187b95be947971501786a12d3074e02cb8ca10cd73181","observation_id":"30cb1895-c93d-4bb4-a201-3ef5de9543b3","resolution":{"observed_at":"2026-08-07T13:57:13.818647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.531657Z","title":"EdgeShard: Efficient LLM inference via collaborative edge computing,","venue":null,"work_id":"5c1ae2c2-9e95-4c32-9685-5e89988bb38e","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.719094Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:a9afa2679c0434f9269411ca7fc50eccfd5901f5056c0de749c19dde2282ce49","observation_id":"d6c3c2ca-c79c-444a-b2a7-7605c6b4ab47","resolution":{"observed_at":"2026-08-07T13:57:13.611251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.390261Z","title":"Power hungry processing: Watts driving the cost of AI deployment?","venue":null,"work_id":"71c46c32-2af6-4edc-bfad-aea4e1dff0dd","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.811054Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:81f4a0c8a61a087d5ec7d24175c98430e2300030e5161d65d3db0e23aedf1804","observation_id":"225b71da-b3d6-4df4-9682-930d474951cf","resolution":{"observed_at":"2026-08-07T13:57:13.454238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.234335Z","title":"An environment for autonomous driving decision- making,","venue":null,"work_id":"8b12bb82-9ab4-40dc-9cc5-0fb721b0e665","year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.906404Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:937bae4aa0933fea360f1472bbf292d9ed46bf83ae330a900895792a8977020a","observation_id":"87e4c2cd-8ee4-431e-a0bb-8a28e650ca2b","resolution":{"observed_at":"2026-08-07T13:57:13.313176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.078053Z","title":"Learning to fly—a Gym environment with PyBullet physics for reinforcement learning of multi-agent quadcopter control,","venue":null,"work_id":"4b9aeb27-8dd9-4348-a6f0-09c39a4f92c5","year":2021},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.001892Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:95582014cadbcebc028db50897eb46c0d4ba1193a4becd700ee3f3d0a950e667","observation_id":"ff57a3ee-4a1a-4b0c-a83c-a2dc768af9cd","resolution":{"observed_at":"2026-08-07T13:57:13.146672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-07T13:57:11.105161Z","title":"Gymnasium: A standard interface for reinforcement learning environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.105161Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:14cd6796c474e22055fa269621031da4aaa241bf8108f642e792270b1dbc9b47","observation_id":"74bdaa22-0965-492e-9f57-c6556a94b078","resolution":{"observed_at":"2026-08-07T13:57:11.105161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:11.192482Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.192482Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:c8b8e351c9a2cecbf8a2204ab9c2b4f8e1490c4f1498a857813fe0313224fedb","observation_id":"7b990891-95c6-4224-a76f-fa9af2c2d912","resolution":{"observed_at":"2026-08-07T13:57:11.192482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.925339Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain- of-thought prompting,","venue":null,"work_id":"29b286ee-e319-4847-b877-30f81310a452","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.303725Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:025bbfd36279d42a72020c42b1900318e15a650c358aa38ed88f603d9667eb38","observation_id":"e81779ee-264f-462c-bdf0-47724d25e710","resolution":{"observed_at":"2026-08-07T13:57:13.001615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T13:57:11.374361Z","title":"Measuring faithfulness in chain-of-thought reason- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.374361Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:b40ae601105b71ff6b4b88939a4f52e95f223c0df0d0810ad7a76ef36d098c7f","observation_id":"4ec7dd12-c123-451e-b0c2-20d72d6cdf58","resolution":{"observed_at":"2026-08-07T13:57:11.374361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01247","last_updated":"2022-04-21T16:03:20Z","snapshot_observed_at":"2026-07-06T11:43:54.154781Z","submitted_at":"2021-09-02T23:46:36Z","title":"Do Prompt-Based Models Really Understand the Meaning of their Prompts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01247","snapshot_observed_at":"2026-08-07T13:57:11.478970Z","title":"Do prompt-based models really understand the meaning of their prompts?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.478970Z"},"links":{"cited_paper":"/paper/2109.01247","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:57bc94b67915ce599fb6789006261e27c4450fd04287bd053bafe71299c75362","observation_id":"db19dba4-69c2-4470-8fa9-744f8721c355","resolution":{"observed_at":"2026-08-07T13:57:11.478970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-07T13:57:11.549507Z","title":"PromptBench: Towards evaluating the robustness of large language models on adversarial prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.549507Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:e8fe5c6005668dd4005f7aabab6296859f5599d276864c16e16a8759b6424c92","observation_id":"d7353651-c3b0-43ac-b1a7-9db0d51c80dc","resolution":{"observed_at":"2026-08-07T13:57:11.549507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.770031Z","title":"Measuring and improving consistency in pretrained language models,","venue":null,"work_id":"012c99e7-235e-46c6-96ba-843fca602a5e","year":2021},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.628585Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:04c3d19965efafe3cec12f0e3bd57f954f5b68f35e6a71e2a9e82d77ee9fe426","observation_id":"8ebd7ffe-3c10-49de-9ef6-83dd799032d7","resolution":{"observed_at":"2026-08-07T13:57:12.854441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08786","last_updated":"2022-03-03T12:10:58Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T09:29:16Z","title":"Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08786","snapshot_observed_at":"2026-08-07T13:57:11.698424Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.698424Z"},"links":{"cited_paper":"/paper/2104.08786","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:c89b0c54266dee7c24ddd37e2dfe1a9b8c031b923eeed34d01060bf585ca38ec","observation_id":"0cfbf370-8663-4870-bbf6-caf7a772d722","resolution":{"observed_at":"2026-08-07T13:57:11.698424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.628667Z","title":"Probing classifiers: Promises, shortcomings, and ad- vances,","venue":null,"work_id":"e0abc724-540a-499e-b090-324ebd035641","year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.782731Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:813561f475f234b5ee1fbe98b76c82930c9bc39e658321a3f348c6134d9783b1","observation_id":"57408b9b-37d8-41a9-ba60-92e3229aad1c","resolution":{"observed_at":"2026-08-07T13:57:12.691304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:11.866001Z","title":"Con- strained model predictive control: Stability and optimality,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.866001Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6f902216251973966f26d64e121ea48d459595880678f989122c8f131d03d823","observation_id":"3e1d8560-31a1-4c9a-b891-4f3e30f6441a","resolution":{"observed_at":"2026-08-07T13:57:11.866001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:11.927436Z","title":"A simple sequentially rejective multiple test procedure,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.927436Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:e6d0c3827fd08f618bd21c49a36275f35ba9ff6e10c3c05cc63a0a98c8cb1586","observation_id":"bc9e8cc5-c59c-41d8-881c-0040b5fd8e28","resolution":{"observed_at":"2026-08-07T13:57:11.927436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.502036Z","title":"SciPy 1.0: Fundamental algorithms for scientific computing in Python,","venue":null,"work_id":"de59e919-0ebf-4a66-9f00-aa3ea7f73eb7","year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:12.001667Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6dc17b53fe1cd676d455fa37f73b50552d1065b1ee18141dcccfcbdd3d70080d","observation_id":"0a71f3cc-ccf6-462e-aee2-b81059cc820c","resolution":{"observed_at":"2026-08-07T13:57:12.541497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.346130Z","title":"Transformers: State-of-the-art natural language pro- cessing,","venue":null,"work_id":"22f42fa4-8e1e-4c5a-b205-011269b5644a","year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:12.082156Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:44f67efdd89a0bc0224a9cda44577b63ca2f2ed84ab33bb6a4d4022703b53d32","observation_id":"f6350d25-8935-4296-a0fa-a42e0757c57c","resolution":{"observed_at":"2026-08-07T13:57:12.424487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T15:19:50.409690Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.06154."}