{"as_of":"2026-08-11T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47bb69c81a9c523ee0a4658ff75e7c50a28001dcd051a417643b9df4cf659dfd","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:16:55.382256Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T12:45:30.225562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20750","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2412.20750 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2412.20750","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:441ff7cb4d8a853703197ce571303455efcf8f6f55457ab7c0e9af2589d65bf8","observation_id":"6f1b9142-81fb-415b-9c86-3ec3c2174556","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20750/citation-record","integrity":"/paper/2412.20750/integrity","json":"/paper/2412.20750/citation-record.json","paper":"/paper/2412.20750"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:58.154307Z","title":"Grounding language models to images for multimodal inputs and outputs,","venue":null,"work_id":"374f9484-d648-4848-b482-3f8c4b6316e0","year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.817302Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:89b3bcf69a46f33c4213a23894bb083705c32f2fcd0bb279958711e23d65761c","observation_id":"a8b3627c-88c6-4762-9d1d-b6980f7ba249","resolution":{"observed_at":"2026-08-10T23:16:58.164424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:58.118129Z","title":"Harnessing multi-modal large language models for measuring and interpreting color differences,","venue":null,"work_id":"7c46d68b-52d6-4cad-976f-55f533a7edb9","year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.829252Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:a9bfd810d0044499a3ec210b3212bcf70fcb92e9506701aff7135bad77b52a7e","observation_id":"34fb1541-20be-44cf-9e30-fe2173d468fb","resolution":{"observed_at":"2026-08-10T23:16:58.125905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:58.083771Z","title":"3vl: Using trees to improve vision-language models’ interpretability,","venue":null,"work_id":"08168933-36e4-4d91-a8bb-4cbba09c94e9","year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.846285Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:be3c9ba3523f505cb6f5e55cfb7409064b8c18cb8011bf5ea35940c7e9da2e56","observation_id":"5cdae950-263f-4a49-b112-ec043aeba294","resolution":{"observed_at":"2026-08-10T23:16:58.092900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:54.852567Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.852567Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:a8a3cd2f4016202ddfb50053eee7cb5ede3d85cba0761b4eb4a67e0d8312aecd","observation_id":"34fd085d-92d3-4fa6-9b8d-3374656b2025","resolution":{"observed_at":"2026-08-10T23:16:54.852567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:58.042421Z","title":"Who, what and where: Composite-semantics instance search for story videos,","venue":null,"work_id":"089011ac-eb27-4d80-b7f3-0b42709f9cc3","year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.860925Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:7b2ee2ca2bee657f290f0f8a7f8e8cf0b8fc33f58152113e5f1140db2267f347","observation_id":"b9da80b5-c261-4bf3-95d3-b5490be68ef4","resolution":{"observed_at":"2026-08-10T23:16:58.048530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:58.013948Z","title":"Exploring language hierarchy for video grounding,","venue":null,"work_id":"b92a3fad-ca2d-4125-9383-c990d43151dd","year":2022},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.874996Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:7378073b907b89671b64ed451f105c2475eeb8629cc2732079585dab65188a68","observation_id":"37ef8cd2-dd4e-4e4a-8328-361fc979194c","resolution":{"observed_at":"2026-08-10T23:16:58.022945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.970481Z","title":"Adaptive spatio- temporal graph enhanced vision-language representation for video qa,","venue":null,"work_id":"cbcb88bc-68d3-48da-984f-803b5d494c09","year":2021},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.881065Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:e5d97c7cd7876685c79a9212b43b6b71653300afebe1f79232ee458b8d3f4b93","observation_id":"ebbac2db-1188-45b3-8baf-01a70e9ec4dd","resolution":{"observed_at":"2026-08-10T23:16:57.984184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-11T01:12:48.131694Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-10T23:16:54.889462Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.889462Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:26005545e58e97da1e8ecd39a1eec211c32cc0d15109da7f99114ed8c0e6a80e","observation_id":"1b457a58-b9ae-41d7-981f-999f974956ae","resolution":{"observed_at":"2026-08-10T23:16:54.889462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.931454Z","title":"(2024) Hello gpt-4o","venue":null,"work_id":"70d15254-5c44-4b24-8cb5-586bb38d3555","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.897037Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:8b07f19e046da1747563d8fc1850a391cea1ac29fa22f0bd79b2d68c107fe810","observation_id":"d40b7757-eb2b-4bda-a045-1ef96cc88d92","resolution":{"observed_at":"2026-08-10T23:16:57.943791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-10T23:16:54.903733Z","title":"Gpt-driver: Learning to drive with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.903733Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:bf548770325386dcda4a3f8b1be79e5a0c3ead4ed082c6d207c9a05612a3f82a","observation_id":"232a566b-4aac-48b3-87f6-bbe0d0014d31","resolution":{"observed_at":"2026-08-10T23:16:54.903733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:54.910154Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.910154Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:de9ccfc00754a4a42d50d85f78fc67500dd1595463ac344e73a3887ea7689b7b","observation_id":"73ed88e7-3cc0-4bc7-b6d4-ce3883fa8357","resolution":{"observed_at":"2026-08-10T23:16:54.910154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05885","last_updated":"2024-10-02T13:46:39Z","snapshot_observed_at":"2026-08-11T01:20:07.070116Z","submitted_at":"2024-05-09T16:17:41Z","title":"VLM-Auto: VLM-based Autonomous Driving Assistant with Human-like Behavior and Understanding for Complex Road Scenes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05885","snapshot_observed_at":"2026-08-10T23:16:54.921826Z","title":"Vlm-auto: Vlm-based autonomous driving assistant with human-like behavior and understanding for complex road scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.921826Z"},"links":{"cited_paper":"/paper/2405.05885","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:b766d91b5bdf79cc06b0c54ffec2f683dfe3064953374186fd76dc2d9ebaede2","observation_id":"0eaff5e0-3299-4960-b2b8-eab6c88219d4","resolution":{"observed_at":"2026-08-10T23:16:54.921826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:54.929466Z","title":"Langloc: Language-driven localization via formatted spatial description genera- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.929466Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:3fdcaef91c36de35aad4e4a3eaee7cad104e3aee2912adbfffef06b1a1120fdd","observation_id":"92555851-77a1-4943-8aa5-2e7b98cbab29","resolution":{"observed_at":"2026-08-10T23:16:54.929466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-10T23:16:54.937962Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.937962Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:1ede7050d84c3d5b79f6f5238d333b6cc3ea65cd23817726ab76f0cf6c98569b","observation_id":"15f3a64d-6f05-45a2-b8ba-1a8f98430e2c","resolution":{"observed_at":"2026-08-10T23:16:54.937962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.854146Z","title":"Trafficvlm: A controllable visual language model for traffic video captioning,","venue":null,"work_id":"e2f7e11d-2507-4641-9664-cb5516cd64df","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.945280Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:0356d15ae6abe261a953eabf118caf6ade09d646a767be083cc7e4c742cc3469","observation_id":"32f1cd6b-e19c-4de5-ba22-83560400bd9f","resolution":{"observed_at":"2026-08-10T23:16:57.861854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08966","last_updated":"2024-12-13T04:59:10Z","snapshot_observed_at":"2026-08-11T01:15:10.034760Z","submitted_at":"2024-02-14T06:20:48Z","title":"Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays","version":3},"cited_work":{"arxiv_id":"2402.08966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08966","snapshot_observed_at":"2026-08-10T23:16:56.447131Z","title":"Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays","venue":"cs.CV","work_id":"2b6a1abe-40ce-454e-b9d1-f0007de63376","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.951087Z"},"links":{"cited_paper":"/paper/2402.08966","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:2dfe5d91787b3239230b061acfd11747caf8d1a3054eb04a0bf8c10d57e438c4","observation_id":"1593e766-91e6-4648-9c6d-3ee1a24a3155","resolution":{"observed_at":"2026-08-10T23:16:56.461973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:54.960802Z","title":"Physically grounded vision-language models for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.960802Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:21ce5af0a765d94803904a62901da59b3a6a6c17bd22c647f405ddaffa9faf10","observation_id":"8f4e9953-c77b-4c0a-8e50-446a82309b2f","resolution":{"observed_at":"2026-08-10T23:16:54.960802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.809828Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation,","venue":null,"work_id":"704fa80c-31de-4d50-aee7-5ae2fd2daf9d","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.968566Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:ac701d5a9070d135a16b828255e05b488bbe44b8ab15d400bc757a54de2742bb","observation_id":"331daaf8-c9f6-4a17-bcdd-dc080a59cf89","resolution":{"observed_at":"2026-08-10T23:16:57.816285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.789112Z","title":"Aha: A vision-language- model for detecting and reasoning over failures in robotic manipulation,","venue":null,"work_id":"e4c47317-a065-49d9-b082-c40db9a913e4","year":null},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.976759Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:d93c5908ccf196768f27ec3bc13629aac7381569542a01b5bc12dd748d6c6619","observation_id":"8565937f-d623-4d14-a8b7-02b0711b903a","resolution":{"observed_at":"2026-08-10T23:16:57.796007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T23:16:54.991648Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.991648Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:8b40e0fcbd72bce7fe5d0448a91041a2db3b00bb2355fccb985954d583592e5f","observation_id":"1c5ee29e-1ccd-49a0-9ad1-fff95276bad7","resolution":{"observed_at":"2026-08-10T23:16:54.991648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07549","last_updated":"2024-06-13T08:16:05Z","snapshot_observed_at":"2026-08-06T22:58:03.641625Z","submitted_at":"2024-06-11T17:59:55Z","title":"A3VLM: Actionable Articulation-Aware Vision Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07549","snapshot_observed_at":"2026-08-10T23:16:54.998856Z","title":"A3vlm: Actionable articulation-aware vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.998856Z"},"links":{"cited_paper":"/paper/2406.07549","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:a4fe483a6122da21a569624b5095e4983046889a2b6fc62bfbce923570bca957","observation_id":"12cf8a70-2080-4615-be78-b547d5fe1f87","resolution":{"observed_at":"2026-08-10T23:16:54.998856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.755324Z","title":"(2024) Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy","venue":null,"work_id":"e2c5659f-5270-4332-8129-6a9408b75016","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.005244Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:79826f807f808e8f7333047ed62652fc732db5cb08303e9487009ffc20e0dc4a","observation_id":"26bccfe0-b39e-4144-b01e-81b6c84afce5","resolution":{"observed_at":"2026-08-10T23:16:57.769303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-11T03:40:47.388058Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-10T23:16:55.011356Z","title":"Spatialbot: Precise spatial understanding with vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.011356Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:1fc2e32e97c4eb45a382bae9f1334933087335426ffef5dc9043bbf1ab32d078","observation_id":"2a98c0c7-f0df-4744-8d4c-1d736d6dbbae","resolution":{"observed_at":"2026-08-10T23:16:55.011356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.019857Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.019857Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:7b5880478216deb43d016fc4ea76721adc12baea4485b54c5eee2a5277a156c3","observation_id":"097e5731-e685-468c-baa7-10263cb9ef6f","resolution":{"observed_at":"2026-08-10T23:16:55.019857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.713294Z","title":"Onellm: One framework to align all modalities with language,","venue":null,"work_id":"fad5f9f7-6b5c-478a-ac83-5b876b486abe","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.029173Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:7905ddeffbcf488b0de55302eddf61e4f7c3321f935693f0916b8c06b0d5eb79","observation_id":"6f6e5f1d-17d1-497d-bb4a-65b655c0da63","resolution":{"observed_at":"2026-08-10T23:16:57.722290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07971","last_updated":"2025-05-07T14:26:09Z","snapshot_observed_at":"2026-08-04T14:30:16.365330Z","submitted_at":"2023-06-13T17:59:59Z","title":"XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07971","snapshot_observed_at":"2026-08-10T23:16:55.036897Z","title":"Xraygpt: Chest radiographs summarization using medical vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.036897Z"},"links":{"cited_paper":"/paper/2306.07971","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:4e38cbd551c57d3a5ca7d3706e560f498448faba267d661d727b2588bb7dcda2","observation_id":"2caa71ea-ad37-41d4-b6ec-05f4594289c4","resolution":{"observed_at":"2026-08-10T23:16:55.036897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20178","last_updated":"2024-11-12T14:45:18Z","snapshot_observed_at":"2026-08-10T07:40:18.117207Z","submitted_at":"2024-10-26T13:19:57Z","title":"LLMs Can Evolve Continually on Modality for X-Modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20178","snapshot_observed_at":"2026-08-10T23:16:55.047443Z","title":"Llms can evolve continually on modality for x-modal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.047443Z"},"links":{"cited_paper":"/paper/2410.20178","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:0c5fc16bdcc91684badb811bfec685bb204a52cfc1607fcec15c99cead9fb230","observation_id":"56071ecc-ee84-4dbc-935a-2112c96abf9d","resolution":{"observed_at":"2026-08-10T23:16:55.047443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.057153Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.057153Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:5ff0f2b4666ce35f159eb4d8d3b1262e137a0008a551bfa272a77cff7f992a13","observation_id":"011b1509-cc5e-4774-93f0-fac0bc8c434e","resolution":{"observed_at":"2026-08-10T23:16:55.057153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.062832Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.062832Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:93b35591d1bddb61ee35844771c2fff044ab7e116330ab3591b26efc2043efb6","observation_id":"9a910b6a-eb0c-4b64-9019-5d0b62e8c8c7","resolution":{"observed_at":"2026-08-10T23:16:55.062832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.070096Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.070096Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:66dd068202cf7d877746110e702492ab8c494deedf5cbea084e6330c06b18b21","observation_id":"a766d814-6adb-49c3-8ac9-4fb8d8230c06","resolution":{"observed_at":"2026-08-10T23:16:55.070096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T23:16:55.078302Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.078302Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:a7c2b6c2424e5596f20caa95b9a4942925c5c038dd69211c89675886f0924b8e","observation_id":"d654cdf2-d889-4af8-a1f9-70ab78727303","resolution":{"observed_at":"2026-08-10T23:16:55.078302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T23:16:55.085117Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.085117Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:3ff34304165968f5a3e2fc219ee2233fe06b31dc73d2d90f457c96d3c9f3a3ae","observation_id":"2d55d716-a0c4-454c-a509-2261670d070e","resolution":{"observed_at":"2026-08-10T23:16:55.085117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T23:16:55.090594Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.090594Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:967ec894ab1fbbb912307a16513c5bb0c02955aa239e0e099301ef78316775c2","observation_id":"d3a49532-c2e3-4eab-9ce9-20031c095353","resolution":{"observed_at":"2026-08-10T23:16:55.090594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.101354Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.101354Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:b1c398dc8f03b0d882b7f287af81921346c314de15e3b34f2e3316c35431255b","observation_id":"9a5667f3-d22b-4c02-9847-bcde6d26da28","resolution":{"observed_at":"2026-08-10T23:16:55.101354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-10T23:16:55.107696Z","title":"Pandagpt: One model to instruction-follow them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.107696Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:d5ddb039de5f2b0f14b52770fdfaf90640e80c66629ec7924b8d7bc7f9ab7706","observation_id":"8947ba36-54a6-4d2a-9a9f-eba3a8c9aff1","resolution":{"observed_at":"2026-08-10T23:16:55.107696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T23:16:55.114595Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.114595Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:c5337a45ece3a097081b2a549da00037764f53fde8f184a3501c26a52d74a5f7","observation_id":"8f326b97-80ef-48a9-810a-cb0f4b893287","resolution":{"observed_at":"2026-08-10T23:16:55.114595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T23:16:55.121002Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.121002Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:3cd9d48a0ef4d2fc1276ae4f6d106893f136fcf5f393f08c44d3e3060c81275d","observation_id":"8dae310a-f67a-4815-8c63-57486054489f","resolution":{"observed_at":"2026-08-10T23:16:55.121002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.131639Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.131639Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:5be27ce02a4400d26968ddfa236f839d02bc905410dfdb9ba06803a89f5a081f","observation_id":"437c7b22-36b9-4d91-ac02-80a5c55bd0f8","resolution":{"observed_at":"2026-08-10T23:16:55.131639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-11T01:43:16.181975Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-10T23:16:55.136845Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.136845Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:88a54a88b4e2f4094d341d16687cd169c703e9b697e099b5affdf5936e4510bd","observation_id":"75da596b-52c8-430a-b37f-a9537e2fe48a","resolution":{"observed_at":"2026-08-10T23:16:55.136845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.551276Z","title":"Q-bench ++: A benchmark for multi-modal foundation models on low-level vision from single images to pairs,","venue":null,"work_id":"1688b14c-758c-4f12-97a6-403cee4ed6cd","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.144635Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:97007aa5de24386bfb44e6c6f936919d31043dcfeeeb39dd8d321a62310c58d6","observation_id":"dc8e5330-580e-4efd-b83b-9dd62650d1d2","resolution":{"observed_at":"2026-08-10T23:16:57.564214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.515981Z","title":"Mmbench: Is your multi-modal model an all-around player?","venue":null,"work_id":"24d2ef8a-2fc9-4274-bfa7-1c89ec7d623e","year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.152443Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:80533dcaca9baa2e8c672ec58f8c7074a196b6f7831fe71498640495b0891d0f","observation_id":"f4f689a7-7995-4b97-aad6-241701e7b7cf","resolution":{"observed_at":"2026-08-10T23:16:57.525800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.478978Z","title":"The reviewing of object files: Object-specific integration of information,","venue":null,"work_id":"177328a9-cdf2-4d6b-9053-b8360735b6e9","year":1992},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.159331Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:356acdbb4e358aa238a43761babcedfae349d4be94867e984d72b924ee53b357","observation_id":"8e21972b-64ef-42e6-a36b-2f7ff72ae059","resolution":{"observed_at":"2026-08-10T23:16:57.492861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.440989Z","title":null,"venue":null,"work_id":"d66660f5-8d6d-464d-a970-db2b75d1c370","year":2013},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.167390Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:95e7a7892a2d6850d6e6a0471f5c1fe04e07bd0ce112d97d6a2c3adec6b333ee","observation_id":"d576d43a-2cf5-4554-b24d-a20e6b4fc5cf","resolution":{"observed_at":"2026-08-10T23:16:57.449205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.173811Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.173811Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:6cf80f120b6d46a58c45c17557a321205ea87cc448b2ef46c32312d628ac0165","observation_id":"3c8d7df6-dae0-47b0-9658-f395710eee33","resolution":{"observed_at":"2026-08-10T23:16:55.173811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14713","last_updated":"2024-09-23T05:19:06Z","snapshot_observed_at":"2026-08-08T09:26:53.921078Z","submitted_at":"2024-09-23T05:19:06Z","title":"Phantom of Latent for Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14713","snapshot_observed_at":"2026-08-10T23:16:55.180265Z","title":"Phan- tom of latent for large language and vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.180265Z"},"links":{"cited_paper":"/paper/2409.14713","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:680375683c0c58390ace742b79e292777b466562dd43864459fb93b54bef02fe","observation_id":"2b7e5b1f-8e55-450c-9c7b-1ecef7080308","resolution":{"observed_at":"2026-08-10T23:16:55.180265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T23:16:55.186893Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.186893Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:c8b1aadc93be7514e1f71f65565c5317f224f906daf92dad500fdda1b146eab0","observation_id":"ffb088be-550e-4ff7-bf85-7235199d2b28","resolution":{"observed_at":"2026-08-10T23:16:55.186893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.354205Z","title":"(2024) Claude 3.5 sonnet","venue":null,"work_id":"fb361162-884c-4ffa-8be3-2dbb8e3cd457","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.192741Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:5d927838b3f2e3e7a68038dae8be33f6e8b7576e8a3b36862aac0d99b753c7bf","observation_id":"417d6d1b-aa34-4670-bfa6-9e1e59370ffc","resolution":{"observed_at":"2026-08-10T23:16:57.374510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.296162Z","title":"Prolific,","venue":null,"work_id":"d0e72ff9-ad56-43ea-b5fb-0d71fc82cdb9","year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.198233Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:f3960a516702201bba06870fce6e8ffe0a168904aea833e56646c3bff39fb6a8","observation_id":"6ee7360f-e93a-479d-b2d2-b9cec25375d7","resolution":{"observed_at":"2026-08-10T23:16:57.321146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.258503Z","title":"Rank analysis of incomplete block designs,","venue":null,"work_id":"9fb9cd94-0387-4104-a5e5-222296b4d17d","year":1952},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.203398Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:f5f529b15d1e322427fc767f4c99bd9a8d2af8c3ac28f5e50dc97807e4dc99b3","observation_id":"f6b04e6f-437a-46e7-bf60-a6bfe513fb61","resolution":{"observed_at":"2026-08-10T23:16:57.269156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.209582Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.209582Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:7ab0d6e66f4778b558c62ae31ee1388c59ed044b7d1f458a6294fa271dfbe625","observation_id":"c37c8ccc-8eef-4408-8042-c81a1192b376","resolution":{"observed_at":"2026-08-10T23:16:55.209582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.216406Z","title":"Facenet: A unified embedding for face recognition and clustering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.216406Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:b786a949750369980a81523e36fcd15a43c820a772e39b06bc08cd428a137e5e","observation_id":"c296a579-0808-42f1-af43-704d1dc5b6ef","resolution":{"observed_at":"2026-08-10T23:16:55.216406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.188722Z","title":"Target-aware dual adversarial learning and a multi-scenario multi- modality benchmark to fuse infrared and visible for object detection,","venue":null,"work_id":"aa91ae9c-ace4-4151-b7b4-a40bcc8650fe","year":2022},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.222315Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:d579251313d986083bd89b897bf74fcc6905145d28d174b8cf14e6877977a1c2","observation_id":"6595076d-124d-4d5b-b1e0-105fc15c5ad4","resolution":{"observed_at":"2026-08-10T23:16:57.200496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.151881Z","title":"thermal dogs and people x6ejw dataset,","venue":null,"work_id":"76d512a2-4e49-405f-aaa3-c72c3073b1cf","year":2022},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.228568Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:93d21905f558223e184a3b0b253c77714fc8f0dbfb133dbd354d1146052ed384","observation_id":"827cef51-6cd5-4e73-a4c6-5581618800d3","resolution":{"observed_at":"2026-08-10T23:16:57.160227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.114633Z","title":"pet dataset,","venue":null,"work_id":"aac68e0a-ac86-44e0-b007-4dba0cd39cec","year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.237447Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:697ae77a41f82c421811aa1e0b2f8e2aafc950ab4c056e5ba6c4e458a626b3e9","observation_id":"cb195b62-1dd8-49a4-9e2d-5f30423b4bdc","resolution":{"observed_at":"2026-08-10T23:16:57.122467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.064557Z","title":"Thermal dataset,","venue":null,"work_id":"f92660b1-1d6d-4c19-a1da-0ed15cced390","year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.249014Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:cd3b161899bbd6c757820d2d6ba6b70176b6f3c5321c634284852f3fcc464144","observation_id":"3b3d3338-35a0-468a-813d-bdb3a674873e","resolution":{"observed_at":"2026-08-10T23:16:57.085566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:57.024037Z","title":"Hit-uav: A high-altitude infrared thermal dataset for unmanned aerial vehicle-based object detection,","venue":null,"work_id":"b273bda0-72cd-430e-89fe-5d47efb00eea","year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.256113Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:f0bb4c0060529642a7da1b78b678359fd6e94a454253a66e094d63eb3411c6d6","observation_id":"085270e7-7557-435a-9082-858b224f95e7","resolution":{"observed_at":"2026-08-10T23:16:57.031211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.980019Z","title":"animal-detection-flir-extra dataset,","venue":null,"work_id":"118295f7-72d4-411c-8f43-344a6ab75fb2","year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.264251Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:23d93432942ea1e97aab7963186378b1224cf63d28864e910cbd72fd08ba1619","observation_id":"7f013fc6-b02e-438a-8d2d-ec869489167d","resolution":{"observed_at":"2026-08-10T23:16:56.997919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.900620Z","title":"chips-thermal-face-dataset,","venue":null,"work_id":"735c16d7-87d2-4253-9114-18c2706bec15","year":2020},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.279065Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:d23124f75db3925a6a8440add94627d69709dd355b8ad514c4c4e501fa2030ce","observation_id":"2a9907d9-f032-4e54-a59b-4b17e12e7ab3","resolution":{"observed_at":"2026-08-10T23:16:56.910171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.942243Z","title":"Available: https://universe.roboflow.com/one-rphct/animal detection flir extra","venue":null,"work_id":"dec89b26-320e-46bc-aa71-b9284c847b3d","year":null},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.272591Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:90b6bde59747936f6e850a421166e61714ea7712e054af28d4e6d7008a30a646","observation_id":"d245561d-3894-4cac-a36b-f8ce905dad9a","resolution":{"observed_at":"2026-08-10T23:16:56.950577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-11T01:17:48.312983Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-10T23:16:55.294746Z","title":"Diode: A dense indoor and outdoor depth dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.294746Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:c1d8fa22f80f56eed53c8b8ed2846f960a15fdbf632685b5671c0b7300620656","observation_id":"7495a38f-2956-49d0-a2e0-08aa4fcb7e17","resolution":{"observed_at":"2026-08-10T23:16:55.294746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.862866Z","title":"Ifsod dataset,","venue":null,"work_id":"843cd12c-20fa-4f3b-a434-066eb66daa81","year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.285182Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:78258e8feac95a3d07e810c7bd6066bc6ac79c5ac5a703c49512e3018f268f08","observation_id":"c7781007-900b-457b-a252-e5860655d16d","resolution":{"observed_at":"2026-08-10T23:16:56.876035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11590","last_updated":"2021-10-22T05:12:42Z","snapshot_observed_at":"2026-08-10T18:58:55.163553Z","submitted_at":"2021-10-22T05:12:42Z","title":"DIML/CVL RGB-D Dataset: 2M RGB-D Images of Natural Indoor and Outdoor Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11590","snapshot_observed_at":"2026-08-10T23:16:55.307903Z","title":"Diml/cvl rgb-d dataset: 2m rgb-d images of natural indoor and outdoor scenes,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.307903Z"},"links":{"cited_paper":"/paper/2110.11590","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:a05c70efe4c3c4f77a00d047a8ce769966b0fd3f68cb6e7cc3f4bb86dd7f8017","observation_id":"899ecfa9-da76-4845-95db-fd153375aa7a","resolution":{"observed_at":"2026-08-10T23:16:55.307903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.822002Z","title":"Indoor segmen- tation and support inference from rgbd images,","venue":null,"work_id":"5fd06da4-9fee-4768-8c02-641afba62b70","year":2012},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.301879Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:678708c7af07c4a7f14b0012a800fa1cca7c63987f29bff74cccf34bdf813a41","observation_id":"79fe59f6-426b-4a08-9e9a-e187715d8902","resolution":{"observed_at":"2026-08-10T23:16:56.837748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.747683Z","title":"X-ray baggage detection dataset,","venue":null,"work_id":"f1bc40e7-db6a-4539-9d71-3c49d12d1342","year":2022},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.321174Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:120614cf232c26e4f3a9c155bae68ab28a9a6cc953bead3824fec972fb8ba2ef","observation_id":"834b060e-a989-47c2-859c-a48e126ab185","resolution":{"observed_at":"2026-08-10T23:16:56.764582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.797519Z","title":"Unifesp x-ray body part classifier compe- tition,","venue":null,"work_id":"a14f3908-1283-46f8-be62-eda3e4e8e2a2","year":2022},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.314125Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:e11e2c3e6a6d389dba2a5e5bfe9d60db99676208d691ed13d722fa5b8884f351","observation_id":"51910820-87e8-4fad-be47-580911fab010","resolution":{"observed_at":"2026-08-10T23:16:56.807204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.338072Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.338072Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:9eacdbaaf9ab4db3ebd17580e89ef4b8a3779ef84a7f2f6ee230cdd3e0dead22","observation_id":"7124f7bc-a881-465d-93bd-b0fae4144252","resolution":{"observed_at":"2026-08-10T23:16:55.338072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:55.327101Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.327101Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:6f730ac20044ea873d784686ba7983d4fb3c526cef117c44ab0276004946a897","observation_id":"82c877dd-628b-43d0-8e0f-de0e4f9a1a34","resolution":{"observed_at":"2026-08-10T23:16:55.327101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T23:16:55.365253Z","title":"Simpo: Simple preference optimization with a reference-free reward,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.365253Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:5c1faeace9e0d91688f73f1cc689bca4f2805062a21a0c6acdf53195b832eb63","observation_id":"bfb8b9a2-dfad-482d-80c0-6fe951c4ab8f","resolution":{"observed_at":"2026-08-10T23:16:55.365253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.655447Z","title":"TE-SQ1 Thermal Camera,","venue":null,"work_id":"a55711bf-bb2e-48e8-bfce-b8228ba5f1bb","year":2025},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.372387Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:e9ec85c1fac2017187fb4e9498ece6ce40d8a9fd3c22822ba28518d35d3d9bf7","observation_id":"7dc168b1-45e2-415a-ab31-3d680cd248b3","resolution":{"observed_at":"2026-08-10T23:16:56.667129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-11T01:15:48.115059Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-10T23:16:55.356697Z","title":"A general theoretical paradigm to understand learning from human preferences,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.356697Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:c2d23ed75f76118050fed76bb3fe8614275a8d7c395a9d1f451f63f05a1c88fc","observation_id":"271cf759-74ff-4e8c-bbca-483ebcf9d94b","resolution":{"observed_at":"2026-08-10T23:16:55.356697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T23:16:55.350018Z","title":"Available: https://arxiv.org/abs/1711.05101","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.350018Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:90131057ab9a9dc2c0a9355666c87026c68278b5051b3bd3aceda484449ea406","observation_id":"bcc74ea9-23cb-411f-8f15-356748985b2f","resolution":{"observed_at":"2026-08-10T23:16:55.350018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00371","last_updated":"2024-10-01T03:47:00Z","snapshot_observed_at":"2026-08-07T23:49:16.921379Z","submitted_at":"2024-10-01T03:47:00Z","title":"AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00371","snapshot_observed_at":"2026-08-10T23:16:54.983609Z","title":"Available: https://arxiv.org/abs/2410.00371","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.983609Z"},"links":{"cited_paper":"/paper/2410.00371","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:4aa972131c1b6a9e776d8539ee0f43b9f920010e776aa27c57312076a4e64a13","observation_id":"8b0f47f1-e734-49e7-9a52-9a4dd10329cd","resolution":{"observed_at":"2026-08-10T23:16:54.983609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:16:56.621654Z","title":"His research interests include deep learning and multimodal large language mod- els","venue":null,"work_id":"c6f18748-3b60-402a-8139-45f12a347287","year":2021},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.382256Z"},"links":{"citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:d1c8b05517c1a944ecaf0f19b91b5e6d2cf544c6ac9478fa51e17715622124a3","observation_id":"8d5cceea-2470-40a4-93a4-58f8a999e59d","resolution":{"observed_at":"2026-08-10T23:16:56.632139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2412.20750."}