{"as_of":"2026-08-15T20:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:226ee255d6131576e2c5cf7c5ea05ea5523c2ea207c7030ee8d630c3dd5d77e7","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:50:19.424861Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07861/citation-record","integrity":"/paper/2608.07861/integrity","json":"/paper/2608.07861/citation-record.json","paper":"/paper/2608.07861"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.017635Z","title":"VQA: Visual Question Answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.017635Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:56d390cbd90cd1cfa8c929179253cfedb49203bc7c2c916437ccb9d807dec4e9","observation_id":"71d47ad8-bae6-495f-9981-555a93e09997","resolution":{"observed_at":"2026-08-12T00:50:19.017635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.022230Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.022230Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:ebf51e75be6ecdfd24bb91116c4299ac984c119f28ff67c8483c433fb96d11a0","observation_id":"8d7bdee0-3f56-4293-b5f7-efcfc3389f5c","resolution":{"observed_at":"2026-08-12T00:50:19.022230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-12T00:50:19.026832Z","title":"Project Aria: A new tool for egocentric multi-modal AI research,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.026832Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:ba0eee216f566dcef8dd5f953d9bbe22348553049f22a1a323521fe85618ca0a","observation_id":"aeee4825-6bf1-400e-b230-b03f9f69aee0","resolution":{"observed_at":"2026-08-12T00:50:19.026832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.031728Z","title":"Ray-Ban Meta AI glasses gen 2 & gen 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.031728Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:1c983c270ce1fd8c4571bb25c087496ddcac51e8ac7270aa83c983709d619e2b","observation_id":"51d95b2f-c7d9-4ea4-819e-9c7989f2f0c0","resolution":{"observed_at":"2026-08-12T00:50:19.031728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.036101Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.036101Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:f430065f250f38af85c05981adcda4932f4cbd00c638592792578589221d81b1","observation_id":"ca9a5527-1242-4b86-bd1c-85c3fadb4b4f","resolution":{"observed_at":"2026-08-12T00:50:19.036101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.040708Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.040708Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e6f8017ddcd5ce1edd0ccd49cbe17a98321aff9f332e24ef33deeed4de9b76b6","observation_id":"c423ef81-b965-4ded-9423-26bd29476cc2","resolution":{"observed_at":"2026-08-12T00:50:19.040708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.045319Z","title":"VizWiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.045319Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9d15c2e2b38540fe26029187f2e72acf2ace3c0f00e4d90be15e85dae2cf019d","observation_id":"5f6c1989-ff9c-411f-9b78-d5a98caf6067","resolution":{"observed_at":"2026-08-12T00:50:19.045319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.049342Z","title":"Be My Eyes: Lend your eyes to the blind","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.049342Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4a87f5b4a2490534777caf75b2cb290e824bb5828acd197678b62beefbde29d9","observation_id":"2ec2a70d-2d04-40e7-9f53-bd449a390a50","resolution":{"observed_at":"2026-08-12T00:50:19.049342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.053382Z","title":"Long-form answers to visual questions from blind and low vision people,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.053382Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:cab8a11c382180fab353a40a803c4bbf0838e3ec174cdf6d94b7592c2eeb6d42","observation_id":"c7a0d083-22a2-4034-b581-b6528d7cdf17","resolution":{"observed_at":"2026-08-12T00:50:19.053382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.057368Z","title":"Augmented reality anatomy visualization for surgery assistance with HoloLens,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.057368Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b090c9e2a135f8ba2e9e4333cdb94b5d268a8c3b2e04307e0425276494ffe050","observation_id":"f809fab8-781e-4a98-a07b-14dbb91febbb","resolution":{"observed_at":"2026-08-12T00:50:19.057368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16597","last_updated":"2024-12-24T08:14:36Z","snapshot_observed_at":"2026-08-12T17:09:45.841966Z","submitted_at":"2024-12-21T12:03:31Z","title":"LLMs Enable Context-Aware Augmented Reality in Surgical Navigation","version":2},"cited_work":{"arxiv_id":"2412.16597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16597","snapshot_observed_at":"2026-08-12T00:50:19.842494Z","title":"LLMs Enable Context-Aware Augmented Reality in Surgical Navigation","venue":"cs.HC","work_id":"0916825e-4512-4297-97ed-2c338275fc0e","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.061282Z"},"links":{"cited_paper":"/paper/2412.16597","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:21a1e9f683e28eaf1b4f787a6863ff658e84c7fe682a492b1e9d7d815a95f326","observation_id":"f4e53888-1f74-4bcb-8700-525f7fbc0d40","resolution":{"observed_at":"2026-08-12T00:50:19.847198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.065974Z","title":"DriVQA: A gaze- based dataset for visual question answering in driving scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.065974Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:acd89c7576f5b759e88b026e4f47574746620fd172a6c8eb65552ae15debbe9a","observation_id":"1f4ba1a6-b0cd-47fd-affe-6011636153dd","resolution":{"observed_at":"2026-08-12T00:50:19.065974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.069805Z","title":"Mimicking human attention in driving scenarios for enhanced visual question answering: Insights from eye-tracking and the human attention filter,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.069805Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b00af17c0f2cf1f4dd0b6727040514c566af585408aa1e6e671fd228e0ee6e23","observation_id":"f23872a6-04d1-484e-93c5-fa11a7b911cf","resolution":{"observed_at":"2026-08-12T00:50:19.069805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.073724Z","title":"Demystifying small language models for edge deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.073724Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5958629730cdb3bd75e0d614c309a49f8edaed60b13e42434e64d50056287844","observation_id":"0e174cce-37bf-44c7-a1d0-9ecab01484fb","resolution":{"observed_at":"2026-08-12T00:50:19.073724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.077650Z","title":"Efficient processing of deep neural networks: A tutorial and survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.077650Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2fcbee5908327713f5b0e439f8c1ee447e6a2893e5b7434fcc9dbbd39b08f912","observation_id":"4f3be074-5d14-4261-9b0f-284edc6d3958","resolution":{"observed_at":"2026-08-12T00:50:19.077650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.082137Z","title":"LLM in a flash: Efficient large language model inference with limited memory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.082137Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:387ad2404cd40b425e28080c69a8398b5460eafa045662661a52e8c729e7ec85","observation_id":"3f716f81-e7ef-4153-bce3-1a2d210cacd2","resolution":{"observed_at":"2026-08-12T00:50:19.082137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.086239Z","title":"Mo- bileLLM: Optimizing sub-billion parameter language models for on- device use cases,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.086239Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:6e8a92df93fb9e68aadb61f7e9a54928528b2ab69a9557b32d55e34a59c9b47d","observation_id":"093f752c-10f3-48fc-aea0-9e19b5827545","resolution":{"observed_at":"2026-08-12T00:50:19.086239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T00:50:19.090469Z","title":"MobileVLM: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.090469Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b404677d31e8d1fa57af676a993df6b58790b9de5eff17b51b05418422788605","observation_id":"ed140e8c-6bb7-4a98-bae5-f052bb71ac1e","resolution":{"observed_at":"2026-08-12T00:50:19.090469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.095087Z","title":"Bench- marking tinyml systems: Challenges and direction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.095087Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:080f72364e857b3e25256792f5fe3f3d48796194e3958a83f8f50968adcafaf1","observation_id":"5591e1b1-915d-433f-9465-befe03319a4a","resolution":{"observed_at":"2026-08-12T00:50:19.095087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-12T00:50:19.099492Z","title":"Tinyllava: A framework of small-scale large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.099492Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:85f1baace953a6d91742b065538e634391e535362f63de12c7aea9e53190185e","observation_id":"e0624723-5114-4f44-ba70-eaa0a743094d","resolution":{"observed_at":"2026-08-12T00:50:19.099492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.103858Z","title":"Rokid AI & AR glasses—redefining reality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.103858Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9903bf866d693e2218e7a4b74071f0548b7de211fd6c0c7cb1df73cbd2b0343d","observation_id":"030b6d04-1204-49be-9816-dcd0f2bb3b2d","resolution":{"observed_at":"2026-08-12T00:50:19.103858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.108144Z","title":"Project Astra: A research prototype exploring the future of AI assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.108144Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0895fc2a6722fbc6d7391907e9f2513c543ee3ee9abde76d138b7efbafc8f994","observation_id":"33c982d4-3c83-47e6-acb7-fa530e2c4d11","resolution":{"observed_at":"2026-08-12T00:50:19.108144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.714680Z","title":"Google vs meta smart glasses: Which AI frames are better","venue":null,"work_id":"c1cc2de2-472a-4297-9cd7-f106c01d36f3","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.111993Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0142caaf579b376da1c907116b44150f8e141af1eb8409ac16ce034a225f217e","observation_id":"43286f77-d8ae-43c3-9bf8-3483d41a9953","resolution":{"observed_at":"2026-08-12T00:50:20.719204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.700698Z","title":"Edge cloud offloading algorithms: Issues, methods, and perspectives,","venue":null,"work_id":"99dbf69f-f95d-471a-aa39-aa220680c921","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.115924Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0bed229459183e8e06aee12745c5625f5330eacda37ad347b79b4bb9c6307112","observation_id":"f4719216-9ab0-4982-9300-c7e5fadb17c7","resolution":{"observed_at":"2026-08-12T00:50:20.705801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.684355Z","title":"Cosmos:computation offloading as a service for mobile devices,","venue":null,"work_id":"4581fb92-9256-4137-8117-c013d1938c53","year":2014},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.119812Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4c79709ea9744427cad7199efc10277fb5f11e64b6b4a9335d3127ee5dab2f50","observation_id":"e2197941-1bf2-423d-afa5-c6c52a9dda66","resolution":{"observed_at":"2026-08-12T00:50:20.690590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.670600Z","title":"To offload or not to offload? the bandwidth and energy costs of mobile cloud comput- ing,","venue":null,"work_id":"db038cba-de0a-42b1-a2c9-20795134db7d","year":2013},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.123655Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:fca5d68f866c209e7693878423d6603eb19b1f9885eeb28b5f5e30d97f5ca64c","observation_id":"b49ec1be-5003-4b1d-8980-a2abd19fa10c","resolution":{"observed_at":"2026-08-12T00:50:20.675452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.658806Z","title":"Images and vision,","venue":null,"work_id":"bf9fbe64-3382-4f8e-bf11-4f3d75b731b3","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.127468Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:218b67784fde5e342642a57b0430fdd901291dd324908c6a03c0bdbbf01d67fa","observation_id":"46a2ff98-5f5e-4710-8ec2-ac5fa2d36e6f","resolution":{"observed_at":"2026-08-12T00:50:20.662673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.644584Z","title":"Understand and count tokens — gemini api,","venue":null,"work_id":"a03ebde6-141a-424a-8c84-5a21536d1dfc","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.131426Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5226b706703010dc44b1adc472600f3988834a9119508675b45b44eddddf55cf","observation_id":"e1199267-7777-484a-be17-82f4ba020a32","resolution":{"observed_at":"2026-08-12T00:50:20.650544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.632459Z","title":"A-vit: Adaptive tokens for efficient vision transformer,","venue":null,"work_id":"8905d36c-1788-4d09-9c9d-8bbac45e41ee","year":2022},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.135656Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5d39627affd0a2d13abf30db19d07089704cbc5963e4995da11df0e066bb2011","observation_id":"e2f21d7e-8e38-48c8-a39c-c1f0178b018b","resolution":{"observed_at":"2026-08-12T00:50:20.636667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.139426Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.139426Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:ce7a7b0d07e9abb227e0302e851247b3d3bc3bb112ae9890ee7f38d97e7b7299","observation_id":"6d2e4ea8-265e-463d-9465-ec7bf0e3941a","resolution":{"observed_at":"2026-08-12T00:50:19.139426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.610781Z","title":"Token merging: Your vit but faster,","venue":null,"work_id":"e2a0c944-eea8-4db8-8de0-b6a6b65481e2","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.143097Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:1ade6d29b8512788492f716ba22babf5db480889666d9b6a582d3727f8b644a6","observation_id":"b1f216e8-d0ab-496d-9366-3b51981bba7a","resolution":{"observed_at":"2026-08-12T00:50:20.615091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.597593Z","title":"Elf: Accelerate high-resolution mobile deep vision with content-aware parallel offloading,","venue":null,"work_id":"cfb51693-95d3-4ed7-b86f-bc50ef6b9538","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.146721Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d1ae5a3956d287cb91bbb1cefcea97a411b0e0a0f053506e481e3bad5a764e01","observation_id":"6fb6ed1d-b647-4032-bb55-085660552667","resolution":{"observed_at":"2026-08-12T00:50:20.601893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.584126Z","title":"Accumo: Accuracy- centric multitask offloading in edge-assisted mobile augmented reality,","venue":null,"work_id":"7cfd93bb-e01a-40f7-b76d-f64ff9d53551","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.150710Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:30ab1d692c00f4aade3f6558402f5ae2b162f77e33adb6e1baddf384e9a48af8","observation_id":"c815e248-ed3e-4b28-ba44-419e630d7ae0","resolution":{"observed_at":"2026-08-12T00:50:20.589138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.571008Z","title":"Deep contextualized compressive offloading for images,","venue":null,"work_id":"e0eccb51-4092-4563-ad1f-b316d0db3e04","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.154686Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9f6d383b652eae3b7877c91eb12e6befac9cbed7ef55f4d9a734ccb02b60911b","observation_id":"db119f59-071d-4edf-b611-a1ad706dad96","resolution":{"observed_at":"2026-08-12T00:50:20.575387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.557255Z","title":"Towards wearable cognitive assistance,","venue":null,"work_id":"e9c8ef5f-5589-4470-be2e-93596d7cf195","year":2014},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.158591Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0947c342b2a2a176a2ebdf17d3099c70ace02479b03eeffac4637f94c4c42f0c","observation_id":"62d30240-4617-49fe-8b99-a546eb9e352a","resolution":{"observed_at":"2026-08-12T00:50:20.561858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.162754Z","title":"Deep learning with edge computing: A review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.162754Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2f0546f37c4f220784ad0da6604b4713c052c2a5c717ef1633a6f40460843c8e","observation_id":"e1736367-04fd-4dca-81ad-2fa144d30a94","resolution":{"observed_at":"2026-08-12T00:50:19.162754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.534946Z","title":"Color-to-grayscale: Does the method matter in image recognition?,","venue":null,"work_id":"01f4e353-1af6-4f2b-b68c-5ca15bb44953","year":2012},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.167041Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:be5bf69be54cc17fd5f0af6dbca633e44ee62c48f77f27e4318a912ef76e4b99","observation_id":"b611c525-e955-40b7-9ec3-84c34dd7569d","resolution":{"observed_at":"2026-08-12T00:50:20.540375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.170915Z","title":"The jpeg still picture compression standard,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.170915Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:163a31ee7c12d2e4c6135a38e5fafe114b2d6318b589b6cfc23e4bef15cd243f","observation_id":"82072b31-de42-4ac8-bb17-d7543c2d9d70","resolution":{"observed_at":"2026-08-12T00:50:19.170915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.516349Z","title":"Learning to resize images for computer vision tasks,","venue":null,"work_id":"400f8545-bd34-48ec-b343-c5f5eddcfb55","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.174922Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:68be9d73531da93720d6a86e9416a11858319faebebb54aa02400c7c96398ce8","observation_id":"a4b2b770-2d6d-4fd1-af7e-2750e9d6511e","resolution":{"observed_at":"2026-08-12T00:50:20.520409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.504899Z","title":"VQA-MHUG: A gaze dataset to study multimodal neural attention in visual question answering,","venue":null,"work_id":"58681d77-1532-49d4-8b8f-4657f56b358b","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.178967Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:7c624f5612dcc9fd80e02bc1ebd3e13a1018726b388dcb3a84dbd8a71ad1b62c","observation_id":"6e7aa746-6bc4-4004-a37f-d48474ab831a","resolution":{"observed_at":"2026-08-12T00:50:20.509216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.492697Z","title":"Eye gaze tells you where to compute: Gaze-driven efficient vlms,","venue":null,"work_id":"d0c1b6e2-f366-42a8-9e31-5d393a6920b5","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.182640Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:5eba4c10bd81f7ec8c7f516e4229d668c15434f1c01f3765d973582fb71b0cf8","observation_id":"8c632c78-07be-4139-a733-c27e553b0ce6","resolution":{"observed_at":"2026-08-12T00:50:20.497438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.480591Z","title":"Saliency detection: A spectral residual approach,","venue":null,"work_id":"1403715e-fe58-44eb-9949-502933e75f10","year":2007},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.186564Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:847eccdf151e94f3f904b6f2d6221ec16cb5986eb3180c4266be51c40229adca","observation_id":"ea0c5c9b-871a-45d3-924c-b67571e48b83","resolution":{"observed_at":"2026-08-12T00:50:20.485099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.468905Z","title":"Saliency driven perceptual image compression,","venue":null,"work_id":"320cfcd4-1955-4919-a468-114958a9a03e","year":2021},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.190484Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a06379d9a09c4c375b48fe8e8b54bdd50d4fbd46144c975c2fd6e90276819e24","observation_id":"2984d488-75ea-4a56-b6c8-3cfd71b74027","resolution":{"observed_at":"2026-08-12T00:50:20.473103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.457507Z","title":"Visual cropping improves zero-shot question answering of multimodal large language models,","venue":null,"work_id":"b82363c5-6cb4-4264-bf82-ec90b547d2fa","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.195307Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:c40e29d1ebd6bfce11b085e38230b2c019aad47b0f0ef12fa4e33140dedb2a8d","observation_id":"46657777-0be2-4c24-a490-16df0595a874","resolution":{"observed_at":"2026-08-12T00:50:20.461376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.445887Z","title":"Edge assisted real-time object detection for mobile augmented reality,","venue":null,"work_id":"fc14fcd5-dd2d-4137-96a8-ca4c41855aff","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.199136Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:8e1fabf8517a53d25a5a29a4f17c2a256bdfb3d86c61e3e7bcb21b5a1f9c27e1","observation_id":"0661ec84-8aed-4a0c-9051-4f3a6796db86","resolution":{"observed_at":"2026-08-12T00:50:20.450028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.434143Z","title":"Glimpse: Continuous, real-time object recognition on mobile devices,","venue":null,"work_id":"3e88be33-dd95-4ea1-bbbb-ba6a24932627","year":2015},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.202934Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:2f24af784f0c1cad3d3a77460830cbcc2a65ad616586130e4eecc0e377782f04","observation_id":"6d1ff298-076a-42f4-9024-d3724fdc2cd0","resolution":{"observed_at":"2026-08-12T00:50:20.438645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.422089Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering,","venue":null,"work_id":"2490808e-1f96-44c7-98a3-76312ffc3c52","year":2017},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.207129Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:fb3997c7fb67a4b056b61e89f7ed471c5a9d5729cf57ebf17c77f5110c97ad30","observation_id":"bb99a795-38e0-4c1d-834e-d84387269ab0","resolution":{"observed_at":"2026-08-12T00:50:20.426348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.409933Z","title":"MMBench: Is your multi- modal model an all-around player?,","venue":null,"work_id":"3bea926c-e0f0-48ca-939d-3fcdc4b2fd91","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.211247Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b12fab0f5f5ed56dea32dd78e9c9a96e38c2f37882b84a2b1bb89626e6f09e0a","observation_id":"a4b4c0c5-25ef-4e90-8c8c-a85746a2e407","resolution":{"observed_at":"2026-08-12T00:50:20.414074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.397135Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI,","venue":null,"work_id":"d91f4ea8-8742-4dde-88a6-d6066daed4ce","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.215889Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:33dc3ca98a5253e5f26214701c7483373cdeb0a687ac46ae88bb97401e73de60","observation_id":"af7e46f8-ecda-49b8-af04-3f441fd59c3e","resolution":{"observed_at":"2026-08-12T00:50:20.401510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.384652Z","title":"MathVista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":"45ac3593-57e6-401e-868a-4f32bdf5eab9","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.219803Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:6b38509dfeb0b367808a9f650f9df8086e3d23126e041760cb9316f6de8a6fb3","observation_id":"2659ab9f-0bc5-4bfb-bbd5-c13dde02c5d8","resolution":{"observed_at":"2026-08-12T00:50:20.389142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.372219Z","title":"HoloAssist: An egocentric human interaction dataset for interactive AI assistants in the real world,","venue":null,"work_id":"e6bc48dc-404c-4bfe-952c-0aadb6099284","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.223759Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a34e2f07a6010268c81b1f728876c1b5338e4793aab38c81df0cf2b62115fb06","observation_id":"fab0333c-8dcf-4f0b-a835-2e2417777199","resolution":{"observed_at":"2026-08-12T00:50:20.376588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.359510Z","title":"WearVQA: A visual question answering benchmark for wearables in egocentric authentic real-world scenarios,","venue":null,"work_id":"add6423f-6293-40e8-9bb5-fbc7155111e7","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.228109Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:845cd9ebed58f4ad8ac53452717726b60ebffed6e31d380f28fb5ee97752dd2b","observation_id":"92215827-6b85-4a43-9454-1c9eaaba8522","resolution":{"observed_at":"2026-08-12T00:50:20.364074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22683","last_updated":"2026-04-09T08:16:21Z","snapshot_observed_at":"2026-08-11T13:27:58.809108Z","submitted_at":"2026-02-26T06:55:48Z","title":"SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22683","snapshot_observed_at":"2026-08-12T00:50:19.232005Z","title":"SuperGlasses: Benchmarking vision language models as intelligent agents for AI smart glasses,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.232005Z"},"links":{"cited_paper":"/paper/2602.22683","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:15a56edb0a1d946bd842f2c218a936a6d1411a2b300da34a4490168a5bd7995c","observation_id":"ea3fede4-c24d-4cf7-a57f-7641895da963","resolution":{"observed_at":"2026-08-12T00:50:19.232005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.238653Z","title":"CRAG-MM: Multi-modal multi-turn comprehen- sive RAG benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.238653Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:c7afda35797b72039f41aeb6150fba4264c958fc27b7ba81929077c72130ed12","observation_id":"9510abb9-44a5-4dd3-aab4-f6334dcd9568","resolution":{"observed_at":"2026-08-12T00:50:19.238653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.347516Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":"f618e5bc-1f69-4fc9-b009-e0dd17930218","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.242494Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:52e2807ff56d32fb06c9517b53828a50fae8bbcdd7ad80680124010c99655d38","observation_id":"d117e68e-2597-4511-8a8f-cd4b438c1b90","resolution":{"observed_at":"2026-08-12T00:50:20.351783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.335550Z","title":"MISAR: A multimodal instructional system with augmented reality,","venue":null,"work_id":"7d000b8a-ab4b-410e-aa6c-4b6210c391d4","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.246484Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9c6f3a6f1398d1351417ec1988ae4bb3d88f1773766f28e0c1faf39a32cd3ed2","observation_id":"a41e1861-e52a-4ab1-ba2f-2da8df2db08a","resolution":{"observed_at":"2026-08-12T00:50:20.339738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.324274Z","title":"Guided Reality: Generating visually-enriched AR task guidance with LLMs and vision models,","venue":null,"work_id":"b32361a7-13ae-4472-8b2f-3ca8ced63a94","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.250850Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0fbb56f68bdec0dd5cb96df07808b7488b83a817aa5b15feda3d35885ffcf4b8","observation_id":"e10d0e33-8929-4845-b0c5-9b401e07c111","resolution":{"observed_at":"2026-08-12T00:50:20.328278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08158","last_updated":"2025-03-11T21:54:08Z","snapshot_observed_at":"2026-08-12T23:03:08.585048Z","submitted_at":"2024-08-15T13:48:44Z","title":"EmBARDiment: an Embodied AI Agent for Productivity in XR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08158","snapshot_observed_at":"2026-08-12T00:50:19.254659Z","title":"EmBARDiment: An embodied AI agent for productivity in XR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.254659Z"},"links":{"cited_paper":"/paper/2408.08158","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:88e07c4d7775a7bb44d6a3a0cca8bc1232ea9f9c6c195bb41ea1eeb7c8bf8ca6","observation_id":"54592885-ffbf-410c-9493-1fea13cc1cd7","resolution":{"observed_at":"2026-08-12T00:50:19.254659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.311716Z","title":"GazePointAR: A context-aware multimodal voice assistant for pronoun disambiguation in wearable augmented reality,","venue":null,"work_id":"f4872e1a-ab0c-4745-9903-2262da31da69","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.261066Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:0654f8a5809d8bb452b282982bfbe2d7b2b2a509ce09f2fa71a7b0e4a7a37c9f","observation_id":"ef168b0b-05ee-4c8c-acfc-835114242bdf","resolution":{"observed_at":"2026-08-12T00:50:20.315950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08774","last_updated":"2025-08-12T09:20:20Z","snapshot_observed_at":"2026-08-09T23:41:04.483120Z","submitted_at":"2025-08-12T09:20:20Z","title":"Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance","version":1},"cited_work":{"arxiv_id":"2508.08774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.08774","snapshot_observed_at":"2026-08-12T00:50:19.694288Z","title":"Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance","venue":"cs.AI","work_id":"81ef696d-ef4b-44d1-8720-4820aa4ae975","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.265562Z"},"links":{"cited_paper":"/paper/2508.08774","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:87a5d07133bb83fffce6f95c0390e4ac45ad6f7b7b492d6e3cd04e4cd43b644d","observation_id":"743d7ba5-8ffe-416b-9a38-98f7ed88fb16","resolution":{"observed_at":"2026-08-12T00:50:19.701778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15604","last_updated":"2025-02-21T17:19:39Z","snapshot_observed_at":"2026-08-07T17:57:58.215976Z","submitted_at":"2025-02-21T17:19:39Z","title":"Cross-Format Retrieval-Augmented Generation in XR with LLMs for Context-Aware Maintenance Assistance","version":1},"cited_work":{"arxiv_id":"2502.15604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15604","snapshot_observed_at":"2026-08-12T00:50:19.671938Z","title":"Cross-Format Retrieval-Augmented Generation in XR with LLMs for Context-Aware Maintenance Assistance","venue":"cs.IR","work_id":"5c95cdf2-b484-4ac9-ae72-4b83ad88f369","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.270631Z"},"links":{"cited_paper":"/paper/2502.15604","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:f503f6deaa3e60c8cd513602d4470d4d8b715fd3fe148a76cc910fd99648f42c","observation_id":"01dd9cdc-092c-4bb0-bc95-48c813e8338f","resolution":{"observed_at":"2026-08-12T00:50:19.676748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15624","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.649111Z","title":"Exploring the use of VLMs for navigation assistance for people with blindness and low vision,","venue":null,"work_id":"51ae223a-af55-44fc-91ff-dc8c704c6e8f","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.275112Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:63b34f51cea3acabe1aa4117f4f8dbd64ba34837e3c84117167aa19da060363f","observation_id":"6676f53c-2d73-4ea9-8c37-0990526deebc","resolution":{"observed_at":"2026-08-12T00:50:19.657100Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06010","last_updated":"2025-09-07T10:58:17Z","snapshot_observed_at":"2026-08-11T02:07:27.096236Z","submitted_at":"2025-09-07T10:58:17Z","title":"BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users","version":1},"cited_work":{"arxiv_id":"2509.06010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06010","snapshot_observed_at":"2026-08-12T00:50:19.564824Z","title":"BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users","venue":"cs.CV","work_id":"ae23c111-a4f0-4ad8-9a13-05c0186db608","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.280108Z"},"links":{"cited_paper":"/paper/2509.06010","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:43346516e01eaeecdb957f662898dcf8620067d277d3e613208c340ff4ad8c02","observation_id":"ed1391d9-df16-421e-b77a-79a1b2965b96","resolution":{"observed_at":"2026-08-12T00:50:19.569534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.300112Z","title":"Objective assessment of the webp image coding algorithm,","venue":null,"work_id":"5ca601c6-c02f-4c71-ba3c-16228e640b05","year":2012},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.284581Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:cb41af9e9097543f48cad696ea35d581c3766d442090590a6010e370c62f88d6","observation_id":"22753e43-642f-43cd-833a-286ca03f7fa5","resolution":{"observed_at":"2026-08-12T00:50:20.304358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.288910Z","title":"Vision - claude api docs,","venue":null,"work_id":"9c655e24-e2bb-4378-95d1-577e828477a6","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.288751Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:bf9587ab82b518b09ca26df60e40c6603368bec2d0adc83f75134b4a2266de81","observation_id":"01bace46-f84d-4361-85c5-794780a21227","resolution":{"observed_at":"2026-08-12T00:50:20.292984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.276734Z","title":"Image understanding — gemini api,","venue":null,"work_id":"bb2e02be-be84-4b2c-92aa-283b6be7bd0b","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.292821Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b5d5d16d051f8a3fce6149b1e85455bb54f15fbaf151630979df7326122cb41f","observation_id":"fa6fb7df-483a-4d21-956c-805c2a386197","resolution":{"observed_at":"2026-08-12T00:50:20.281030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.264128Z","title":"Image interpolation and resam- pling,","venue":null,"work_id":"56386a04-d452-4f0f-85d0-4ac2f52a5450","year":2000},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.297025Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:d2e84c5289a2e6073d5b5fac9eed289581abbd76ff31553929d0988c2968a648","observation_id":"41af0a65-9a0f-4dd8-8072-cab64b6cb2a6","resolution":{"observed_at":"2026-08-12T00:50:20.268208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.251052Z","title":"Colorbench: Can vlms see and understand the colorful world? a comprehensive benchmark for color perception, reasoning, and robustness,","venue":null,"work_id":"f0b6492c-6794-4f2e-8d0c-dc350cc2d342","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.301374Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:412a7ca65fb2bfb5fa7781e1649fb4f6c74861ea92c2f905073dc6814b225e29","observation_id":"f99b59f9-f810-4d14-8e34-e9a36a3fd0cd","resolution":{"observed_at":"2026-08-12T00:50:20.256188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.237453Z","title":"V oila-a: Aligning vision-language models with user's gaze attention,","venue":null,"work_id":"bcd3d103-6240-47dd-87c7-a97fbf4a95fb","year":1918},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.306560Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:90e1f3dd24d4ec589bdebeb9859e4756c300a7385a83cef1ff5fcc9f0093d9aa","observation_id":"6c8b19a3-96f7-42bb-86d6-9061eba41935","resolution":{"observed_at":"2026-08-12T00:50:20.242817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.223726Z","title":"EgoVQA—an egocentric video question answering benchmark dataset,","venue":null,"work_id":"23eb9e09-acab-4892-97ba-742300e9f6a5","year":2019},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.310732Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:7625baffffdb843d4d98ab378173138355e5efe714331d8ea12348f52369e83f","observation_id":"f87e2bc5-b3fd-4be5-8c95-6ba2989c591d","resolution":{"observed_at":"2026-08-12T00:50:20.228121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.212040Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":"cc12ddc3-9b6f-4ada-a463-00bcfefd4055","year":2016},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.314944Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:8de912f4b695ce883507d70845dbd5033f92f7b882b8194a05b5adb5ca13c28a","observation_id":"9bf1c15d-5ff4-405f-8e17-d64dfc0701e2","resolution":{"observed_at":"2026-08-12T00:50:20.216201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.200518Z","title":"What are tokens and how to count them?","venue":null,"work_id":"e3cdff72-7fd8-4a8d-aba2-ed988775de96","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.319134Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:935fc703cd3252192c88a561a205e738ddc34aaf0af2fcfa70b2b8fd78d723ef","observation_id":"2fd64ec6-85d1-4967-b5d8-38c431fa085d","resolution":{"observed_at":"2026-08-12T00:50:20.204919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.188285Z","title":"Saliency based image crop- ping,","venue":null,"work_id":"6d9f7e98-6cf9-4eed-bef2-c4aa5caee9b2","year":2013},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.323268Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9f912daa0fe2216704be28c9099dc9eb076144878693e58dbcc6c3adffdbe076","observation_id":"5da132dd-8582-4cbc-8c93-f29ca696bc7f","resolution":{"observed_at":"2026-08-12T00:50:20.192706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.174841Z","title":"Benchmarking deep learning models for object detection on edge computing devices,","venue":null,"work_id":"44fa5605-bd00-4d50-915c-7c41eeacd0cc","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.327140Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:87d836253ec801e01f8bdacf36833cfc272d4fd925a100552e182931f327c75e","observation_id":"2794bdd8-29c7-47b4-a08d-47226a09f943","resolution":{"observed_at":"2026-08-12T00:50:20.179180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.162326Z","title":"Region-of-interest extraction method to increase object-detection performance in remote monitoring system,","venue":null,"work_id":"37915ada-c54a-4c5c-98f6-768ff6d58bd1","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.330909Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:04cd6a8bec645c98c6158f5d95648cd6d8b6354413156f61a8609c22bc102dde","observation_id":"89aca3b1-210a-4f3c-a678-ffd30360e0e6","resolution":{"observed_at":"2026-08-12T00:50:20.166519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.149986Z","title":"Improving automatic VQA evaluation using large language models,","venue":null,"work_id":"f7e0b93b-732f-4ca5-8033-2ba2db238b47","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.335462Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:604c2e7463b6bf44c7ba993256f460c5285254d93764733a905c5a824500ff2d","observation_id":"d50df610-97c5-461a-ad07-33e8fbcfb191","resolution":{"observed_at":"2026-08-12T00:50:20.154479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.137674Z","title":"Mind the uncertainty in human disagreement: Evaluating discrepancies between model predictions and human responses in vqa,","venue":null,"work_id":"af311bf5-b19b-46de-8e2f-2c65f821f42a","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.339617Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:718c4e9748ee71365d102fc1342d6eab2398606975a11e83c43602c9160730fe","observation_id":"33234788-e51a-4184-b466-9825241e5b41","resolution":{"observed_at":"2026-08-12T00:50:20.142051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.122568Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,","venue":null,"work_id":"9c4ff41e-ec8c-4c08-bccc-00beabe63dfa","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.344182Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a449abb1309b8b36699f7918acf95cce0b40032301d017f31e249a9593dcc8e4","observation_id":"0f4ff4da-137d-44ba-8cf0-faab0953198f","resolution":{"observed_at":"2026-08-12T00:50:20.128003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.107710Z","title":"G-Eval: NLG evaluation using GPT-4 with better human alignment,","venue":null,"work_id":"f05628de-ca38-4cf1-9a57-aefac5b8cf91","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.348271Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b0e10b9497f78472dabd8c2d7ed3c1b2b90b325816bb71e2bad4b9b448084ba9","observation_id":"afd1f3e0-03c3-4560-98cf-b74131d5675a","resolution":{"observed_at":"2026-08-12T00:50:20.113194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.094930Z","title":"Chatar: Conversation support using large language model and augmented reality,","venue":null,"work_id":"84e1dbd4-24d6-4dd8-a42f-77d45c3f2e01","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.352344Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:39efe21a14879dc179a9ae0aad5735bbe5b922be294fa263a34f3926948e29e2","observation_id":"57d015c5-2614-4081-8fbc-ef1c06409793","resolution":{"observed_at":"2026-08-12T00:50:20.099459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.080824Z","title":"Next-generation networking and edge computing for mixed reality real-time interactive systems,","venue":null,"work_id":"8ca25653-3d32-4f47-98c1-4749345d0c7e","year":2020},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.356200Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:aa2566ede27ecdc441287f97086f404911127c1e3c732b19193a578ea4567c74","observation_id":"0db091eb-cd22-4e25-9b2a-5515d36fb4b3","resolution":{"observed_at":"2026-08-12T00:50:20.086379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.066809Z","title":"An egocentric vision-language model based portable real-time smart assistant,","venue":null,"work_id":"91f4eced-9d44-410c-bf25-b0ed0ec84a37","year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.360215Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:7a91273bb95b9012f4375b2ec5728f9b7e3a70c191d3c7e93c13d9c77f1e4821","observation_id":"43a2847e-f2a4-4cdc-866c-3ed4e713706d","resolution":{"observed_at":"2026-08-12T00:50:20.071213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.364187Z","title":"Teaching LLMs to see and guide: Context-aware real-time assistance in augmented reality,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.364187Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a863d56b30fc0323321b5599e4ba91a389f7681284c4ce533da734ef3c8fd772","observation_id":"4cbd87af-581d-45c3-a2de-fb96d7c5dbfa","resolution":{"observed_at":"2026-08-12T00:50:19.364187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.052991Z","title":"Gartner predicts 80% of enterprise software and applications will be multimodal by 2030, up from less than 10% in 2024,","venue":null,"work_id":"a0ed781e-16af-4de4-9b70-b43802242d4e","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.368841Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:3becd6f3082471b19ee3042488be05accb4221d2c4d9e42d35a5e81a28052170","observation_id":"3999f9fc-18db-49bc-85a5-767882c1d7fb","resolution":{"observed_at":"2026-08-12T00:50:20.057437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.372822Z","title":"Deep learning-based object detection in augmented reality: A systematic review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.372822Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:9e1a12085f0fb750b7c9fdde7669279e61297726097bc1c64040d7e69bc678f7","observation_id":"9ad2d767-1a29-49bb-8fc9-b5b4f177566a","resolution":{"observed_at":"2026-08-12T00:50:19.372822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.031876Z","title":"Realtime API with WebRTC,","venue":null,"work_id":"603f7cfd-2c59-4d33-a5ca-ef77ab020254","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.376497Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:25a6ada089eda953f8c38197c07c33f2330523290c1323cdd04b3a90a81223e4","observation_id":"b3c695f9-5789-4416-885c-8d6bf76902b8","resolution":{"observed_at":"2026-08-12T00:50:20.036424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:20.016909Z","title":"Realtime API with WebSocket,","venue":null,"work_id":"41c2ea42-2725-4bf3-9be4-99492d5b042d","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.380300Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:171c37a73c6e1547ed31ca039d6c55d63ff50e9990a9e28dd442e43f189f2194","observation_id":"2437408b-3e1a-4cee-9a4e-18cefaaabc6c","resolution":{"observed_at":"2026-08-12T00:50:20.022217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.999660Z","title":"Bench- marking the effects of operating system interference on extreme-scale parallel machines,","venue":null,"work_id":"32f73ae0-5347-4728-a889-b2289712031a","year":2008},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.384617Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:45f7b916e66a0689b182d44a14ed246ba340ea87f8a2b2d71af0c30f8aa7f4dd","observation_id":"0b4103ae-d36f-4f62-b6d0-c6c63b65fa68","resolution":{"observed_at":"2026-08-12T00:50:20.006413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.986029Z","title":"Understanding the causes of performance variability in HPC workloads,","venue":null,"work_id":"b502aa95-007c-429a-a822-4ceb689d5cfd","year":2005},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.389165Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:4927a359eb964d1f65f0aba2072770e32c9e4f4d64b33e3f78771981662a302f","observation_id":"1f047041-fa3f-4727-9554-0090e9e3532e","resolution":{"observed_at":"2026-08-12T00:50:19.990984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05491","last_updated":"2024-11-08T11:43:40Z","snapshot_observed_at":"2026-08-12T22:04:53.394807Z","submitted_at":"2024-11-08T11:43:40Z","title":"Overhead Measurement Noise in Different Runtime Environments","version":1},"cited_work":{"arxiv_id":"2411.05491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.05491","snapshot_observed_at":"2026-08-12T00:50:19.459574Z","title":"Overhead Measurement Noise in Different Runtime Environments","venue":"cs.PF","work_id":"38d22c6b-ea95-4499-8321-2c5142df3319","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.392944Z"},"links":{"cited_paper":"/paper/2411.05491","citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:e454747505df6ca3bdd21c211ba713ad920d13ec65043e26fcbafa6e1d6e6c9e","observation_id":"129c06b6-3e73-46a7-b6b0-c9eac695ac01","resolution":{"observed_at":"2026-08-12T00:50:19.466260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.972142Z","title":"Using microbenchmarks to evaluate system performance,","venue":null,"work_id":"117e4358-6763-40b4-813a-99e39815e2c4","year":1992},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.397014Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:b21330b0f0aae7166ee9aaadd05f2b37d428bc61d132ec7be5e0d1fa8b4a6168","observation_id":"b5e9adb5-74f6-44ab-8670-c8f301c10ab1","resolution":{"observed_at":"2026-08-12T00:50:19.976627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.957311Z","title":"Beyond inference: Performance analysis of DNN server overheads for computer vision,","venue":null,"work_id":"9fa12a0f-ea29-4344-88da-22ba6d5480a1","year":2024},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.400903Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:c29bac2655887e1f85cf9c2a81aff1ba377feabcb46c73d7514d33f05c951d3b","observation_id":"308695cf-3a57-4dd8-945a-a254dd5502f4","resolution":{"observed_at":"2026-08-12T00:50:19.962037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.944342Z","title":"EdgeYOLO: An edge-real- time object detector,","venue":null,"work_id":"74e74146-0f10-4604-86ca-1078a22890f8","year":2023},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.405290Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:794121dc69adf25a563b7e2911022909b45dd2285b1ef7b4c7757efb3a802e55","observation_id":"199f6712-add6-4936-95dd-b41d3f3fd1a6","resolution":{"observed_at":"2026-08-12T00:50:19.948887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.930175Z","title":"Images and vision — calculating image tokens","venue":null,"work_id":"23f98a67-14ff-4012-b55c-91a10b1c9987","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.409358Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:8b9460a2cec9468931a07f0879d6c8979077a4520e0aa41aaf0aed2e1988ae38","observation_id":"464bb5f5-a174-40fb-860b-14cfe70ae457","resolution":{"observed_at":"2026-08-12T00:50:19.935016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.915735Z","title":"Per-part media resolution (Gemini 3 only)","venue":null,"work_id":"4954235a-709c-4f14-9aaf-c07ff640b22e","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.413398Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:1fbe4881e2c0b61b4806b20a7906c5af262a8f8b9a472c316bc741839e61e56b","observation_id":"7d4d740a-2e86-46f3-b44f-b283bba3fcf4","resolution":{"observed_at":"2026-08-12T00:50:19.920442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.899881Z","title":"Gemini 3 Flash — model documentation","venue":null,"work_id":"1ddb10df-455d-4af1-8317-96115ea7da2f","year":null},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.417282Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:a842b852d5718ad1079a93405c63bcca5ef1e68c0cd6cbf99046498260f1d13c","observation_id":"279c4101-1146-4c54-a220-213d08828304","resolution":{"observed_at":"2026-08-12T00:50:19.904265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.872146Z","title":"Gemini 3 developer guide — generateContent API","venue":null,"work_id":"1d0c15c5-152d-45e4-a790-8c3cebb530b4","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.424861Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:f033227cbe7b0dedcceef278d789325620a52eb5edbf0e9eeb0eb333fd57c945","observation_id":"6e963d5a-b3a1-4dab-97b1-0a1dc045532d","resolution":{"observed_at":"2026-08-12T00:50:19.877165Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:19.886935Z","title":"Accessed: 2026-05-28","venue":null,"work_id":"230653da-cc46-421c-9f28-7ba2278ce1f9","year":2026},"citing_paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:19.421183Z"},"links":{"citing_paper":"/paper/2608.07861"},"observation_digest":"sha256:173bc3475e5ce69929c0b2c300a922d63de11ee7254842aca0d699071f328d04","observation_id":"b0674577-89e0-4df8-88f0-db6abe44eb2d","resolution":{"observed_at":"2026-08-12T00:50:19.891144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07861","last_updated":"2026-08-08T01:58:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:22:00.925012Z","submitted_at":"2026-08-08T01:58:13Z","title":"How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":6,"verified_fuzzy":62},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2608.07861."}