{"as_of":"2026-08-21T22:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94623e318bd9960047ec226fa336d66682c1c1a2fa12adf7a5a2ec179f227e32","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:08:27.096029Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:34:36.466548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T22:17:26.215530Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"cited_work":{"arxiv_id":"2605.19307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19307","snapshot_observed_at":"2026-07-02T22:17:26.215530Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","venue":"cs.CV","work_id":"a2e131ef-d71f-4d46-b5b1-de8a3a0d6455","year":2026},"citing_paper":{"arxiv_id":"2606.08394","last_updated":"2026-06-07T01:11:36Z","snapshot_observed_at":"2026-08-15T10:24:14.510087Z","submitted_at":"2026-06-07T01:11:36Z","title":"When Correct Decisions Hide Internal Stress: Decision-State Probing in Multimodal Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T19:02:12.613002Z"},"links":{"cited_paper":"/paper/2605.19307","citing_paper":"/paper/2606.08394"},"observation_digest":"sha256:feb4f5d3eaca8c37834f3145095620504ef49bb12c80cf0058934a410ad4f9d2","observation_id":"4fea7622-0c1b-439b-9834-694c03244021","resolution":{"observed_at":"2026-07-02T22:17:26.216885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19307","snapshot_observed_at":"2026-08-08T04:25:12.551331Z","title":"Metara: Metamorphic robustness assessment for multimodal large language model-based visual question answering systems.arXiv preprint arXiv:2605.19307, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05675","last_updated":"2026-08-07T04:01:19Z","snapshot_observed_at":"2026-08-14T09:41:31.249443Z","submitted_at":"2026-08-06T07:14:58Z","title":"Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T04:25:12.551331Z"},"links":{"cited_paper":"/paper/2605.19307","citing_paper":"/paper/2608.05675"},"observation_digest":"sha256:1ca7f3b60729d208325f4815d5cfb2c0cbb22dd5038ab6d960c960af75ffb0d5","observation_id":"324b48c5-fe9a-4e47-8523-173af80dcf8c","resolution":{"observed_at":"2026-08-08T04:25:12.551331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19307","snapshot_observed_at":"2026-08-10T04:34:36.466548Z","title":"Metara: Metamorphic robustness assessment for multimodal large language model-based visual question answering systems.arXiv preprint arXiv:2605.19307, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05675","last_updated":"2026-08-07T04:01:19Z","snapshot_observed_at":"2026-08-14T09:41:31.249443Z","submitted_at":"2026-08-06T07:14:58Z","title":"Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T04:34:36.466548Z"},"links":{"cited_paper":"/paper/2605.19307","citing_paper":"/paper/2608.05675"},"observation_digest":"sha256:6bb4e31100c9cc322c8e56a889020fcd9f5bfd5382316004ccbb5da124c51d1e","observation_id":"a8b007b0-eb69-4c28-b9b1-17c8f2156e70","resolution":{"observed_at":"2026-08-10T04:34:36.466548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19307/citation-record","integrity":"/paper/2605.19307/integrity","json":"/paper/2605.19307/citation-record.json","paper":"/paper/2605.19307"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"StoryLLaV A: Enhancing visual storytelling with multi-modal large language models","venue":null,"work_id":"f08efe07-932c-410a-bdd3-197c9f65c081","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:c0056d678ed2c0527703bb8e0587bc52a60dbfd42c38400193a43899522b4e59","observation_id":"40a77528-40e2-4d85-a656-377706929da9","resolution":{"observed_at":"2026-05-20T07:13:23.630099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refined semantic enhancement towards frequency diffusion for video captioning","venue":null,"work_id":"e071614e-8785-457c-b811-782faa1fa9e5","year":2023},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:d1c5822161f67eadd72a7e1e9bca3ea9e7041a2032f8ea4d204462a66af7103f","observation_id":"a32790f2-14ba-4cbe-a9c0-7e9a045cc975","resolution":{"observed_at":"2026-05-20T07:13:23.634289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action-aware linguistic skeleton optimization network for non-autoregressive video captioning","venue":null,"work_id":"44cfd3c2-3ede-4f8f-ad75-5eafb5291a1a","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:53f3081bef18dec2663f6813089dd2d3076686476f0411c82f860f115f269452","observation_id":"e0a285ca-b2af-408a-9789-2ffe8a79dd31","resolution":{"observed_at":"2026-05-20T07:13:23.615134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VQA: Visual question answering","venue":null,"work_id":"f7819c0b-dfde-4979-8c93-78959834179a","year":2015},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:0d83f3db2684b518818c1e039ccc05fdde0e61faeb74b045963b9e15d68a690c","observation_id":"2cb57102-b457-4f1f-afab-e295cbfff7bb","resolution":{"observed_at":"2026-05-20T07:13:23.637677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"a31aa438-93e1-4239-aae4-79466a86c74a","year":2017},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:9a6f5d608837b9a02032382e6bbc634ab98de5605366b44df4a08fdfa5999319","observation_id":"366adef9-3c3d-4ed0-9bff-125b5d6fcf40","resolution":{"observed_at":"2026-05-20T07:13:23.659541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust visual question answering: Datasets, methods, and future challenges","venue":null,"work_id":"60221467-3286-4b76-b0fe-6b047baf83a4","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:1966963f190b3db3dbac48161556cc6ce9bdf865fe61f25df49a6eee0617376c","observation_id":"b8403d03-2906-4045-9077-0d8bc97bb874","resolution":{"observed_at":"2026-05-20T07:13:23.648452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12543","last_updated":"2020-02-28T04:47:31Z","snapshot_observed_at":"2026-08-14T05:31:36.259685Z","submitted_at":"2020-02-28T04:47:31Z","title":"Metamorphic Testing: A New Approach for Generating Next Test Cases","version":1},"cited_work":{"arxiv_id":"2002.12543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12543","snapshot_observed_at":"2026-07-04T12:39:49.230696Z","title":"Metamorphic testing: a new approach for generating next test cases","venue":null,"work_id":"86215440-bb96-48e8-ad27-6b8279b56e9f","year":2002},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2002.12543","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:68f99a60dd79367275468c34bcd0771a4971c085320c89a464f59b2275379e8f","observation_id":"9b409ebb-1613-4226-8bee-c783736fb4ae","resolution":{"observed_at":"2026-05-20T07:13:06.636646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KVQA: Knowledge- aware visual question answering","venue":null,"work_id":"a83ec1df-a1d1-45e3-aab2-0feffcaf1437","year":2019},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:043cd794424a49ad58f907b56772be6105ee82c70f3566cb8bcf35ef5c0d73fc","observation_id":"a3cc4d09-97ab-47bc-bca5-3d667ce72d19","resolution":{"observed_at":"2026-05-20T07:13:23.619540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OCR-VQA: Visual question answering by reading text in images","venue":null,"work_id":"0e7674d9-8999-4d66-bad8-dba528eadab7","year":2019},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:91b6be16c0467f94aa7ff21d47123fd4cb60f14e9e635b190df87c7bdc98986a","observation_id":"7b58c1b2-cab4-4b3d-8450-7f94e5fc5db4","resolution":{"observed_at":"2026-05-20T07:13:23.613066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metamorphic testing: A review of challenges and opportunities","venue":null,"work_id":"e5fbefb5-f770-4755-aff1-177a50fe8ce6","year":2018},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:9cd47b50b3c19214e9d594d01024082eb9ed802851b26a85bc5210db6a241c13","observation_id":"5a800ab6-245b-4278-a216-2196e09496fe","resolution":{"observed_at":"2026-05-20T07:13:23.635651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perception matters: Detecting perception failures of VQA models using metamorphic testing","venue":null,"work_id":"b8347484-d42c-4091-a121-d21d6a051851","year":2021},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:8a47613288c91d1abd2c5d8f92b4cd82d91867de4dc43b0b7885e852cb01e493","observation_id":"eba38e50-7dcd-4ad7-a71b-1bc60426b74b","resolution":{"observed_at":"2026-05-20T07:13:23.655114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metamorphic testing of image captioning systems via image-level reduction","venue":null,"work_id":"37a94b0e-103a-4ded-bd67-ee029835ee2b","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:613c7e90c98c87146415af90294a6cb19d1fb93bc33cc4d5b0267398ca8fae07","observation_id":"b1ea812e-da81-412c-8d65-ec0f9b9bbedd","resolution":{"observed_at":"2026-05-20T07:13:23.617226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13945","last_updated":"2024-12-21T15:21:27Z","snapshot_observed_at":"2026-08-16T13:59:00.394606Z","submitted_at":"2024-04-22T07:41:41Z","title":"How Multi-Modal LLMs Reshape Visual Deep Learning Testing? A Comprehensive Study Through the Lens of Image Mutation","version":3},"cited_work":{"arxiv_id":"2404.13945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.13945","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How multi- modal LLMs reshape visual deep learning testing? A comprehensive study through the lens of image mutation","venue":null,"work_id":"149f82d8-3569-48bd-b131-665e05723a74","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2404.13945","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:0a0ced870d5683e4479441af05bbe8a3ef39adb02d47a418545594d3a5a6fc28","observation_id":"defa4c4a-2175-4611-ba56-e3c7800fc10c","resolution":{"observed_at":"2026-05-20T07:13:06.627458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP in mirror: Disentangling text from visual images through reflection","venue":null,"work_id":"2c2babc3-5432-4eda-8759-74af88519ba3","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:65a03ba689c5c2682e32f880a40ad95b984e4e3a2df367099d2ca21d1f20fc4c","observation_id":"b2b34d11-a9fa-41aa-b0ab-9409456710bf","resolution":{"observed_at":"2026-05-20T07:13:23.638490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16983","last_updated":"2024-10-22T13:05:11Z","snapshot_observed_at":"2026-08-17T18:21:25.692848Z","submitted_at":"2024-10-22T13:05:11Z","title":"Order Matters: Exploring Order Sensitivity in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2410.16983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16983","snapshot_observed_at":"2026-07-04T20:40:07.562350Z","title":"Order matters: Exploring or- der sensitivity in multimodal large language models","venue":null,"work_id":"6abdd4e1-26e5-4271-8ad3-3f1cea6a0fc4","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2410.16983","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:de452d51969e506e13c4a9e30eb11c4a29ccf387a529507ede7f8dfebc4fca08","observation_id":"dc90bcf0-16f3-4835-91ad-7c23000b50c4","resolution":{"observed_at":"2026-05-20T07:13:06.643279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"4d391bf3-0d34-41ab-b9ad-66fb3981f619","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:d6940e3031322a2750d4984c6c5c2cad43aa09ac42943dab1d856db76364eb65","observation_id":"9cad04b3-a962-45c0-b40b-1064c7646f41","resolution":{"observed_at":"2026-05-20T07:13:23.608107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:e9c0451bc540dc465286f3cce575aa53afa09855973fe2ac2d2c7f358caecd66","observation_id":"d17fc3ed-8c8e-4869-ab75-3499af4d8a91","resolution":{"observed_at":"2026-05-20T07:13:06.658617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:775e3d928a40d7162c9001cbed57086c1276156c5833c12a92c99eeca4a43975","observation_id":"7d250587-ca1f-4825-ba6a-0dc71fcb901f","resolution":{"observed_at":"2026-05-20T07:13:06.633393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:c8fac9c883a31811e885cbcc84b03017bdbe635400d3d0c47540407061815f57","observation_id":"f4dfff8c-3e48-48d0-9efa-f8f3188e200c","resolution":{"observed_at":"2026-05-20T07:13:06.624537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-modal retrieval for knowledge-based visual question answering","venue":null,"work_id":"6c3292ab-ba1b-47d1-a291-8ae23ffb33e6","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:dc4151e0554fd4f7a65259e03c1c132da4a8d341a0130cc7b9ac0350456df6fa","observation_id":"3f4fcffa-d64c-4203-9598-e9edc0a06f77","resolution":{"observed_at":"2026-05-20T07:13:23.651294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08876","last_updated":"2024-10-14T20:31:13Z","snapshot_observed_at":"2026-08-18T18:39:38.744680Z","submitted_at":"2024-10-11T14:51:00Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models","version":2},"cited_work":{"arxiv_id":"2410.08876","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08876","snapshot_observed_at":"2026-07-09T12:46:14.741586Z","title":"RoRA-VLM: Robust retrieval-augmented vision language models","venue":"cs.CL","work_id":"48d42e0d-c351-4823-a47e-fe49fe58a3d1","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2410.08876","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:7fdf639e6a1184a4699907cafeddd9d0a6fb20f888c6fba4bd796d6851a484f5","observation_id":"7299ff26-4b25-4e92-934d-911836cd0826","resolution":{"observed_at":"2026-05-20T07:13:06.630472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoSight: Advancing visual-language models with wiki knowledge","venue":null,"work_id":"9b4027f0-161d-45b8-9ae8-4b4f5f51f963","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:ac6003edbabbb493fe6198afdadaf8722f9658e90d1426e1a3e00d391dde7ecf","observation_id":"e8c68954-cbd3-404f-b165-107084698c7f","resolution":{"observed_at":"2026-05-20T07:13:23.601543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wiki-LLaV A: Hierarchical retrieval-augmented generation for multimodal LLMs","venue":null,"work_id":"f68a1732-9f45-4aae-b4f9-25e5eeb67d8d","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:043c0c9184c03d171b8939357d4a4f20bde69b402588b9514d9db9ffcbc05b98","observation_id":"9863a52e-f48c-4a4f-be88-930f525f8f76","resolution":{"observed_at":"2026-05-20T07:13:23.628216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Augmenting multimodal LLMs with self-reflective tokens for knowledge- based visual question answering","venue":null,"work_id":"8aac2036-7973-4fe5-bc16-37474f69eada","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:d8c5ddf04de8bc6698d0878b32986d3af6d1474391761459d513ecd022a05bf6","observation_id":"9d401e5e-077c-4c7f-b864-2c7217f1b398","resolution":{"observed_at":"2026-05-20T07:13:23.608935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20964","last_updated":"2025-07-08T07:47:57Z","snapshot_observed_at":"2026-08-16T12:54:19.079626Z","submitted_at":"2025-02-28T11:25:38Z","title":"Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering","version":3},"cited_work":{"arxiv_id":"2502.20964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20964","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained retrieval- augmented generation for visual question answering","venue":null,"work_id":"6a9856f8-afea-42c3-9c7c-7f6ec1f2576f","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2502.20964","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:afbdb3efcc020052f945137b521ea40636fcee4fdf38a5c5ae5670aa4e25655b","observation_id":"5259ee6c-ea88-4d77-949b-dbb3da6fd157","resolution":{"observed_at":"2026-05-20T07:13:06.621722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10074","last_updated":"2025-04-20T17:16:02Z","snapshot_observed_at":"2026-08-17T20:33:26.633181Z","submitted_at":"2025-04-14T10:19:47Z","title":"MMKB-RAG: A Multi-Modal Knowledge-Based Retrieval-Augmented Generation Framework","version":3},"cited_work":{"arxiv_id":"2504.10074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10074","snapshot_observed_at":"2026-07-09T12:46:14.735850Z","title":"MMKB-RAG: A multi-modal knowledge-based retrieval-augmented generation framework","venue":"cs.AI","work_id":"01626bc0-4376-447b-a0e9-34d11522f746","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2504.10074","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:1eef40138f9424eeac57fc3d24072f09d1212b1985aa96020b8a049a82225cfc","observation_id":"9537564a-1628-4075-be86-33cee8c52a11","resolution":{"observed_at":"2026-05-20T07:13:06.649910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.761035Z","title":"Knowledge-based visual question answering with multimodal processing, retrieval, and filtering","venue":null,"work_id":"60132425-7c15-43a4-87c2-5811a6d0e8fe","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:454554b515f3cc7afb1a4e2df7b36991e68992842bd6956ef0d2cb3b925652f4","observation_id":"13892cdb-6abd-4c60-a392-2b935ece5dc9","resolution":{"observed_at":"2026-05-20T07:13:06.639865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":"59321e61-2e30-438e-8b2a-f1c0609fde49","year":2023},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:cd9cd24fd8487694aaf126adf9dbb4cc90a53a93434f3beb672ac6cc7a3c3d6b","observation_id":"b93bf570-9e8d-4a8e-a89b-100242817fee","resolution":{"observed_at":"2026-05-20T07:13:23.636496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can pre-trained vision and language models answer visual information- seeking questions?","venue":null,"work_id":"5845bd65-c956-4e83-8aa7-a572ea1f632a","year":2023},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:c87cb70d7a358f0a5d3bfd1efe7623492743af645468bffcc5ac065d7c15e010","observation_id":"23acc7a2-4cb9-4009-8d5d-e0f358c54932","resolution":{"observed_at":"2026-05-20T07:13:23.653221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":"84ce0ecf-2587-40bd-bbb2-de9b01cc3cd4","year":2021},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:38f502351e818809804337c8cb52ba42ddbf49c531d4186c0a2c1d4711ee7acf","observation_id":"a9766a17-b34e-47e8-9e7d-3372be0b1691","resolution":{"observed_at":"2026-05-20T07:13:23.656274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfographicVQA","venue":null,"work_id":"b504294a-7339-403f-98f0-7b2069f5a009","year":2022},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:2b34ffc33dad2bd3123f11faa1294cd2e307b3204f8ceda2a75e0fb367f8c7d7","observation_id":"3036f867-1409-4a0b-893f-5267038a278c","resolution":{"observed_at":"2026-05-20T07:13:23.646361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"44ff93c0-5f9b-4163-bc7d-aee0e121815b","year":2022},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:e1ff1365d27b1fdad395b148a168340d769dc505dcf0a5d159a74bb994a3abd1","observation_id":"1d88c7e6-7f08-4102-8ecc-3990a62686a1","resolution":{"observed_at":"2026-05-20T07:13:23.647414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards VQA models that can read","venue":null,"work_id":"955977aa-5d5e-42b5-922e-40fd9e9fb73b","year":2019},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:3d1c9e77cfb0d2f217fe2550a1cf5f8a77a928b85922499951bd2aec5295ceca","observation_id":"5cb459f8-d775-4233-b51c-dd4dcb55c463","resolution":{"observed_at":"2026-05-20T07:13:23.650510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UReader: Universal OCR-free visually situated language understanding with multimodal large language model","venue":null,"work_id":"5dd4ae33-60e7-4a3a-9615-a5b967350785","year":2023},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:a892ea573b3782acc189bc0900e887d80182afed95e83e9390dbb808e41bc614","observation_id":"fd5e739b-249b-42d0-9330-eeac67f2fecf","resolution":{"observed_at":"2026-05-20T07:13:23.652406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:75702c568eaf9782aa0f6382dc87143169aac71de09f9e48606f6ad6b3cb8405","observation_id":"fd5df8c2-74ca-4768-a2d2-99b61bb009f7","resolution":{"observed_at":"2026-05-20T07:13:06.652683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mPLUG-DocOwl 1.5: Unified structure learning for OCR-free document understanding","venue":null,"work_id":"786199da-ee2c-44bd-b58d-947eef3da412","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:f1e9b9cd9a1404ab5a6b80acc1059edc1897ea34e3950a2eaad4baeeb4f032a6","observation_id":"680c603c-caa9-4fd0-9683-864d36dc43b4","resolution":{"observed_at":"2026-05-20T07:13:23.624050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CogAgent: A visual language model for GUI agents","venue":null,"work_id":"c9b51251-a35a-4153-b3f2-22362eeea4bf","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:3f062ffdb6b7c63992f3bf10673dc846750e2b7d022294cc3172dfe4349e9864","observation_id":"ce0db268-efea-4acc-8ade-478b625b435d","resolution":{"observed_at":"2026-05-20T07:13:23.642170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"168c4ea1-b994-42f5-820c-baee3807db58","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:28db7d33fa4d605c34cf7afb287312183de210aeb62a5300bf984e40ad84b042","observation_id":"eeadb008-120f-4763-8649-c33e6465a655","resolution":{"observed_at":"2026-05-20T07:13:23.654324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-19T13:03:34.686585Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:a08aa3594c1bf16c8213598b04e9ebab0031d2b1696b14ad767ff948f7bbdfa6","observation_id":"c1e3a305-7ffb-4e9a-9c0a-8ffd881c53d2","resolution":{"observed_at":"2026-05-20T07:13:06.655691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-08-19T15:44:20.951516Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:26a071d3097a390c040d5c2cf04515246a55812e0e6747a5bc0e389d12afdc5a","observation_id":"daf5c038-6a87-4bd2-ad6e-2659742359a8","resolution":{"observed_at":"2026-05-20T07:13:06.646603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HRVDA: High-resolution visual document assistant","venue":null,"work_id":"d6018f31-fad9-4e5e-b41f-3faead2e8b68","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:84e49ad9ef76b282d11bd3fc5f1075edbaeb2ab0bdaff50b787bcad64e163fb9","observation_id":"2d8c065b-c51d-464c-8043-09f285768c08","resolution":{"observed_at":"2026-05-20T07:13:23.658689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision- language models","venue":null,"work_id":"99c778fc-cee3-4abc-9c5b-7461e319889f","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:7adabdba5dd684e91ac57c8cbfde8764b764c6c6450f4a1c909e33673d5d63d1","observation_id":"b8946daf-1346-487b-ac91-46bc3862da70","resolution":{"observed_at":"2026-05-20T07:13:23.663478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MM1.5: Methods, analysis & insights from multimodal LLM fine-tuning","venue":null,"work_id":"4aee4bf5-a45c-4e5b-bb8e-7e9ed56e873b","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:ab35b681f7edc0343cfda714398cc9a05dacb8ac68ecfe73aad943e9a883e7c5","observation_id":"771d640a-b0f3-432e-93bf-b2a82c800a1a","resolution":{"observed_at":"2026-05-20T07:13:23.660592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marten: Visual question answering with mask generation for multi-modal document understanding","venue":null,"work_id":"69288aec-dc45-403b-a1fb-4e63e7142f84","year":2025},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:b0605a3ff01e8203f54f23b017b1ea0695b2f329a9659f2bcb4b1645e6e9a485","observation_id":"cdd41cf3-302b-4a0b-88df-8087a5e666be","resolution":{"observed_at":"2026-05-20T07:13:23.642954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T01:50:20.408574Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":31},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 3 inbound Pith citation observations for arXiv:2605.19307."}