{"as_of":"2026-08-07T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc3ae0886d25155b181cb58b559f8aa8a07f5d929b6b8955bb5dbd2515bdb23a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:19:53.982380Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01147/citation-record","integrity":"/paper/2608.01147/integrity","json":"/paper/2608.01147/citation-record.json","paper":"/paper/2608.01147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T04:19:50.216121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.216121Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:0ba1901954c3633475015d789e32f1dfad92da95d97b44d14c99044a51513d6a","observation_id":"2bb68c95-c171-474b-bdcc-9c007e00ce3f","resolution":{"observed_at":"2026-08-06T04:19:50.216121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.544335Z","title":null,"venue":null,"work_id":"5ed90aa4-4ba7-4dd8-a8fb-774ee27c83c0","year":2015},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.297578Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7aae9e9a275d77f30535b43824ee31e3b4b115691f539f1ee146422271c8e11f","observation_id":"f664837a-2893-42f9-835a-2f28a4495149","resolution":{"observed_at":"2026-08-06T04:19:55.614150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T04:19:50.404693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.404693Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:b3b7e9d0001d9afa0d6a901c123dba17c37ca46a66c4ec33d32fc30a2a1746fb","observation_id":"f208109c-42c9-4e1d-aa5e-aa01cb540437","resolution":{"observed_at":"2026-08-06T04:19:50.404693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T04:19:50.507547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.507547Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:6341fd5fc044715df82c688a23e6706db55450b96c7427baaff849dfdfca5c37","observation_id":"aae32054-007c-4f65-b57a-c0c3a56445cb","resolution":{"observed_at":"2026-08-06T04:19:50.507547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.602495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.602495Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:bb3253a8c015807d3b2a2e45d8d6dfce2e5296159b73015ef3d6ea3f2d8194f0","observation_id":"25ae2193-bf17-49de-a3d5-cc486e447b7c","resolution":{"observed_at":"2026-08-06T04:19:50.602495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.682091Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.682091Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:a2623415883f8c567e30b1e0c9ca0d2631d03949b9333185a09a769c8e6dd7c7","observation_id":"08af70f6-b402-483c-8af4-fbe7cd2e550a","resolution":{"observed_at":"2026-08-06T04:19:50.682091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T04:19:50.895716Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.895716Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7a964a85f1c9574753305925edbbe15e445252244e10adc494e7a4c2424dd276","observation_id":"10cad550-eafc-443e-b7b9-4b4853ee7ce6","resolution":{"observed_at":"2026-08-06T04:19:50.895716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.996226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.996226Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7021860f28d2a15fbd65d6bd4e61a7aa1b67e9a78b2e6016bf7d2f84ea528787","observation_id":"ab2615f7-fdaf-49b7-a3f7-fea5343fe571","resolution":{"observed_at":"2026-08-06T04:19:50.996226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.075352Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.075352Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:21a2dd09d619155eeb233a2c5a2d3f81fc29964ea977a8a0df5f82e104e4776c","observation_id":"06f71d09-dbbf-4a82-b872-08399c5cd30e","resolution":{"observed_at":"2026-08-06T04:19:51.075352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.364882Z","title":null,"venue":null,"work_id":"b3507cd5-fe74-41b6-a93e-f1603453a725","year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.154841Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:fb4da6656fd73b8485f1d8f1fd3de0d96400523ede9d6ac436212eeb2e1331af","observation_id":"bd99ac77-efa7-4ddf-964f-37586bd0a4d1","resolution":{"observed_at":"2026-08-06T04:19:55.418742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.235201Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.235201Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:070b5865ee55175fd41203eab827faca863f835427a32dae30a9cc574b913237","observation_id":"f7f2eeb6-e29e-4841-88dd-afef575d4ebf","resolution":{"observed_at":"2026-08-06T04:19:51.235201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T04:19:51.313452Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.313452Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:355c05e26077f9f6d119b1dca3acb0896c870a7f57f59cddd7deb76a3606696d","observation_id":"df8ea478-3852-44da-a3f3-567f9f74c712","resolution":{"observed_at":"2026-08-06T04:19:51.313452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T04:19:51.425738Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.425738Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:96cdcf5fe3a31c8d33ae344f58b261fd2d3d3b457ea258d165d59fe3fd4f2a0a","observation_id":"2e9126b8-f1e0-4eba-9538-f71149b6beef","resolution":{"observed_at":"2026-08-06T04:19:51.425738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.533409Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.533409Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:9e2b01799915be996714720b9aeae76e6173d91c7a0dd9a1f67762280e016b0c","observation_id":"5d219da0-b112-48ed-b4e1-3679c49a409f","resolution":{"observed_at":"2026-08-06T04:19:51.533409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.239318Z","title":null,"venue":null,"work_id":"7414357a-95bf-4832-9723-aafdd4539a90","year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.669637Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:9e2e4b65237084af131a94c2062da8ef77be0179c3d00e7046e085137e068dac","observation_id":"da99ee83-6262-415b-820b-06ae18726929","resolution":{"observed_at":"2026-08-06T04:19:55.280826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.778845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.778845Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:1a2315b3df14f58f27a0b045a0ecfb83ef4c2c76c09443ea83bb19f45a1d5c46","observation_id":"3f0ee1a0-4492-418a-9814-741aa9e3a40e","resolution":{"observed_at":"2026-08-06T04:19:51.778845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:51.853909Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.853909Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:54699a89d9d365d3e863921f44791ebfc58b5a5644ab89c486595c03b0e89c8d","observation_id":"7d5196e2-5231-4716-8362-d8c264cad265","resolution":{"observed_at":"2026-08-06T04:19:51.853909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:55.064494Z","title":null,"venue":null,"work_id":"11ea5db2-3739-4acc-a3c1-83db1bbc6d64","year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:51.951800Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:dc8bb5e6f5dcd8cb116050de4104b001f566dc45bee574f63218e9399914fb8a","observation_id":"77659e10-c540-4016-a2eb-9eab808d3cde","resolution":{"observed_at":"2026-08-06T04:19:55.147501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03809","last_updated":"2022-10-29T10:08:13Z","snapshot_observed_at":"2026-08-05T15:50:39.183704Z","submitted_at":"2022-10-07T20:35:58Z","title":"Retrieval Augmented Visual Question Answering with Outside Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03809","snapshot_observed_at":"2026-08-06T04:19:52.036191Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.036191Z"},"links":{"cited_paper":"/paper/2210.03809","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7a172de5cdcfc16f1c522d0a0c42f26e7d8f8818b013c49cbd6a517fb56ced97","observation_id":"223dbdda-d3e0-441e-80d0-6faf03e1bf5d","resolution":{"observed_at":"2026-08-06T04:19:52.036191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08327","last_updated":"2024-06-05T11:46:23Z","snapshot_observed_at":"2026-08-01T04:05:40.608560Z","submitted_at":"2024-02-13T09:47:07Z","title":"PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08327","snapshot_observed_at":"2026-08-06T04:19:52.136432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.136432Z"},"links":{"cited_paper":"/paper/2402.08327","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:5d170ebbfb2ddd88e39fe10c077b42fe7d7b8572e5e4d9a8bdf70401937ed422","observation_id":"584b56d9-b84c-4eb3-b82c-216ad41c9541","resolution":{"observed_at":"2026-08-06T04:19:52.136432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:52.210369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.210369Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:186ad20d5e7a3cb8e481c03788a2975976b1c3ab839d9167c90f186dfc3f575f","observation_id":"d64f23e0-d59c-4081-b92e-14bcc7510a24","resolution":{"observed_at":"2026-08-06T04:19:52.210369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:52.314740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.314740Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e30a49cd5cf7a5f796d5724471a20302ea7e5267bd14aba334f815849e6d6bfb","observation_id":"0449d530-f874-4807-8f9c-00e4383183d7","resolution":{"observed_at":"2026-08-06T04:19:52.314740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:52.394159Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.394159Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:32cb97e4add8c184b6bb578692f320f8aa8811baccb71d814dbd581c2928f87a","observation_id":"dc7db9c0-5901-4373-a404-3478e071c15d","resolution":{"observed_at":"2026-08-06T04:19:52.394159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05256","snapshot_observed_at":"2026-08-06T04:19:52.487643Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.487643Z"},"links":{"cited_paper":"/paper/2603.05256","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:eaf7ff785602d05d52e226a7de1daae7d22cae9086cfee725cb69aa563221f1b","observation_id":"a8d15d2f-478c-4f03-942e-75e496b055cc","resolution":{"observed_at":"2026-08-06T04:19:52.487643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08876","last_updated":"2024-10-14T20:31:13Z","snapshot_observed_at":"2026-08-04T21:17:26.164677Z","submitted_at":"2024-10-11T14:51:00Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08876","snapshot_observed_at":"2026-08-06T04:19:52.572934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.572934Z"},"links":{"cited_paper":"/paper/2410.08876","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:11bf0fcbbe3e65031702b48298affe6b38734160383ce23c0d375b5cca3621c3","observation_id":"060c3c5d-b2e5-4643-8320-93471c8fbb7b","resolution":{"observed_at":"2026-08-06T04:19:52.572934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:54.914374Z","title":null,"venue":null,"work_id":"4e595d81-37d1-4f92-9c85-b73e9424b03b","year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.648108Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:67670258fcb263ce507b13ecf43e8d242e6d9b1d70fbb86718d7959b9db4203f","observation_id":"b8fdebfc-4d5f-447f-8b7e-a8c4ae5269ab","resolution":{"observed_at":"2026-08-06T04:19:54.962955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T04:19:52.727061Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.727061Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:f9ddff46c700f0bc42e02318a0af1fa0259ea1feeaf6f47979b82d4691e6688d","observation_id":"afb758eb-e9b6-4e11-a679-a0b77b8f5bcc","resolution":{"observed_at":"2026-08-06T04:19:52.727061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T04:19:52.837353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.837353Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:d26640589b32b490c35b27cb9f1fedcd9c76bf61407a9746a1568adc6589fcb2","observation_id":"353c7071-a8c2-4dbc-9acf-c8a45a9ce76c","resolution":{"observed_at":"2026-08-06T04:19:52.837353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T04:19:52.948788Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.948788Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:4e2008adb51fb6a500ade4048a166837162170e863b61ee5ba18c52f3132f366","observation_id":"73f094df-eb03-46c0-a41f-3a77f4c6c5d0","resolution":{"observed_at":"2026-08-06T04:19:52.948788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:53.028597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.028597Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e124ea5bfe3a0831a4b733e068fe82f6ac94206801b680523370fb925a7d8158","observation_id":"944fb81a-2de3-4908-8c7e-587f23b15e96","resolution":{"observed_at":"2026-08-06T04:19:53.028597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:53.123232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.123232Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e2c6dc3bed12cc0ccabec1211f6997fab6737b1311c97c718ccb75af7d4c7341","observation_id":"8d33b20a-8c2e-4174-a437-f8fd38258077","resolution":{"observed_at":"2026-08-06T04:19:53.123232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12735","last_updated":"2024-12-02T02:34:47Z","snapshot_observed_at":"2026-08-05T16:52:46.144105Z","submitted_at":"2024-07-17T16:55:42Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12735","snapshot_observed_at":"2026-08-06T04:19:53.199025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.199025Z"},"links":{"cited_paper":"/paper/2407.12735","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:3f2374816d54a133bc7d03d45a64bd01c5f1f7e9ae3af4973c22cf969236548e","observation_id":"bd2f5435-1540-49da-8431-66d651fd345d","resolution":{"observed_at":"2026-08-06T04:19:53.199025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07879","last_updated":"2025-09-12T11:47:31Z","snapshot_observed_at":"2026-08-07T15:48:13.406477Z","submitted_at":"2025-05-10T14:24:41Z","title":"OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07879","snapshot_observed_at":"2026-08-06T04:19:53.283015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.283015Z"},"links":{"cited_paper":"/paper/2505.07879","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e80dbf1d98b8abbeaf791e2599de7b949a0e7d39f77d40c7600cdbf2e3c7996a","observation_id":"78da66fd-09d7-4042-91c6-bb593a4a47fe","resolution":{"observed_at":"2026-08-06T04:19:53.283015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:54.783897Z","title":null,"venue":null,"work_id":"3ff182f2-a05f-4c6a-b37b-5909e6692dbf","year":2022},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.376192Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:fd4f3cff9f722263d59c775d7cfbba652bec349d665918d12ea6ff9ba6b264e4","observation_id":"80bfd994-9173-4ded-aef9-7a2273ef6ea2","resolution":{"observed_at":"2026-08-06T04:19:54.830261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05318","last_updated":"2026-04-27T09:35:27Z","snapshot_observed_at":"2026-08-02T15:08:55.264024Z","submitted_at":"2025-08-07T12:22:50Z","title":"mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05318","snapshot_observed_at":"2026-08-06T04:19:53.513377Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.513377Z"},"links":{"cited_paper":"/paper/2508.05318","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:a4adaff3de5ada282406f293868d4ea204935e5180b955675736e8a8e2e35db0","observation_id":"9d01db48-708a-4a66-bb7f-b4b75c537b31","resolution":{"observed_at":"2026-08-06T04:19:53.513377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T04:19:53.647357Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.647357Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:8c51e25a7bb2d98a8e6e4f17c0a025d5fc7c411aa4d3bf0848caa9decb85fcc8","observation_id":"8cd9d452-1dfa-4da1-b0b7-7df1cef49c02","resolution":{"observed_at":"2026-08-06T04:19:53.647357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2024-11-22T16:15:50Z","snapshot_observed_at":"2026-08-05T15:40:13.091317Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-06T04:19:53.771485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.771485Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:a9a8819e2b27e8d76e05c7e64479e57f5a712302ea226a5b41711c52f25dfd06","observation_id":"90a75562-a2e8-494d-8a15-9392fa7bb123","resolution":{"observed_at":"2026-08-06T04:19:53.771485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-08-06T04:19:53.886239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.886239Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:1612f39e2df9c27a87bd4603416cc3d01d2db38961cf01e9be8d8d718593c326","observation_id":"cac9af94-b7cd-47cc-baff-5f9517ab36f1","resolution":{"observed_at":"2026-08-06T04:19:53.886239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T04:19:53.982380Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.982380Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:d6f8435104a61eab39ef04948b7b339cf14c045c405029d3e4b52a43bc0fb39b","observation_id":"8b1d433e-18e6-424a-bb66-51e281d7bd0d","resolution":{"observed_at":"2026-08-06T04:19:53.982380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:19:50.787024Z","title":"InFindings of the association for computational linguistics: ACL 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.787024Z"},"links":{"citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:8d8eb01c044c0c1d71f455da37c09fa61d9188dd6477d2a91538aff629368c46","observation_id":"3bc49fac-1c75-4c20-be69-4e9ac9b6080f","resolution":{"observed_at":"2026-08-06T04:19:50.787024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T20:16:55.143801Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.01147."}