{"as_of":"2026-08-10T17:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79930f19b93efeb6c1161d91258b858938bbe3be1bafaf23ae4914d359ff8d7a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:20:32.109683Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08715/citation-record","integrity":"/paper/2509.08715/integrity","json":"/paper/2509.08715/citation-record.json","paper":"/paper/2509.08715"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.838381Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.838381Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:53e596346c33825aae4d44959b660b6acbaae7cd549b703c307d9ba1ec583eda","observation_id":"fbb2a09b-aa9d-4105-9a95-bce59f67ac5f","resolution":{"observed_at":"2026-08-04T20:20:31.838381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.845129Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.845129Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:a6e6632a6ab6554977e374dd3a70faf039f5c0e34939b7bab3f9ff557adb31d1","observation_id":"8054e82c-2154-437a-b521-68e7650f06f3","resolution":{"observed_at":"2026-08-04T20:20:31.845129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T20:20:31.852312Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.852312Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:56ca9d7833513e72abb95edd4ea3eb7f0c97ec712bf221f485c27b95f9075971","observation_id":"d45ce047-a741-4fed-93d2-9641d82650a7","resolution":{"observed_at":"2026-08-04T20:20:31.852312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.860828Z","title":"Yu, and Qingsong Wen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.860828Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:181a2d1bd4b8b7ea77b4b1630c98d5d4eb555ba2aed4af633cbbfda4d7abe2db","observation_id":"14489560-6e77-4f19-9ec3-1b4ad1aa35e7","resolution":{"observed_at":"2026-08-04T20:20:31.860828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.866374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.866374Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:5728539bc420b96c43b27870ce10fb6b76105b161f20f78f41dc45c675842c42","observation_id":"e740c634-1b0a-4eda-9da7-179d44b7fd16","resolution":{"observed_at":"2026-08-04T20:20:31.866374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.872316Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.872316Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:7515ab4532cea791f5c5c2039ffde8b86377b07df5b8837d987ae656114cc738","observation_id":"54da9b1e-d160-4c7f-acde-6cf7137bd3a8","resolution":{"observed_at":"2026-08-04T20:20:31.872316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T20:20:31.878936Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.878936Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:71ee22cd20238d5e127a07aae527190b2770c07518801d013fbbf55e16eef3e4","observation_id":"a2a88261-d317-43b1-a9ad-f213266a70fc","resolution":{"observed_at":"2026-08-04T20:20:31.878936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T20:20:31.884483Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.884483Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:dd120422f9586be65b5c083c2b32be4858e3f8327bd3b0eb284267431ee0070c","observation_id":"b1b100a7-4b74-4ea2-9e53-6e88cee99c79","resolution":{"observed_at":"2026-08-04T20:20:31.884483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.890684Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.890684Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:1c700dea92b11827433fe1f4958fdf8dbc2b8bfa93642fcc20aae630f71167cf","observation_id":"2ccf931e-efb8-4764-98e1-615a06a004e8","resolution":{"observed_at":"2026-08-04T20:20:31.890684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.896539Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.896539Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:8f7c962a4be91b30af5cdac13d42e9ba1e8c51a975d59d8fea9a501aee967e42","observation_id":"4d0006f5-74bd-45e7-9cf2-e0e7399119a1","resolution":{"observed_at":"2026-08-04T20:20:31.896539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.901438Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.901438Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:bc5311fd014f0f48f032a515e7d4b0b32442b6b71420d9cae8aaf261d3a1070d","observation_id":"1b91d14b-0dd1-42a1-b67f-ee7a8caa2952","resolution":{"observed_at":"2026-08-04T20:20:31.901438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T20:20:31.908323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.908323Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:ec36082b88c536999f446a468087600101f3f29affb02966193427ca3a4a651b","observation_id":"6212fe34-b008-491a-b149-b50f7dd94cd8","resolution":{"observed_at":"2026-08-04T20:20:31.908323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.914162Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.914162Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:54829696284c355136c96ab3f6024ac52ea8f8c24bc73c5e30b459e9f9a82633","observation_id":"e95421e9-1028-40d3-b9a3-2088cf0e4329","resolution":{"observed_at":"2026-08-04T20:20:31.914162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.920233Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.920233Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:a2f570d9d6da054007441cf15d48ae5966c5f3b5b8b1c49a01379f95c79aabad","observation_id":"c52993bc-6e3d-48aa-8c6d-39a00471e33a","resolution":{"observed_at":"2026-08-04T20:20:31.920233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.926144Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.926144Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:8d0c4961c2c05fe5633e24e34d0190e05241a13c6b0470b4047ed1db4f7a22b2","observation_id":"580ce551-b7eb-42be-9eed-2eb2f9535327","resolution":{"observed_at":"2026-08-04T20:20:31.926144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.932743Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.932743Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:0f14d3818911d97120dc5c6cd018f0e82246f525ef2b13516a6bef00fb57ccb9","observation_id":"c998cc76-bf49-4db6-b8b9-28943e1fb2d1","resolution":{"observed_at":"2026-08-04T20:20:31.932743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.938893Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.938893Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:2e3b434e378de5c2a114fba63b70ddbb52ef1bc0ab7699680297c26872bc8f6e","observation_id":"6aa8c892-eb5e-4c99-8ac5-c79ce5a5f5f5","resolution":{"observed_at":"2026-08-04T20:20:31.938893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15501","last_updated":"2024-01-27T20:52:33Z","snapshot_observed_at":"2026-08-05T13:53:08.241249Z","submitted_at":"2024-01-27T20:52:33Z","title":"FloodLense: A Framework for ChatGPT-based Real-time Flood Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15501","snapshot_observed_at":"2026-08-04T20:20:31.945501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.945501Z"},"links":{"cited_paper":"/paper/2401.15501","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:1531d9d6a7c27f9a867ed13d82f96cbc9a2057538ade38262f87a876fd3f87c2","observation_id":"c6c1c8fc-d7b3-4a46-ad37-91c48d44c0ac","resolution":{"observed_at":"2026-08-04T20:20:31.945501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16527","last_updated":"2023-08-21T09:35:52Z","snapshot_observed_at":"2026-07-06T15:48:01.777256Z","submitted_at":"2023-06-21T14:01:01Z","title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16527","snapshot_observed_at":"2026-08-04T20:20:31.952915Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.952915Z"},"links":{"cited_paper":"/paper/2306.16527","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:b65932dd03597940a8330dab9ce7a28c6efd54d504c4f99e781e1e267101fcc6","observation_id":"7c418fee-50a4-4bd3-b9f1-e7b13d5756c0","resolution":{"observed_at":"2026-08-04T20:20:31.952915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:20:31.961424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.961424Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:4a28fcd5a91e904c3faa2a150cf969cbc460da0efabfe2d8d354e0078349ab2d","observation_id":"69b4835f-f2ef-4edb-ab63-7bcf7618857a","resolution":{"observed_at":"2026-08-04T20:20:31.961424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.968857Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.968857Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:c36a66220b2bf07e09d6115882c4ce340c47eb93faaa7f325e239d3eb7aa1dd3","observation_id":"a91a41bd-446a-48fe-abb4-286cd22dfedf","resolution":{"observed_at":"2026-08-04T20:20:31.968857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.976072Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.976072Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:8f55d28905b7f1157896c7000919a6f7b60843380357b7c20864ef8888a44a38","observation_id":"b53a083a-b41d-4047-a0f2-c1c37004469a","resolution":{"observed_at":"2026-08-04T20:20:31.976072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.982535Z","title":"Selvaraju, Akhilesh Deepak Gotmare, Shafiq Joty, Caiming Xiong, and Steven Hoi","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.982535Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:97857628b2c085d52ef1e1cdb746908b0e4a493d007920e871a2645d94181ed1","observation_id":"6419b4aa-93fe-4f01-a2d1-66768114bc2c","resolution":{"observed_at":"2026-08-04T20:20:31.982535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-08-10T13:01:53.292743Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T20:20:31.990067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.990067Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:f7142492b5e351393943d5e9c56150752e604dd76d66e129f4ace98c786426ab","observation_id":"fb3d657b-2e0a-4e38-abd9-018bed994755","resolution":{"observed_at":"2026-08-04T20:20:31.990067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:31.998097Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.998097Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:12531c85b7f2bb908b5a8b7b33a4ac09e68bf3dfa4ca2b955cf60fba69ef02b9","observation_id":"1ead14f3-015d-46ef-9ae3-76c2a2b19fc4","resolution":{"observed_at":"2026-08-04T20:20:31.998097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20756","last_updated":"2025-08-11T14:20:55Z","snapshot_observed_at":"2026-08-04T05:33:48.921191Z","submitted_at":"2024-07-30T11:57:40Z","title":"SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20756","snapshot_observed_at":"2026-08-04T20:20:32.005334Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.005334Z"},"links":{"cited_paper":"/paper/2407.20756","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:439c63add93942902c6b4621ca5a86ab82569d65beaa95596603c0b88b1591a6","observation_id":"e1ba2790-d1ae-45be-8d0e-9065fbef0ab2","resolution":{"observed_at":"2026-08-04T20:20:32.005334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.025261Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.025261Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:b2060fd93e25b5458dd8e26c2b9722ccce11c1a9450248f62b405749c023f7be","observation_id":"dadd9655-ac2d-43c1-ad80-3fe0ffc9c14b","resolution":{"observed_at":"2026-08-04T20:20:32.025261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07920","last_updated":"2023-02-15T19:45:35Z","snapshot_observed_at":"2026-07-06T14:52:15.762461Z","submitted_at":"2023-02-15T19:45:35Z","title":"InfoNCE Loss Provably Learns Cluster-Preserving Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07920","snapshot_observed_at":"2026-08-04T20:20:32.034195Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.034195Z"},"links":{"cited_paper":"/paper/2302.07920","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:41932a25b3d5a439ecdd885fdfaa33b066b0ea85f559e2b406ed273b269d5016","observation_id":"4e5b9c70-ada8-4e25-9c40-a95c80c9b626","resolution":{"observed_at":"2026-08-04T20:20:32.034195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T20:20:32.039577Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.039577Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:506f5e64e0671ccddd5b673fac79f8ef887101ab9d4b3e886a5ab9f966845d33","observation_id":"eba5e1a2-04e3-449b-8f0b-7b3cf0b0c433","resolution":{"observed_at":"2026-08-04T20:20:32.039577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T20:20:32.046090Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.046090Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:8807976f7646e2fb95ec1909ed403965b4c4a56f9ee96e021e32d2bc8bcbed41","observation_id":"355c30c5-e9c5-4a4c-89ce-12b1ece284fe","resolution":{"observed_at":"2026-08-04T20:20:32.046090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.053096Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.053096Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:3e65df3307d9fc2afbf8b6969521d0813d6b3075b322c88aa34ad8cb21724a5a","observation_id":"7a0fdbf8-e3ce-415e-b1b4-8ccc2a3ae36d","resolution":{"observed_at":"2026-08-04T20:20:32.053096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.061995Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.061995Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:1fd01cd5c89d3159e8555e4110fc39e78ebb4f5871ed6a7d86fbc970e2e119a2","observation_id":"a17c89c5-b1fa-4083-8e4b-7dd3ed0451db","resolution":{"observed_at":"2026-08-04T20:20:32.061995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-04T20:20:32.068229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.068229Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:c14a48f67197e59f36317361596237e49ca1ce851807c9c56fcf302b1803bec1","observation_id":"f049bd5f-62cd-44bb-8670-d6f785b50f1a","resolution":{"observed_at":"2026-08-04T20:20:32.068229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-10T14:10:03.894992Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-04T20:20:32.074452Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.074452Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:81b467f2021030cb0834e900be928fd6d911c625be053a76c178535a8eddb809","observation_id":"051c0ae2-8b8e-42db-b539-5eeb95a61fbc","resolution":{"observed_at":"2026-08-04T20:20:32.074452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.083452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.083452Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:81f0558f2bd3acb6db79450739a16457fd89997faf1ec1485bc9e72faf5fbc65","observation_id":"6085218d-969c-41d2-b5cc-c0b53ed990a9","resolution":{"observed_at":"2026-08-04T20:20:32.083452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.089561Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.089561Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:92ddc17663164905bf0f0424cf62815e846512045cc39cc58d3a6b31ed363891","observation_id":"e6922f30-9ecc-4b35-a002-01d5d5489067","resolution":{"observed_at":"2026-08-04T20:20:32.089561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.097017Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.097017Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:0c02feb78fac4ef5d027125c82f4ca981367e417e5df6a3280928db8c85af635","observation_id":"fc9fbfb4-0ee6-4750-b893-1bcc4667eb55","resolution":{"observed_at":"2026-08-04T20:20:32.097017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.103961Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.103961Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:324a005cc3ffb9dcd5ee160bd68a0c787915ba7f32b0000e76954ac5e0d8bb9c","observation_id":"7acde425-109a-4556-ba41-63ba2d732315","resolution":{"observed_at":"2026-08-04T20:20:32.103961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:20:32.109683Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:32.109683Z"},"links":{"citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:fd1a34d831deaea9488ced11be9c3df7dfa7b1ad8ced7ffb1a6bc136b38dd4b0","observation_id":"7d0cd1a6-8fce-4da4-8edd-c2268fd10c56","resolution":{"observed_at":"2026-08-04T20:20:32.109683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:33:34.278868Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2509.08715."}