{"as_of":"2026-08-09T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0664547581c71ee5c3d32c9a81b98b5437fcefdcf1741bf9187b65689364aac0","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:54:27.130704Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T08:20:56.561166Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T08:22:10.936561Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"cited_work":{"arxiv_id":"2505.23272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23272","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yongchao Zhou, Andrei Ioan Muresanu, Ziwen Han, Keiran Paster, Silviu Pitis, Harris Chan, and Jimmy Ba","venue":null,"work_id":"fa486b30-11ef-4864-a37d-ed60d0c556fc","year":null},"citing_paper":{"arxiv_id":"2506.19420","last_updated":"2026-04-08T07:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T08:38:32Z","title":"Commander-GPT: Dividing and Routing for Multimodal Sarcasm Detection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T08:20:56.561166Z"},"links":{"cited_paper":"/paper/2505.23272","citing_paper":"/paper/2506.19420"},"observation_digest":"sha256:b45dec273725a2b76c3e69ffd60447a0fd377971e49b75356e97694f316a79e5","observation_id":"51b99c23-2f2c-480c-9eaf-133d03052004","resolution":{"observed_at":"2026-05-19T08:22:10.940154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23272/citation-record","integrity":"/paper/2505.23272/integrity","json":"/paper/2505.23272/citation-record.json","paper":"/paper/2505.23272"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:28.012804Z","title":"Advances in neural information processing systems35, 23716– 23736 (2022)","venue":null,"work_id":"1f7f194b-f817-4044-a648-b77f7710a3fa","year":2022},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:24.966379Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:5042d709e33dfac2011d69546a203159c050327d79cc7ebc285b946574c10f5e","observation_id":"10197d36-6930-412d-943b-607fa623afb5","resolution":{"observed_at":"2026-08-07T12:54:28.081107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:54:25.054856Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.054856Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:ba30cc789d74c348dee092a129011e779ed344593edb54566273fed731d29043","observation_id":"6a90386f-f6b1-4cf6-9e9f-6d65c061194c","resolution":{"observed_at":"2026-08-07T12:54:25.054856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01815","last_updated":"2019-06-05T04:08:47Z","snapshot_observed_at":"2026-07-06T07:58:02.684338Z","submitted_at":"2019-06-05T04:08:47Z","title":"Towards Multimodal Sarcasm Detection (An _Obviously_ Perfect Paper)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01815","snapshot_observed_at":"2026-08-07T12:54:25.159760Z","title":"arXiv preprint arXiv:1906.01815 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.159760Z"},"links":{"cited_paper":"/paper/1906.01815","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:fbead7ca272a0332f7aa53e10799a18f80b17f0770b603946b1c711a866a3b1d","observation_id":"3b4ddf6d-1c1e-4d6f-9e42-8b6807b3a149","resolution":{"observed_at":"2026-08-07T12:54:25.159760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:27.852356Z","title":"Advances in Neural Information Processing Systems37, 110805–110853 (2024)","venue":null,"work_id":"5cd855ff-e25e-4440-9dc8-878388f39904","year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.251838Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:6cb19b0ce306a607a0396abe6efd376253cd9e5d1ed46d5d4ff4c0869a6e6195","observation_id":"5139d084-0e47-43d3-a0c9-ec38f6bb92da","resolution":{"observed_at":"2026-08-07T12:54:27.926495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.350577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.350577Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:c93f35323e9ca83b4ddbfe847bc61cbbb044c4f1bef2f7899fd1363554a011ce","observation_id":"19863e85-f32f-4496-a8aa-4b9b282be700","resolution":{"observed_at":"2026-08-07T12:54:25.350577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:54:25.466576Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.466576Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:2bc313f2d3509cca1971879727e3677c3d2bf75f148ebb6b5962df3e451ac040","observation_id":"59ba3b7d-bae5-4f2d-9f27-a7b0bdcedd10","resolution":{"observed_at":"2026-08-07T12:54:25.466576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.598847Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.598847Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:8c73aa00884c1a5877e89760f781ed16fcb3e8d20bf66f4cb13ebcf25a30794c","observation_id":"02bc6d2b-074d-4321-8b2e-9ef466e960d9","resolution":{"observed_at":"2026-08-07T12:54:25.598847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.728615Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.728615Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:dd3e67eae72085dad8a79c2f9f555f8ab48f699104301eb196316a9299559527","observation_id":"fb71c79b-557a-4685-8682-775a215e124a","resolution":{"observed_at":"2026-08-07T12:54:25.728615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.856176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.856176Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:bb83459284b16f4cf784b551abc19b40cd34f50b45ce1fa579c71e3dbcc1d3f8","observation_id":"9eb782d3-f035-447f-843a-565f68f4b0ac","resolution":{"observed_at":"2026-08-07T12:54:25.856176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08387","last_updated":"2022-09-28T19:24:24Z","snapshot_observed_at":"2026-08-04T15:44:42.221453Z","submitted_at":"2021-10-15T21:58:03Z","title":"Generated Knowledge Prompting for Commonsense Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08387","snapshot_observed_at":"2026-08-07T12:54:25.942571Z","title":"arXiv preprint arXiv:2110.08387 (2021) Are MLMs Trapped in the Visual Room? 19","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:25.942571Z"},"links":{"cited_paper":"/paper/2110.08387","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:23277629a5eb916992c56ceb281b17e69a50862dbcb9fa950eb0f38b2a5792b2","observation_id":"e29d5e5b-71d6-414e-9023-a1cc80353618","resolution":{"observed_at":"2026-08-07T12:54:25.942571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:27.681138Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia","venue":null,"work_id":"5e1ec0fa-9735-408d-9dc3-d0d3afb26c61","year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.039290Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:c97d2e710122e20d27956d1397115f646baa5d0f977d9d055f05ad3bdc30f454","observation_id":"0d3d752f-9ee3-401d-9e15-2d0d2aa687e2","resolution":{"observed_at":"2026-08-07T12:54:27.742685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T12:54:26.194743Z","title":"arXiv preprint arXiv:2403.05525 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.194743Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:b6258e5b48e1bc48b3a4a29a74d6c9739f2146d246f23e91d752d3e4d4fcb86d","observation_id":"d7c945a3-792b-4025-a7e2-1e1504c5284a","resolution":{"observed_at":"2026-08-07T12:54:26.194743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07135","last_updated":"2023-07-14T03:22:51Z","snapshot_observed_at":"2026-08-05T05:59:38.928602Z","submitted_at":"2023-07-14T03:22:51Z","title":"MMSD2.0: Towards a Reliable Multi-modal Sarcasm Detection System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07135","snapshot_observed_at":"2026-08-07T12:54:26.308818Z","title":"0: Towards a reliable multi-modal sarcasm detection system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.308818Z"},"links":{"cited_paper":"/paper/2307.07135","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:70a33f108630ee0f81a7ea3c8021e2e00b13c6cbc8e0daae6a3008209088a6da","observation_id":"68e865bb-5934-4a6b-ad97-0c9996bb4c98","resolution":{"observed_at":"2026-08-07T12:54:26.308818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.367430Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.367430Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:7b0362c2e33107ef207c5e91f20a0eadfa7cff86b0e1879c86f0b9cd5696377a","observation_id":"baee13cc-5c43-43cc-b383-46088c667f8e","resolution":{"observed_at":"2026-08-07T12:54:26.367430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:27.552849Z","title":"Scholarpedia4(8), 3100 (2009)","venue":null,"work_id":"df2e8287-652f-4c14-a864-d8b0960e8151","year":2009},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.439968Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:8ff5dc51e291ecf71726e036dadb8fc4e5ac6d85fb993e1c663c28ce4193d08e","observation_id":"7b9972cb-ffeb-4639-9573-b00babf8f469","resolution":{"observed_at":"2026-08-07T12:54:27.597716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T12:54:26.520235Z","title":"arXiv preprint arXiv:2410.17434 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.520235Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:14e4e85ade1f806381f71510a9bdba3ea175defb49f9d49ea9aa0aaa70d04727","observation_id":"f815efce-317d-4461-a7f1-7c8f898e212d","resolution":{"observed_at":"2026-08-07T12:54:26.520235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.649855Z","title":"Information Fusion 103, 102132 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.649855Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:243e7c059d37e0e5ec5069a553dfc9c7713d3e006a0824acf0726d612fbe26e3","observation_id":"7e8d331a-8437-4602-8717-6fa5d7c5c7e3","resolution":{"observed_at":"2026-08-07T12:54:26.649855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:54:26.702049Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.702049Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:0eeba599516ddf890b979986174484ba042873f933a847f1cd9c3df0702557fa","observation_id":"00371fb9-2991-4069-9f45-b31c4e4dd40c","resolution":{"observed_at":"2026-08-07T12:54:26.702049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09909","last_updated":"2023-12-04T14:13:35Z","snapshot_observed_at":"2026-08-06T15:15:16.288168Z","submitted_at":"2023-10-15T18:32:27Z","title":"Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09909","snapshot_observed_at":"2026-08-07T12:54:26.786207Z","title":"arXiv preprint arXiv:2310.09909 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.786207Z"},"links":{"cited_paper":"/paper/2310.09909","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:929b22ff68d39760fc97f3da872719214b91962a12bb61c58c17dcbba04c1f5f","observation_id":"e8df1fdf-8a55-4fe2-8821-1465ea6aeebf","resolution":{"observed_at":"2026-08-07T12:54:26.786207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11374","last_updated":"2024-01-17T02:44:56Z","snapshot_observed_at":"2026-08-06T22:00:54.649916Z","submitted_at":"2023-10-17T16:15:34Z","title":"DialogueLLM: Context and Emotion Knowledge-Tuned Large Language Models for Emotion Recognition in Conversations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11374","snapshot_observed_at":"2026-08-07T12:54:26.879990Z","title":"arXiv preprint arXiv:2310.11374 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.879990Z"},"links":{"cited_paper":"/paper/2310.11374","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:a7a79286e91ba33387c2f90258753c436bcde0dc90bfb967174f54f3214e3938","observation_id":"7456e1fd-f150-46b0-9bba-6f41c97a0ce7","resolution":{"observed_at":"2026-08-07T12:54:26.879990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:27.361059Z","title":"Advances in Neural Information Processing Systems36, 18794–18805 (2023)","venue":null,"work_id":"327fd948-360b-4a7e-bcdf-25683d389583","year":2023},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:26.971368Z"},"links":{"citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:c00037cbbc013ab42b99c594539d9372a4f3a718aa7a63a20dc37377cbfe778f","observation_id":"d057ae2d-c8ef-41de-b82c-769ac8f6f1c4","resolution":{"observed_at":"2026-08-07T12:54:27.444845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:54:27.034519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:27.034519Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:9aefbe80e78ee112c8f3d3e9be78251da0b687177656d0bcb2b6b0941fcc4b0f","observation_id":"9279b93b-17e7-469f-a099-4376b71c4232","resolution":{"observed_at":"2026-08-07T12:54:27.034519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:54:27.130704Z","title":"arXiv preprint arXiv:2304.10592 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:27.130704Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:6b5471698f0be02172d1b3360018e3a724668a08f7c7615b0811e3be31094df6","observation_id":"38fa8348-8c66-410d-89c0-fb7767f6dca1","resolution":{"observed_at":"2026-08-07T12:54:27.130704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:25:29.746220Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2505.23272."}