{"as_of":"2026-08-10T23:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c67b0669d6af86ae4bba16263bf3f656d9854f24c0b90e17c870ff806e506da","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T20:55:50.873271Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.12703/citation-record","integrity":"/paper/2605.12703/integrity","json":"/paper/2605.12703/citation-record.json","paper":"/paper/2605.12703"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03587","doi":"10.48550/arxiv.2602.03587","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cl-bench: A benchmark for context learning","venue":"Open MIND","work_id":"4d10e4c6-07c6-47a2-bf06-94046a4b3d1a","year":2026},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:4ceddc49d0a889157c447e7dcf8b5e7c16594d46e78a73022a187b85c299283e","observation_id":"e00dabe7-4512-4bb7-9983-54f7d60efa9c","resolution":{"observed_at":"2026-05-14T20:59:27.477216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CL-bench leaderboard.https://www.clbench.com/","venue":null,"work_id":"e977157b-3f86-456f-8c13-2efe29c96b3d","year":2026},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:40331b07767860d01dfb6554f360c60b70bffece3676bc9ed34304beb6c74f51","observation_id":"940a004b-6b36-4823-9c16-eaa00539fe9c","resolution":{"observed_at":"2026-05-15T13:10:50.574390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:2c01f2680a290031473e3afd1b3c5d1139d3e57f4b36c030a9eb36a35e60976d","observation_id":"115147b6-6a04-43d2-aa6e-e7cef5472f11","resolution":{"observed_at":"2026-05-14T20:59:27.465430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-08-10T19:55:45.249416Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":"2404.02060","doi":"10.48550/arxiv.2404.02060","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long- context llms struggle with long in-context learning","venue":"arXiv (Cornell University)","work_id":"595d1e20-91fe-461e-9442-4baeb3560aee","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:7055c93b22430aa05832136932fca9834ac92d55615a52d8574797859d0abf4e","observation_id":"9d2b9f35-9e88-48ed-bcb7-abeb8bdc09fa","resolution":{"observed_at":"2026-05-14T20:59:27.471087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.10610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:09.503888Z","title":"Mmlongbench: Benchmarking long-context vision-language models effectively and thoroughly","venue":null,"work_id":"7c57f3bc-9274-4cae-9408-0472fb16354a","year":2025},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:2c0d29fa53bd5b864259dfe704982be72a72a807ad82e8989d21d404e25621f7","observation_id":"a953cadd-7c65-487a-ba33-653c989f3728","resolution":{"observed_at":"2026-05-14T20:59:27.460138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-04T01:28:52.686106Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":"2404.18532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-07-04T13:19:50.957441Z","title":"Milebench: Benchmarking mllms in long context","venue":null,"work_id":"2bf00545-5a48-438f-9805-41788308bea9","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:fb8e4eeb7bbba463b7d4cb82f47524c6cab2f8743c7c1f76e3ec4e8a9b37e78c","observation_id":"5a435841-c8b9-4dfc-ad51-0309e22c2e8b","resolution":{"observed_at":"2026-05-14T20:59:27.482431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"147d6141-9e02-4637-818b-a45b03230fda","year":2022},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:ff15bdb78cd5ceb1ecdcf3837fb2ac2dc29ce4c00cf3320046c9d21eec9c3063","observation_id":"e8012ecd-0b3e-48e4-a85b-587e8896339c","resolution":{"observed_at":"2026-05-15T13:10:50.591397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13164","last_updated":"2025-03-31T20:03:34Z","snapshot_observed_at":"2026-08-08T00:23:49.655888Z","submitted_at":"2024-03-19T21:31:56Z","title":"VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning","version":4},"cited_work":{"arxiv_id":"2403.13164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13164","snapshot_observed_at":"2026-07-03T05:07:39.144487Z","title":"Vl-icl bench: The devil in the details of multimodal in-context learning","venue":null,"work_id":"fe2facb8-537a-443f-9eb2-a03997802df6","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2403.13164","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:d59b8c305e71ab46f6b5bf5afcb97df30e4c939b12c47e7aa7f0a81c31dc4694","observation_id":"352b51bc-8eb7-447d-a147-9b4e415cfae9","resolution":{"observed_at":"2026-05-14T20:59:27.481171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"29a8fe98-bdca-46e8-a5a4-539a97075961","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:f56be443579dc81c6a74a228cee92644229d6055b9614cb637daf381736f68ac","observation_id":"590339c4-5ad7-4e7c-a458-0c99529196e7","resolution":{"observed_at":"2026-05-15T13:10:50.580399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:adaeebc1b7bc16154d7c971aa9ab5a9260b141fca403705c7533d5fc0f58c7cc","observation_id":"04e23971-e7e0-45ed-9158-43abe108f9de","resolution":{"observed_at":"2026-05-14T20:59:27.463094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"fb76a544-89a4-41bc-80f1-b35ab47742af","year":2017},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:1a28623e2ae97b680bc2a87d4258d5965e0b2f70008fefa079c89086eee5c2a0","observation_id":"c1bae3e1-9449-4d3c-b57c-b9090ac68e72","resolution":{"observed_at":"2026-05-15T13:10:50.584386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards vqa models that can read","venue":null,"work_id":"0eeedf3a-b771-4369-884b-564ffeaf6982","year":2019},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:3d1101a211461058e7ac71fcbde435eac7ff4424355cc7705482c3a126f193f2","observation_id":"07ead220-755a-47e8-aaf1-476cffe1c0ce","resolution":{"observed_at":"2026-05-15T13:10:50.578420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3557fccf-53ff-4e54-8a22-3a7d21b560cc","year":2019},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:1df0fd5abad94ade06ce744fd3d49fc0750624d013b006a768f10b65d9f35f9a","observation_id":"45c7f5f1-275a-4eef-b1fe-bbc3fcc6dc77","resolution":{"observed_at":"2026-05-15T13:10:50.595893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"039e85bf-9f46-4d1f-944d-dce968fe7cb9","year":2019},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:eb6a5c1d0bf87d849a34e0ffb007238f480f9decc615626803c25d533fd9bd39","observation_id":"bf2118fd-ef09-4835-90c9-4a3241c6649f","resolution":{"observed_at":"2026-05-15T13:10:50.582374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"20ac282b-f647-40ee-aeef-01a06ab45225","year":2021},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:291ceac6808193a895973504483f7300601b7545c7c4c4e97403c8e8281acef5","observation_id":"577c9b37-88e4-4c83-8c6d-81925e24e634","resolution":{"observed_at":"2026-05-15T13:10:50.586507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical multimodal transformers for multi-page docvqa.Pattern Recognition","venue":null,"work_id":"de4d3319-c400-4c09-9f67-4b190b433a46","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:407d944c2ef464541a1161119f1383a51d0558b60e54c552bffd2cccb937b044","observation_id":"41c0385d-8aa9-4cb3-acf9-8acb821913a6","resolution":{"observed_at":"2026-05-15T13:10:50.589116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fde972d2-72cb-40be-8828-9a1769fefb1d","year":2022},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:9cc4b9db2bcd68a567bf98a222a840dc95a30061321ef6f57bb118f2894647c5","observation_id":"f4c58843-b0c7-4c18-8b48-f342b0e582cb","resolution":{"observed_at":"2026-05-15T13:10:50.593740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"971f61dc-8ef5-4d7c-a8cd-351ac900ee4a","year":2022},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:9f77f1fe4cf96eca98b8df5ff5f18be1357e97c1c79422b48562487e9693f940","observation_id":"204b37e4-2144-475f-bbda-eff516f96a6c","resolution":{"observed_at":"2026-05-15T13:10:50.576322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06627","last_updated":"2024-04-15T18:03:26Z","snapshot_observed_at":"2026-07-06T16:30:29.783501Z","submitted_at":"2023-10-10T13:45:59Z","title":"What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models","version":4},"cited_work":{"arxiv_id":"2310.06627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.06627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What if the tv was off? examining counterfactual reasoning abilities of multi-modal language models","venue":null,"work_id":"29c53212-30bd-492b-8f29-9fb48a91ee9b","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2310.06627","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:0862c74851366846a313d63872d019239fa5728c2e905157997714c09b797466","observation_id":"44f91405-ceb0-4645-87cc-a4fa844a4657","resolution":{"observed_at":"2026-05-14T20:59:27.435741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01509","last_updated":"2025-03-20T02:49:09Z","snapshot_observed_at":"2026-08-10T13:00:40.129990Z","submitted_at":"2024-07-01T17:53:35Z","title":"MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs","version":5},"cited_work":{"arxiv_id":"2407.01509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.01509","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIA-Bench: Towards better instruction following evaluation of multimodal LLMs","venue":null,"work_id":"e1a325db-a0a4-4302-a8f6-0971bbf81fab","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2407.01509","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:bcae2e09a886669843f2fdc8a00823c669f9eca0605082a280368a52cd8d3aca","observation_id":"9a18e8bc-75b3-4e66-a435-f3097e4faf73","resolution":{"observed_at":"2026-05-14T20:59:27.443071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19509","snapshot_observed_at":"2026-07-03T20:18:56.636833Z","title":"Bench- marking multimodal knowledge conflict for large multimodal models.ArXiv, abs/2505.19509","venue":null,"work_id":"4fec24e9-06d4-4c9e-8268-76f2c9610a2b","year":2025},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2505.19509","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:061fc24ef37ffc0153c6b179e99b9ab32863a969bd9b6b473ca55f4b1a1d4879","observation_id":"e0494347-3837-40a3-95e8-2e0c2420a272","resolution":{"observed_at":"2026-05-14T20:59:27.451890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17722","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mt-video-bench: A holistic video understanding benchmark for evaluating multimodal llms in multi-turn dialogues","venue":null,"work_id":"cd3222f6-84e4-4579-83d4-315bfb57cc5c","year":2025},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:111713cd60ae6ed3375e98a32c9658109f4e637f38a231f830c8a79101bc6088","observation_id":"817684a6-0b8d-479f-87ec-5c2447b7bdfe","resolution":{"observed_at":"2026-05-14T20:59:27.488076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05523","last_updated":"2025-06-05T19:12:45Z","snapshot_observed_at":"2026-08-07T22:11:58.027730Z","submitted_at":"2025-06-05T19:12:45Z","title":"MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.05523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05523","snapshot_observed_at":"2026-07-02T19:07:17.489489Z","title":"Morse-500: A program- matically controllable video benchmark to stress-test multi- modal reasoning","venue":null,"work_id":"cc1d127b-004c-495c-9593-60e0057ce1b1","year":2025},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2506.05523","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:1ad84dd9f78c21d8cce5ece1eaa5286df73405b5b086924ff4064687d0f53549","observation_id":"e609a570-1da9-4af5-ba00-a91498e7fc37","resolution":{"observed_at":"2026-05-14T20:59:27.475069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19100","last_updated":"2025-02-15T05:19:38Z","snapshot_observed_at":"2026-07-06T19:39:19.409512Z","submitted_at":"2024-10-24T19:03:01Z","title":"VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks","version":3},"cited_work":{"arxiv_id":"2410.19100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.19100","snapshot_observed_at":"2026-07-02T02:56:28.711027Z","title":"Videowebarena: Evaluating long context multi- modal agents with video understanding web tasks.arXiv preprint arXiv:2410.19100, 2024","venue":null,"work_id":"eddc1abb-88d7-436a-97d1-f786498bc0ff","year":2024},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2410.19100","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:8d58992ed14cb54d057155f8ca8539d1ffa35abe2909d9e4c1fcde760fd9a7b6","observation_id":"9b796f75-f6d0-4afc-9c6d-3828fb8f5f0c","resolution":{"observed_at":"2026-05-14T20:59:27.468715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:50.873271Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2605.12703"},"observation_digest":"sha256:a56f3973ad1f1171b72f1f061e7a99f7fda69fe1708901ec8e0d1ab311c03422","observation_id":"35dda440-56d5-47d0-a120-ec6a11098604","resolution":{"observed_at":"2026-05-14T20:59:27.457543Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12703","last_updated":"2026-05-12T19:57:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T23:28:23.895717Z","submitted_at":"2026-05-12T19:57:37Z","title":"MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":13,"verified_fuzzy":8},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2605.12703."}