{"as_of":"2026-08-11T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c8b13cb765507d38420d2d22f5bf9e0d26a381891751bb008d7d460ee3ee1f6","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T22:00:45.377456Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T22:00:45.377456Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-21T22:04:24.215885Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"cited_work":{"arxiv_id":"2509.18150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.18150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","venue":"cs.LG","work_id":"6591be99-5fc4-458c-8c72-44d6cc5c309e","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"cited_paper":"/paper/2509.18150","citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:c5c3f6bf8bfc514fa9ca0ec5190ad0a35c050764d75b668894504bae32908a40","observation_id":"f9bba53d-bd7d-4c60-861f-b3b74aaf6722","resolution":{"observed_at":"2026-05-21T22:04:24.217936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.18150/citation-record","integrity":"/paper/2509.18150/integrity","json":"/paper/2509.18150/citation-record.json","paper":"/paper/2509.18150"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"60f47ba3-89b5-4c7b-af71-332b2a7fed04","year":null},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:0c160a4e3da992ec67c110d61cbce34d38a6e1999a0cf4779bc74e8aefb2b00d","observation_id":"4e1fb56b-e447-4dbf-a374-e88b0fa0a53f","resolution":{"observed_at":"2026-05-21T22:04:24.922738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"cited_work":{"arxiv_id":"2509.18150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.18150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","venue":"cs.LG","work_id":"6591be99-5fc4-458c-8c72-44d6cc5c309e","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"cited_paper":"/paper/2509.18150","citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:c5c3f6bf8bfc514fa9ca0ec5190ad0a35c050764d75b668894504bae32908a40","observation_id":"f9bba53d-bd7d-4c60-861f-b3b74aaf6722","resolution":{"observed_at":"2026-05-21T22:04:24.217936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We also illustrate the ablation studies in Sec","venue":null,"work_id":"5a94277c-f056-452d-9498-324a45376507","year":2000},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:63f21d05eff5e9fc5f5b1a8aca2af3fa7493d3506ab37a0ced52a4b3b09feb05","observation_id":"3f96adc6-b2fc-4153-9716-725467d35a82","resolution":{"observed_at":"2026-05-21T22:04:24.929212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"STS reduces the computational overhead by using two components: VTC and LDS, which can compress redundant visual inputs and dynamically skip unnecessary decoder layers respectively","venue":null,"work_id":"29294f67-4078-4569-bc55-a1e460c0310a","year":null},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:83eed04f578947fd7883c316409db44a06aac4a2cf64c94e488e89b9a8256354","observation_id":"73a4119d-11c0-467a-8acd-13aecc428af3","resolution":{"observed_at":"2026-05-21T22:04:24.925913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"677e529c-2de1-4929-8280-b2d0b31d067e","year":2022},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:32163f16b748c4c8cc9571d744ffac49a52ea2f79de24c377cc03041365dccd5","observation_id":"5a40032d-362b-4be9-971a-033545dc5970","resolution":{"observed_at":"2026-05-21T22:04:24.932043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"f4579e79-0063-4155-8ebf-8cdbcf294286","year":2020},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:8903ab48028a0263e05df7139c9d0a03712a2e3af314d817249e6eb4738e346f","observation_id":"7742a0af-d60f-44b6-9d72-d164dfc0a478","resolution":{"observed_at":"2026-05-21T22:04:24.935309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":"ee4b4c29-8fbb-4448-b38e-9c71f8977a4f","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:fd83adc336d6ca555b53c9be260525e609a57433c8410d988ddfe9e65fd4e295","observation_id":"68119adc-d53e-40d4-ae33-dd2a82c2b49c","resolution":{"observed_at":"2026-05-21T22:04:24.889872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5 technical report","venue":null,"work_id":"aaec70ac-df30-445e-b659-d4f3971b164f","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:ce586bcc424540a2deeb805d419b33f3b3b6b15e4963a199358ff156cb23575a","observation_id":"8ca377b3-dd7a-40e9-a2e9-1ef4a7badb25","resolution":{"observed_at":"2026-05-21T22:04:24.914494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen im- age encoders and large language models","venue":null,"work_id":"c6bd28bf-3087-4fdb-842b-7ace641db104","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:8bb3c75242c34a2e2e0e21ba57d63fbdebb52e36e07d808b47dc46b55b00cc17","observation_id":"953397f2-46d9-4dee-bbbb-17009d76bc62","resolution":{"observed_at":"2026-05-21T22:04:24.918130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- ternvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"e8b2e3ae-f321-46dc-916a-da310aecb826","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:aa9cf546dceb9d473d8bb23931e1e26240a82b5f259147a75aab28e9a3b06755","observation_id":"a63decf4-66c0-472a-b131-029eb635cb4f","resolution":{"observed_at":"2026-05-21T22:04:24.928898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen-vl: A versatile vision-language model for understand- ing, localization, text reading, and beyond","venue":null,"work_id":"09b1057e-dc52-44a9-a525-2b79dedf2356","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:8477fbd4fbe59c46fd6d7d3a105eef449e47d4cc35ce3ab6d2f8b399155986e1","observation_id":"67dded0d-5605-4e11-baa1-86c8acfd2846","resolution":{"observed_at":"2026-05-21T22:04:24.925275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"a6e83ef3-8ed0-447b-bf99-b61c6ca8eb04","year":2022},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:c703b18893cf59c63928ab803c4cf8cb557c4a82085b67c4fc328089dd4ba390","observation_id":"50eda628-0ad0-4492-bff6-c37b7a09b322","resolution":{"observed_at":"2026-05-21T22:04:24.938540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"f9cdf6f0-29a5-4b50-a8ea-a915a8978ecb","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:252c50f7a49878d136d6d1332717a0a70730e49d255087929db0a48ff48f4cf6","observation_id":"b98092d6-438a-4182-a3d4-5b54c3d21715","resolution":{"observed_at":"2026-05-21T22:04:24.932009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"b6fa03f2-b720-4473-a41f-94f617c97acf","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:eb94eb103d46fced502fb8d844edab8cfaa3e4fed2b4a5e8e0bf8a7c5798ae74","observation_id":"436012f6-a21b-4006-b0d9-1b43f9c99347","resolution":{"observed_at":"2026-05-21T22:04:24.935607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02547","last_updated":"2024-06-04T17:59:25Z","snapshot_observed_at":"2026-08-11T14:28:53.408835Z","submitted_at":"2024-06-04T17:59:25Z","title":"Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning","version":1},"cited_work":{"arxiv_id":"2406.02547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02547","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging visual tokens for ex- tended text contexts in multi-modal learning","venue":null,"work_id":"b753f08e-27dd-44ed-a1ad-d0b968d97149","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"cited_paper":"/paper/2406.02547","citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:a85e80f4b3760fc13469c0113e634748cbf6f37046704a0cf93ba2923dce2ac1","observation_id":"6623c92a-1315-499e-bacb-3f490b497a14","resolution":{"observed_at":"2026-05-21T22:04:24.222596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"d7b88163-8c70-40f2-a907-c975dcaeb42e","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:7f3ef9bde01643ec1c40f860fe15382fa86567dfb3b72923c7370758d1316b4a","observation_id":"b849fce7-0d80-48d5-b6ba-cccae4ce6b51","resolution":{"observed_at":"2026-05-21T22:04:24.910762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"ef5ea09c-0d8e-4bcd-8c55-f5b355cdd707","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:286a2e6bb330393718e5574ee1f9ff7084c75af08da888d548f623e98ce4d7b3","observation_id":"74f63105-2c8f-4980-90cf-be861f56596a","resolution":{"observed_at":"2026-05-21T22:04:24.916514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feather the throttle: Revisiting visual token pruning for vision- language model acceleration","venue":null,"work_id":"af0de5c0-e0a2-41a3-88bd-951804b21b70","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:8c88f2becda7dd6b6d7d1b602f61c1860f82a05b377e156ff72adcee7209fc1a","observation_id":"024760ff-0dcc-4a83-a78d-7002f377df43","resolution":{"observed_at":"2026-05-21T22:04:24.910041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse- vlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":"eb7dc044-6e0e-4ed9-a8d5-0c4004e9f983","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:bd321735598419ff5565dbf6047f7f1879efc4328fa6e6c4e6a12316107fd43f","observation_id":"3969b073-fcd6-477c-943a-87d3af17b17d","resolution":{"observed_at":"2026-05-21T22:04:24.922118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advancing multimodal large language mod- els with quantization-aware scale learning for efficient adap- tation","venue":null,"work_id":"70eecbee-4920-45d9-8934-e865f1b38a89","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:3d9752aa8d462e5f7829be934f9822b0c82f2072a19f703675b550163746da41","observation_id":"12493ba0-039a-4f87-81c4-66f18fa2e7c8","resolution":{"observed_at":"2026-05-21T22:05:42.116510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.03351","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:27:05.580336Z","title":"Vlmq: Efficient post-training quantization for large vision- language models via hessian augmentation","venue":null,"work_id":"f2f17173-f267-448a-8f82-259a6da38568","year":2026},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:fb1a6930480e26caf73ccb5cbe40b5ea580b06f796e0453f72076d95cd190a11","observation_id":"ec4881ea-e242-428d-8d87-bb21e00fe79a","resolution":{"observed_at":"2026-05-21T22:04:24.206029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A multi- level framework for accelerating training transformer models","venue":null,"work_id":"63bcfb3d-81c7-468e-8bf6-cd85fbd5acde","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:d3682e0a0b2a2b8315cada991e989b7ee023af8a6d8abfaaea9c8d3fb23908c5","observation_id":"80c4004d-dd03-469b-a046-ef227dd2389b","resolution":{"observed_at":"2026-05-21T22:04:24.903743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Staged training for transformer lan- guage models","venue":null,"work_id":"e04a2480-8533-42da-a72f-ff332e790fe7","year":2022},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:1b062a6bbe55b530b32297d207dcbda4bf681b4869a70a1af618a90ecac5c122","observation_id":"6673568a-47f6-42a4-bda5-5635c99e9e41","resolution":{"observed_at":"2026-05-21T22:05:42.127765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"No train no gain: Revisiting efficient training algorithms for transformer-based language models","venue":null,"work_id":"ff3bf1b5-097d-468c-82a9-ba0303ec7f90","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:0d58b83fb68920905b85528d2dcee791f6f10d3ecb661f1af2f8088e3c3e6691","observation_id":"e7d1e826-9a5d-443d-898c-72b9629fd743","resolution":{"observed_at":"2026-05-21T22:05:42.121956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large multi-modal mod- els via visual context compression","venue":null,"work_id":"420d33ff-68f8-49e9-9d58-2d8ac0a25ee7","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:31776f99c8a1403af0f3825ad94cbca04a81414b2e75c2673bb01a3e216762ab","observation_id":"a941bdcf-8578-40ad-a5a8-180801b9f1cd","resolution":{"observed_at":"2026-05-21T22:05:42.119162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":"3f1c9c5b-eff8-4a2a-a731-8717baf548ae","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:002da169218da72853191674b4f65490398c1b21a87c85b8d591f014e32589c6","observation_id":"d13c2368-2272-4a64-a59e-bb5e555a47ae","resolution":{"observed_at":"2026-05-21T22:05:42.130526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring activation patterns of parameters in lan- guage models","venue":null,"work_id":"bf09bd46-f4d6-44f5-a5a4-b86429059cce","year":2025},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:11017bcf11dc53d5e1c5389dcb120be7eb52de8e90f7678fd33cfbd0653018d0","observation_id":"d7aa18bb-d07a-4a15-9bb5-86b45795bc4d","resolution":{"observed_at":"2026-05-21T22:04:24.939089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mipha: A comprehensive overhaul of multimodal as- sistant with small language models","venue":null,"work_id":"47c0bd00-2b28-4b91-afc4-72e19c82e42f","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:51c94261d4a18a60cc1b5d9747372234992aa52ae3799b34f1377e26d014a660","observation_id":"348f31bb-3b9b-4ff4-be0d-4368203838bf","resolution":{"observed_at":"2026-05-21T22:04:24.941975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moe-llava: Mixture of experts for large vision-language mod- els","venue":null,"work_id":"5db41dc3-9b74-4c18-bd98-e6cac5069076","year":2024},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:e1bc48d42354ad1bd64a6e8134497da74189653634c1097bd17f73aaa4870bee","observation_id":"14c3fd0a-a23c-4b27-a32d-41866300da52","resolution":{"observed_at":"2026-05-21T22:04:24.945204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"be050465-13d2-43a1-8fe8-c7915154a39b","year":2019},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:2ef1eb53d537346aed90cfd07861a20e4d18ebcf9e1bdb437de7ac6b347f00f2","observation_id":"076b03f8-c546-402b-b2f6-e83f968bf3d8","resolution":{"observed_at":"2026-05-21T22:04:24.948366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answer- ing","venue":null,"work_id":"7cc31e68-0772-426c-88f2-eb9378fc6b17","year":2017},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:969cb771514b062006eebe73a33314c09e5c17a142a3020b11b702a53033248d","observation_id":"42c9cbd5-71e3-465b-abd2-37d4eb8ef881","resolution":{"observed_at":"2026-05-21T22:05:42.124650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":"2209.09513","doi":"10.48550/arxiv.2209.09513","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":"arXiv (Cornell University)","work_id":"5379429b-ef16-4b3b-b4dc-f8a0df7fa66b","year":2022},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:df39518471c8e3049d04bcb2eb804062202a5216c198d394d762432ac2e40090","observation_id":"25940f83-fed7-47d3-a2a8-beaa8f68caf9","resolution":{"observed_at":"2026-05-21T22:04:24.213919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:e79e14c86bc8ac57f0078c621a3db134c22c5e500dd2134998189345ee074e0e","observation_id":"880ee0b3-6a84-4808-b96d-18099edfb21a","resolution":{"observed_at":"2026-05-21T22:04:24.210033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"637ad550-9501-40e3-9623-ce2336363b31","year":2023},"citing_paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:45.377456Z"},"links":{"citing_paper":"/paper/2509.18150"},"observation_digest":"sha256:40657f0fb19b73e1432aac8dc85699aadb9a22b8efedb9fe4a83fa830d98441e","observation_id":"08f7686e-d1fa-48d7-9c9e-094b3e9cec27","resolution":{"observed_at":"2026-05-21T22:04:24.919608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.18150","last_updated":"2026-05-18T07:54:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T19:54:51.242122Z","submitted_at":"2025-09-16T11:33:20Z","title":"Improving MLLM Training Efficiency via Stage-Aware Sparsity"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":5,"verified_fuzzy":28},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2509.18150."}