{"as_of":"2026-08-13T02:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93a85ac9c5c5b7869db7cc5be34eac86fdc6a46d4e40f20d9437069de6c090bb","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:45:46.148987Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T21:28:37.680681Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"cited_work":{"arxiv_id":"2501.04155","doi":"10.48550/arxiv.2501.04155","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","venue":"arXiv (Cornell University)","work_id":"1b27d025-fdae-44b9-a054-8ecde2fd3fc4","year":2025},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2501.04155","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:0eef8ee584e185eb4813813ee2d9809b61328feb16d3680d1fe34b5b09310e97","observation_id":"ac973bde-508f-42a9-8b61-26faac0367b8","resolution":{"observed_at":"2026-05-13T02:57:09.442144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"cited_work":{"arxiv_id":"2501.04155","doi":"10.48550/arxiv.2501.04155","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","venue":"arXiv (Cornell University)","work_id":"1b27d025-fdae-44b9-a054-8ecde2fd3fc4","year":2025},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2501.04155","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:4d5a847c88885b30ded77d626e66208654d36891a995dc843d15bb2f8125547c","observation_id":"e8383d39-89ac-468f-83f8-6624a3821a07","resolution":{"observed_at":"2026-05-14T21:29:28.681673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"cited_work":{"arxiv_id":"2501.04155","doi":"10.48550/arxiv.2501.04155","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","venue":"arXiv (Cornell University)","work_id":"1b27d025-fdae-44b9-a054-8ecde2fd3fc4","year":2025},"citing_paper":{"arxiv_id":"2605.11634","last_updated":"2026-05-12T06:57:47Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:57:47Z","title":"Unlocking UML Class Diagram Understanding in Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:39:50.027264Z"},"links":{"cited_paper":"/paper/2501.04155","citing_paper":"/paper/2605.11634"},"observation_digest":"sha256:54f0ff2b37a13e3dc69056f07ef6fd15f3e5a75b8a391ef8f1443782ccacc306","observation_id":"f93a6f5e-3930-4dc7-ad66-56309254a29c","resolution":{"observed_at":"2026-05-13T01:42:02.618815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04155/citation-record","integrity":"/paper/2501.04155/integrity","json":"/paper/2501.04155/citation-record.json","paper":"/paper/2501.04155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.692887Z","title":null,"venue":null,"work_id":"8e3a799d-e9fa-4051-bc42-99cf3596db30","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.674255Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:cb26df362a9c98d493f1254e4f22005b10bae18d4eaca0d4ed6afab63867741c","observation_id":"e0def824-6a1a-4cca-a2cd-8c401bd92ee2","resolution":{"observed_at":"2026-08-10T21:45:47.698235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.673855Z","title":null,"venue":null,"work_id":"fabaa763-7572-45d6-83eb-e2ab30241be4","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.679645Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:410cefc444c465b8dc7ddac660dbe9d7b154e9c62a2924298f5925e703bf1761","observation_id":"16a9f92a-8eaf-46fc-a474-aa8f9bf4390d","resolution":{"observed_at":"2026-08-10T21:45:47.679392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10566","last_updated":"2024-09-13T18:01:49Z","snapshot_observed_at":"2026-08-12T22:45:15.997572Z","submitted_at":"2024-09-13T18:01:49Z","title":"Eureka: Evaluating and Understanding Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10566","snapshot_observed_at":"2026-08-10T21:45:45.685534Z","title":"Eureka: Eval- uating and understanding large foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.685534Z"},"links":{"cited_paper":"/paper/2409.10566","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:98289312868f776b1f7620b9deea7cc7ed6ec0eab2939f27667fb61cadda25bc","observation_id":"fa811d3f-279e-405b-87ec-5b725f5caf2c","resolution":{"observed_at":"2026-08-10T21:45:45.685534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.647555Z","title":"Introduction to Natural Language Pro- cessing","venue":null,"work_id":"aa4d2053-99c6-47b5-908f-0bd0b5523005","year":1992},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.691150Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:2bad43315579c8d13d8503afb5a48a102b3a6613b3f60fe318bfd97fd82408d5","observation_id":"6b99cb32-86f6-4adc-b1f8-35f0b0144e5b","resolution":{"observed_at":"2026-08-10T21:45:47.653822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.630864Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":"1023d9e7-f299-4bfa-b381-338ec9515bda","year":2021},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.703431Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:884bd53f9a93886dae13583a58ba9817ec113e7ab4fdfaa14d18b54a6f0df6fa","observation_id":"f90a3c62-72a6-41df-bf1e-1a24d80661fe","resolution":{"observed_at":"2026-08-10T21:45:47.636329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.612593Z","title":"Sharegpt4v: Improving large multi-modal models with better captions,","venue":null,"work_id":"aa6ddc82-baf6-4267-84ed-dd87ff7f68cd","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.708945Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:2a9ad5a5037d48122c2fffecdab8ab182390d2f0bddc443394fd0cf767e8635d","observation_id":"d597aca8-aa56-4094-9aa8-b3306e2aed41","resolution":{"observed_at":"2026-08-10T21:45:47.621454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-08-10T22:03:25.770697Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-10T21:45:45.714805Z","title":"Alpagasus: Training a better alpaca with fewer data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.714805Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:44921e80241da95ac55376cebce83fa59edcb9d51532fa17415e588190839509","observation_id":"2f826d38-c6e4-4022-a905-0f2c1dde5257","resolution":{"observed_at":"2026-08-10T21:45:45.714805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11829","last_updated":"2020-10-27T00:52:20Z","snapshot_observed_at":"2026-07-06T08:03:24.054624Z","submitted_at":"2019-06-26T23:01:47Z","title":"Selection via Proxy: Efficient Data Selection for Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.11829","snapshot_observed_at":"2026-08-10T21:45:45.721082Z","title":"Selection via proxy: Efficient data se- lection for deep learning","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.721082Z"},"links":{"cited_paper":"/paper/1906.11829","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:7c9cd7328a50fe982b5ef68185a7b0840ccf1ae2a744c6bbf17b6231952d204e","observation_id":"f57deb5f-8094-49ef-aa8e-8c43bd611be7","resolution":{"observed_at":"2026-08-10T21:45:45.721082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.592806Z","title":"A survey on in-context learning, 2024","venue":null,"work_id":"bb141388-476f-4ea7-8583-bc8fe44f5105","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.725412Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:ec35d43ea80b38227d74e5a56f5a2d71944c3d3f683de9373a01c1df8305b1dd","observation_id":"3f0ef15c-d78f-4b4b-8729-b705e4a8e8c2","resolution":{"observed_at":"2026-08-10T21:45:47.597592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T21:45:45.729541Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.729541Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:f194e72620047f58dc25fc797c3a7604d72f5468562fca5e6093bce9809e545f","observation_id":"b88e0666-15ca-46fa-9cea-85783dd9ac06","resolution":{"observed_at":"2026-08-10T21:45:45.729541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.562490Z","title":"Tinystories: How small can language models be and still speak coherent english?, 2023","venue":null,"work_id":"73bc02f2-ef42-4266-892b-68643a71ca12","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.733543Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:f1c340f415d58545053b06532795dbaa640ea64c5bbb204d91b4f6b5958a9aa9","observation_id":"a7f45de2-aae3-463c-b563-90662e2ae71b","resolution":{"observed_at":"2026-08-10T21:45:47.579297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17711","last_updated":"2024-06-25T16:52:37Z","snapshot_observed_at":"2026-08-12T23:35:06.399024Z","submitted_at":"2024-06-25T16:52:37Z","title":"Data curation via joint example selection further accelerates multimodal learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17711","snapshot_observed_at":"2026-08-10T21:45:45.737944Z","title":"Data curation via joint example selec- tion further accelerates multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.737944Z"},"links":{"cited_paper":"/paper/2406.17711","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:9ae227505b3f7be887d0013760f0e8ef33a6f6d1c103e6b098b1853e68c7dc95","observation_id":"91ce6dd0-283b-4568-9cc0-10540dec98d6","resolution":{"observed_at":"2026-08-10T21:45:45.737944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.533088Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"9e540cde-e9aa-44a3-beec-6c6584a4c8ad","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.743101Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:24bcb664699595340eace3c52642288345376b4c66969b9411e8d5da334e5a9e","observation_id":"a6175318-33b7-43c8-89f7-70956a29f416","resolution":{"observed_at":"2026-08-10T21:45:47.538874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.510053Z","title":"Data fil- tering networks, 2023","venue":null,"work_id":"003c2db4-726c-43ee-8614-edf5e055e18d","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.747389Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:b3b388a622e34119f5b53d3eafb3e67510ade8cd187028727712b7827ee7f3ba","observation_id":"91bceeee-3b9b-485b-ada7-45b350f679a6","resolution":{"observed_at":"2026-08-10T21:45:47.520855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.486159Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"5a20bd68-8baa-4ad1-ae1e-811dad119207","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.752067Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:5212a6ad6af42f6517f28c1b4469549eece025f6224917a84d9f6f7a362ea98c","observation_id":"480ff99d-ec12-41ec-8a86-7267c4fe9fef","resolution":{"observed_at":"2026-08-10T21:45:47.492428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.470548Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"1f52aa86-8e86-4fbd-ac82-9fdd94ce0271","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.757274Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:db705823e1f010dff91df78be2b10f64b2fe98c052e3c6271862e76a418844ea","observation_id":"d06e20d5-c06c-417c-9eb6-8ad535de0467","resolution":{"observed_at":"2026-08-10T21:45:47.475310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.446843Z","title":"Textbooks are all you need, 2023","venue":null,"work_id":"b733fdf7-8128-4a71-90ea-ba5f57067d9a","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.762665Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:ed8110b077af8130a80e160cec654028d28ef34f20c513a3588cf910d93059f7","observation_id":"f3951993-f15d-49da-8fe6-8f24fb16161f","resolution":{"observed_at":"2026-08-10T21:45:47.453986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.428371Z","title":"Statistical Methods for Speech Recogni- tion","venue":null,"work_id":"24596c81-1f3e-4430-8454-65689c5aeb4c","year":1997},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.766460Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:ac4466b318a7cfb75c2c5bb4f26af71e952282784d3ee871ca8680b78a9c8346","observation_id":"9a90dad8-22f3-4995-9be3-23a89620a890","resolution":{"observed_at":"2026-08-10T21:45:47.433242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.411618Z","title":"Data-efficient contrastive self-supervised learning: Most beneficial exam- ples for supervised learning contribute the least","venue":null,"work_id":"4f866895-b3ee-47f5-ab38-6c1b1383a2dc","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.771697Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:2ca7681a8281fe436b0ad9b4f6b0c98b26e0e867eaf20f7503f6b573caa476cf","observation_id":"2d18b204-ead3-48a5-987f-7d9df402fbe2","resolution":{"observed_at":"2026-08-10T21:45:47.418100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.394803Z","title":"Data-efficient contrastive language-image pre- training: Prioritizing data quality over quantity, 2024","venue":null,"work_id":"0867182b-7d82-4a86-abd9-a335c0e52bdf","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.906802Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:f41a5f177ce8653df070d838fc1be873aa52618687e5333d94da6fee253e64e0","observation_id":"26c40066-ca40-4111-ba37-05090a8ab588","resolution":{"observed_at":"2026-08-10T21:45:47.399558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.373045Z","title":"What’s ”up” with vision-language models? investigating their strug- gle with spatial reasoning, 2023","venue":null,"work_id":"1e90d8df-514e-4e01-881c-9eb89ee79753","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.911771Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:66bccee72c2b73256c4453ed89bf54f8ad1e152ffead7eee3ed3082e68e22a04","observation_id":"9fc42298-ffae-4ff3-b920-8f8db743d20e","resolution":{"observed_at":"2026-08-10T21:45:47.383268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.353573Z","title":"Not all sam- ples are created equal: Deep learning with importance sam- pling","venue":null,"work_id":"abb6618e-874e-4124-b265-2fffe980a5c9","year":2018},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.915930Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:1e6937ba9da6b5e64f9c07d05eb2b53406b225ce09659d2916154609ee4f617f","observation_id":"d9d34882-3d13-45ae-91ff-e3fc602c97ed","resolution":{"observed_at":"2026-08-10T21:45:47.360864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:45.920097Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.920097Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:eb0ae1824a08f4aa75ebace8db3cb5b9d0bcaf89d742434fb4edde4da3a16449","observation_id":"80fbdd5b-f870-4798-9d68-55de9976f92d","resolution":{"observed_at":"2026-08-10T21:45:45.920097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.302282Z","title":"Grad-match: Gradient matching based data subset selection for efficient deep model training","venue":null,"work_id":"fb3814fc-b2d2-4bee-b577-626824442ff3","year":2021},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.928292Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:1a8b53ad8fb4c579b921c65a79fcda6fc65c8d4b4763580f06c387039dfa279e","observation_id":"94ca5eeb-8653-4765-8e0f-abcd00236f8e","resolution":{"observed_at":"2026-08-10T21:45:47.309657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.285080Z","title":"Revisit large-scale image-caption data in pre-training multi- modal foundation models, 2024","venue":null,"work_id":"61a26e12-b3bd-4393-af32-0dbc0fa87ce9","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.932593Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:567dfb45e6b944e0f45e3c5d09be54405a1d80e44f9a7a5d43830470f5be4a15","observation_id":"cd7275d1-fe30-4ccc-adeb-5b68524de13b","resolution":{"observed_at":"2026-08-10T21:45:47.290284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:45.936558Z","title":"Veclip: Improving clip training via visual-enriched captions,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.936558Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:91a65ec11f78c7b9609cc9c33a19eae2f069fcd2801bf396c0b8626553d72674","observation_id":"c6bc482d-75a7-4721-8036-7e202af722ea","resolution":{"observed_at":"2026-08-10T21:45:45.936558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-12T09:36:48.705293Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-10T21:45:45.940806Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.940806Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:efbf1ca65cfe4123b3b71bc5080614645d5939dc1b0953db158fbdee15c6e603","observation_id":"7dd9a7a5-e192-4923-9288-c98bfaceeb94","resolution":{"observed_at":"2026-08-10T21:45:45.940806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:45.945149Z","title":"Textbooks are all you need ii: phi-1.5 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.945149Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:41c30554a945f94265d872ff82143a9a025c749510338190ef01b166f94d1ce3","observation_id":"f6ccc2c0-cf5c-4081-b7b4-db4d30d78697","resolution":{"observed_at":"2026-08-10T21:45:45.945149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.242259Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"2c6bb41e-c93c-4add-a914-828d8498c5cd","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.948900Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:228f0e30e4125cc8f132bea967097101d8a6add0b01acfa36a69e4ca8ca6e124","observation_id":"a9b8a560-b0a3-4fe4-bfe3-246c2a309289","resolution":{"observed_at":"2026-08-10T21:45:47.246927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.227629Z","title":"T-MARS: Improving visual representations by circumventing text feature learning","venue":null,"work_id":"53122c68-01a9-408b-8d21-ae8ac27d0de4","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.952814Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:710d5d33171f08470a5a6325f05ffc33cc25fc02b6cf15108db33e533c66ef93","observation_id":"6d8ee901-ecfc-4de0-818e-394d550b92a5","resolution":{"observed_at":"2026-08-10T21:45:47.232888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-12T22:52:53.265830Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-10T21:45:45.956267Z","title":"When less is more: In- vestigating data pruning for pretraining llms at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.956267Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:0e25335c161c82b5a02004754f15fe2a247ab85f40bee470b76a35e3534b74d7","observation_id":"81b1b235-bad7-4ea9-9c48-ef461e92a2e8","resolution":{"observed_at":"2026-08-10T21:45:45.956267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.213399Z","title":"Joty, and Enamul Hoque","venue":null,"work_id":"72b77ad6-4698-4c2f-b6f7-7fa114e17825","year":2022},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.960156Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:b21d940a91a0fdc91ccbd23c7d7a88cf6a2759186ff43453b91fc3d2beb1e06e","observation_id":"97b13408-1408-497c-bbcd-e2ec1173d76f","resolution":{"observed_at":"2026-08-10T21:45:47.217798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.178768Z","title":"Chartinstruct: Instruction tuning for chart comprehension and reasoning,","venue":null,"work_id":"1f90f476-0a41-4029-9133-caac644fea54","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.969503Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:9c9e982c8929e756ca4f938efa645043cf68b0cd234f21081f13ccefbc64aaf6","observation_id":"585c7a07-f294-4e00-ba51-6e49d2fc65f0","resolution":{"observed_at":"2026-08-10T21:45:47.184369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.162487Z","title":"Mmiu: Multimodal multi- image understanding for evaluating large vision-language models, 2024","venue":null,"work_id":"f72c0fc5-5f90-4bbf-b804-f053cd4cafad","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.974012Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:2311ae4af6d42ff5ca8907b6abdba65f2011f15fff3ae205838dc46b2f00d5fb","observation_id":"5f923886-9885-455c-a8c6-9fe06caed7df","resolution":{"observed_at":"2026-08-10T21:45:47.168981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.142053Z","title":"Coresets for data-efficient training of machine learning mod- els","venue":null,"work_id":"3cbb4d5d-bc82-4a02-9aaf-cb1a9f163205","year":2020},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.978496Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:c2b6f166d521d592d04b730d8f8c66dfeeaf2d8d4e4741f13e29decf31c6edad","observation_id":"375f069d-e6e4-4116-adcf-8aabd8afa165","resolution":{"observed_at":"2026-08-10T21:45:47.147986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.123474Z","title":"Orca 2: Teaching small language models how to reason, 2023","venue":null,"work_id":"c67ad3ac-e142-4f6f-9d83-e140f9ec376c","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.982471Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:676a4974a3b76196c663d14f0a95410311c99dcaf585153c2474ff020eaf88a5","observation_id":"d6d30720-6c6f-4300-a80a-8500b3f2ce19","resolution":{"observed_at":"2026-08-10T21:45:47.128426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.098742Z","title":"Agentinstruct: Toward generative teaching with agentic flows, 2024","venue":null,"work_id":"277f7cf4-03bb-4a5c-9b3c-741c6987646f","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.987055Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:f66aca1cd5f1cc2e14d840d37fc8324af085341aefb3d1a5cf54e20b4c3d388a","observation_id":"6772d19d-d32f-4bf5-a53f-9cf2e2f4baf9","resolution":{"observed_at":"2026-08-10T21:45:47.111690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.074681Z","title":"Orca: Progressive learning from complex explanation traces of gpt- 4, 2023","venue":null,"work_id":"9fb82655-84d2-4155-98f7-f5572a2f1c01","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.991377Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:0f8ca2074562f0a4850a89f7311ec70a5f1d8fa1807956dbfd3302a2b6021f5f","observation_id":"7d9775f9-a91c-48ae-94b0-4db88dd951a6","resolution":{"observed_at":"2026-08-10T21:45:47.086437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.054508Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":"8028f5e8-f79b-48ab-9277-154a968fb743","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.995650Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:c8e52da631a122a6e424c41d60302cb1b6a6768b7ed08e06318c4beef2b0d85a","observation_id":"966db625-5b0a-4672-ba1c-ccbe55accc66","resolution":{"observed_at":"2026-08-10T21:45:47.060679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T21:45:46.000150Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.000150Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:a091e0c7afee48dacdb259076a4eae12e7de200efc9fed1044e7c22feb06fd17","observation_id":"0d1b369f-d3c2-455c-9aa6-90b60dcc1cdb","resolution":{"observed_at":"2026-08-10T21:45:46.000150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.004308Z","title":"Deep learning on a data diet: Finding important ex- amples early in training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.004308Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:11e439110d4c167833ea272b6079a2979946da74025212e7a32b8f8f90dcf30b","observation_id":"b37b0661-1dbe-4c0b-a23b-623d3d5e449d","resolution":{"observed_at":"2026-08-10T21:45:46.004308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.023784Z","title":"Adaptive second order coresets for data-efficient machine learning","venue":null,"work_id":"2e453179-5708-40eb-bf27-5912cc8ecf3b","year":2022},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.008764Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:b9e99a577125731cd68e65e0dc60c77bfef07ead27e732fe07f369009ebda83a","observation_id":"7441493e-9901-42cd-8f78-b9741ec5c742","resolution":{"observed_at":"2026-08-10T21:45:47.028134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.012853Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.012853Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:579ce152a57ecfe6316c30ef15db06e0bd0e458126d74c0c501f0a241c7bae92","observation_id":"0c9f476e-2b9f-404c-bc01-aeda92c41599","resolution":{"observed_at":"2026-08-10T21:45:46.012853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17718","last_updated":"2023-11-15T14:57:32Z","snapshot_observed_at":"2026-08-10T18:39:08.811385Z","submitted_at":"2023-05-28T13:16:03Z","title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17718","snapshot_observed_at":"2026-08-10T21:45:46.017427Z","title":"Fusecap: Leveraging large language models for enriched fused image captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.017427Z"},"links":{"cited_paper":"/paper/2305.17718","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:1cc92064d3b7002be9677065cc3da91d6073c9fb176b6ffc1771a323db3feb70","observation_id":"e09306b9-615d-45fb-96bf-a95e914fc6e9","resolution":{"observed_at":"2026-08-10T21:45:46.017427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.981890Z","title":"Is a caption worth a thousand im- ages? a study on representation learning","venue":null,"work_id":"af4edc0f-4a82-4deb-99cd-8a4952c01f69","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.022417Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:3db0e34ad7ed3b13d2a2138b83c68cd090ae098414b6c00e6769402754ed427a","observation_id":"1fe657d6-43b0-4aa6-98ff-41a1eadeca3e","resolution":{"observed_at":"2026-08-10T21:45:46.992347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.956670Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"da400200-73f8-4581-a6b7-b3db52ca8778","year":2022},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.027100Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:89e39fa39cd37fe15424a307b55de95ee9b1891bd7067ad8f37c1bb0190aa334","observation_id":"39e4111d-ce49-4428-b350-7cedebdd518d","resolution":{"observed_at":"2026-08-10T21:45:46.965511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.936601Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"2bd479ab-f842-47e0-9113-7fb125791f0a","year":2018},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.031188Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:87d9633eae48b7df925e6e8dca0e6a49f09387cdd934dde2f4ca48ac5aef5874","observation_id":"36f9edc2-e3cb-4aa2-a14b-42e62cb9f5b1","resolution":{"observed_at":"2026-08-10T21:45:46.943332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.908771Z","title":"Math- llava: Bootstrapping mathematical reasoning for multimodal large language models, 2024","venue":null,"work_id":"7e5af10d-9020-45f9-ae9b-b949747cc02d","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.035329Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:fe8a0e8515d752193dd57a6d4bc96022f7981bd02a0a51d937df977ee5e125d5","observation_id":"d94aea82-d231-4228-bf57-7325fe8e7948","resolution":{"observed_at":"2026-08-10T21:45:46.915219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.889161Z","title":"Chatgpt-4 vision struggles with radiologic image interpretation","venue":null,"work_id":"f21adc08-a032-4ba1-ae7c-bb3a5dc2c592","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.039698Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:29726b18adb917bc1cb0a0bd1d0c74655f035607908cafd3958b16963760cbd2","observation_id":"f96b1b11-bae4-4952-b324-f9d0c1fd5603","resolution":{"observed_at":"2026-08-10T21:45:46.896538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10795","last_updated":"2020-10-15T05:53:46Z","snapshot_observed_at":"2026-08-11T21:19:06.148202Z","submitted_at":"2020-09-22T20:19:41Z","title":"Dataset Cartography: Mapping and Diagnosing Datasets with Training Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10795","snapshot_observed_at":"2026-08-10T21:45:46.044678Z","title":"Dataset cartography: Mapping and diag- nosing datasets with training dynamics","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.044678Z"},"links":{"cited_paper":"/paper/2009.10795","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:a74c430c07b967a7b3b104d4ef3485cbb6348fdde9c52b137ba02376fc735e77","observation_id":"8d4114e7-e92e-4315-919c-15eae6eea1b7","resolution":{"observed_at":"2026-08-10T21:45:46.044678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.864883Z","title":null,"venue":null,"work_id":"f33c5633-f4c1-410c-9e23-e37282710005","year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.049655Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:7df31646f5e279c422ff635c998b06db0336b828b59059b1673772abe0ee8d5b","observation_id":"f7827bac-5b2f-49c4-9ae3-25caf3d7bdb2","resolution":{"observed_at":"2026-08-10T21:45:46.872048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05159","last_updated":"2019-11-15T17:08:30Z","snapshot_observed_at":"2026-08-01T06:33:25.731787Z","submitted_at":"2018-12-12T21:24:15Z","title":"An Empirical Study of Example Forgetting during Deep Neural Network Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05159","snapshot_observed_at":"2026-08-10T21:45:46.054263Z","title":"An empirical study of example forget- ting during deep neural network learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.054263Z"},"links":{"cited_paper":"/paper/1812.05159","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:04f908c5fcbe417e97219c5e4b4f2040debc27502240aab07a8b7dbfbc2ede25","observation_id":"780bbae5-20fd-4acc-98d1-5ea42e275b6a","resolution":{"observed_at":"2026-08-10T21:45:46.054263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.835756Z","title":"Dynamic data selection for efficient ssl via coarse-to-fine re- finement","venue":null,"work_id":"545384e6-c7e4-4a41-8687-fc6d42d05f4f","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.058675Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:b9f6cc0876fdecd3ecfc1c6696dc2fbce5ecf8b897719ce8e5c2bdc06452a13b","observation_id":"a1565f15-2808-4542-a8ff-29620c750f04","resolution":{"observed_at":"2026-08-10T21:45:46.841057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.063180Z","title":"Show and tell: Lessons learned from the 2015 mscoco image captioning challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.063180Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:f40dc9c8472c4059ef610772c01e7afccf58de2e8e4cf077d534795bb3589947","observation_id":"352f8531-7729-42b3-ac28-45ac41f85937","resolution":{"observed_at":"2026-08-10T21:45:46.063180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.813188Z","title":"Is a picture worth a thou- sand words? delving into spatial reasoning for vision lan- guage models","venue":null,"work_id":"9aceab6f-5342-4012-9dfe-11cf40d1112a","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.068355Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:f79fba003bbcf0af8ab24ef4dc1573d667cd4edf7d3b79c069c0536d40ec0754","observation_id":"1715ed42-84bd-4452-97d9-33cd6d7d81a4","resolution":{"observed_at":"2026-08-10T21:45:46.818213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02418","last_updated":"2023-12-05T01:19:30Z","snapshot_observed_at":"2026-08-10T07:21:45.884226Z","submitted_at":"2023-12-05T01:19:30Z","title":"Decoding Data Quality via Synthetic Corruptions: Embedding-guided Pruning of Code Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02418","snapshot_observed_at":"2026-08-10T21:45:46.075086Z","title":"Decoding data quality via synthetic corruptions: Embedding-guided pruning of code data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.075086Z"},"links":{"cited_paper":"/paper/2312.02418","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:bb4b77d789f1782ca01dcc2decae37fd46475fdf6cbae7445c036196126c0278","observation_id":"082548be-0f79-4cb3-b979-4b187a08643c","resolution":{"observed_at":"2026-08-10T21:45:46.075086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.798162Z","title":"Capsfu- sion: Rethinking image-text data at scale, 2024","venue":null,"work_id":"67071e80-0a63-4cde-8075-45a29d584386","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.081145Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:1d511efd5aefd97e0b27c3cbe083f2fd5fdf01a4b061db13ff5e8c47415692f2","observation_id":"0728e6dd-9bae-4dee-8845-0769751b2e0b","resolution":{"observed_at":"2026-08-10T21:45:46.803460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.782334Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"64d9c9d6-061f-4fb1-b7c6-dcb224766875","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.086087Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:32a09055bf91e3218fb4ad0cece860be1d7fa1f232aa4aea773a7a661d1b4511","observation_id":"4c2bfe0e-b3a2-465f-98a9-51acff9f3453","resolution":{"observed_at":"2026-08-10T21:45:46.788371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.765805Z","title":"Multimodal self-instruct: Synthetic abstract image and visual reasoning instruction using language model, 2024","venue":null,"work_id":"169f9430-c8d8-4356-a6c5-066758aaef22","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.091233Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:3b5409b5eac4d1dd064e308c9fcd0b59063af4e26f5d3c5eb593d5ce492bdc0c","observation_id":"42f49a25-c3fb-495b-876c-e260f90e1e37","resolution":{"observed_at":"2026-08-10T21:45:46.771221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.751339Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"2c090fc7-7e7a-40dc-8013-a5d32224fe64","year":2024},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.096926Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:9f08c263dd3c11cdd083256294acd25f124732a958a863d7b9fbae43a4bc6131","observation_id":"338dfdf7-4491-485b-b8a4-aa512523bbea","resolution":{"observed_at":"2026-08-10T21:45:46.755567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T21:45:46.102791Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.102791Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:cc18b9bb67c56eed4d04ccdb768e29fbf5d478f0b81cc31793d7532129302602","observation_id":"0384b6f5-82c5-4c52-82d0-a9ce40c7e24e","resolution":{"observed_at":"2026-08-10T21:45:46.102791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.732388Z","title":null,"venue":null,"work_id":"7fc6fdf5-842a-4ed9-adc0-cac4dcd9267d","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.109989Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:0665df12a794786857e1bed7205e2ac9e6345660c07c64d850359f798d0a9d6c","observation_id":"fca5074e-2878-4323-b264-106069c62193","resolution":{"observed_at":"2026-08-10T21:45:46.737796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.713521Z","title":null,"venue":null,"work_id":"fede8234-38a7-4680-af28-76347097dbac","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.115378Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:5cb8d41b7c2dd4421555e0a23ac76060ed4c93a11442dd147c0afbd7debc3af5","observation_id":"7d031cdb-4b33-4c4b-9006-b195c8611540","resolution":{"observed_at":"2026-08-10T21:45:46.718986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.695840Z","title":null,"venue":null,"work_id":"0576e090-8149-4a46-9463-631fd5427f98","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.120785Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:21bcdc54f0bca284d3fc28035e34772b3186b2e32b442d12337d6e187afc0558","observation_id":"3622dcb6-4e75-4d0a-a05b-a258c69a8ee3","resolution":{"observed_at":"2026-08-10T21:45:46.701823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.461043Z","title":null,"venue":null,"work_id":"89003bb6-7711-40a2-93c2-c950e2b19d7c","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.125900Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:aeda1e62b4db68adec0e5fc56f3bc25bbc489065cb47abca8780ffd531471814","observation_id":"2a2cd15e-85ae-4343-99ba-77929c6c5cd2","resolution":{"observed_at":"2026-08-10T21:45:46.683180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.440081Z","title":"Q\": The generated question (include options if it’s multiple-choice). -","venue":null,"work_id":"a316256b-01e1-485e-ad54-e82600dce5d2","year":2011},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.131769Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:386bbbaee0d90cc0eb0cc1962aace50e74480cb45ce7c3282b73e4444aece40e","observation_id":"59f8e91d-9f74-4057-80de-d888344960c2","resolution":{"observed_at":"2026-08-10T21:45:46.446901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.423354Z","title":null,"venue":null,"work_id":"6daa2779-94ec-48f9-8c0f-10e831fbce05","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.137605Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:c21844ddcc87503011acae4cd76ebb5a27436330a562545ad0227b3995c38a6c","observation_id":"842fba42-ce9e-4cd6-a8e7-53cf0c9ec6a4","resolution":{"observed_at":"2026-08-10T21:45:46.428751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.404232Z","title":null,"venue":null,"work_id":"25b7799b-03ac-49e7-9c62-8adf2b4c58c4","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.142195Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:fdb7456452f24904db478aaa8bd4a15a619c0ba2162806d718b08c31999b15d4","observation_id":"cbbbe3ac-33bd-45f5-9780-c2d150fa0176","resolution":{"observed_at":"2026-08-10T21:45:46.409958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:46.385941Z","title":null,"venue":null,"work_id":"0f0afedf-485f-4df6-a621-95b1cf8a5eb2","year":null},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:46.148987Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:8ab77bdc4e9c517d3aec237e8d701c9a27f9b82bda6a8a7a0361e717ecd386e1","observation_id":"363f0474-8c9a-4ed0-a547-9ffa06d47600","resolution":{"observed_at":"2026-08-10T21:45:46.393032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.324762Z","title":null,"venue":null,"work_id":"39126daf-c038-447c-9ff6-1b24030b1fff","year":2016},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.923926Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:ede6a749c3fb953b6c016cb1160cd824415e8071c597338212991577e269b35f","observation_id":"26f1a52b-f90d-4bdc-b54b-ae663d6e4b1a","resolution":{"observed_at":"2026-08-10T21:45:47.331313Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:47.195289Z","title":"3, 4, 5, 6","venue":null,"work_id":"6589ca5e-f27c-43a5-ad21-b6cbefeeda10","year":2022},"citing_paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation","version":1},"reference_index":2279,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:45.964422Z"},"links":{"citing_paper":"/paper/2501.04155"},"observation_digest":"sha256:012bbdc93505c174f61f629f50745d4860046433068587e32edbeba237dc726d","observation_id":"bc4665e9-da03-44f8-9961-72f23475c1bb","resolution":{"observed_at":"2026-08-10T21:45:47.201313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.04155","last_updated":"2025-01-07T21:55:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:30:24.098756Z","submitted_at":"2025-01-07T21:55:56Z","title":"MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":29,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 3 inbound Pith citation observations for arXiv:2501.04155."}