{"as_of":"2026-08-10T19:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d519c92953ed848847bfb839362207a53e58a8b6901f4755744951aab09200d","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:36:37.393483Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:56.015260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T14:14:55.612445Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"cited_work":{"arxiv_id":"2501.18648","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18648","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image, text, and speech data augmentation using multimodal LLMs for deep learning: A survey","venue":null,"work_id":"bad10dd8-3ffd-4b72-bfda-c6ca39c31148","year":2025},"citing_paper":{"arxiv_id":"2505.10708","last_updated":"2026-04-22T23:20:17Z","snapshot_observed_at":"2026-07-06T21:24:39.918413Z","submitted_at":"2025-05-15T21:05:33Z","title":"SafeTrans: LLM-assisted Transpilation from C to Rust","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T14:12:55.504993Z"},"links":{"cited_paper":"/paper/2501.18648","citing_paper":"/paper/2505.10708"},"observation_digest":"sha256:d5c72b195c59bf83c08e76a33d7675c26764f8e6b3d0744ece4f3695052e67d0","observation_id":"763b5aaf-b75e-4ada-8887-4dfad38ffd6c","resolution":{"observed_at":"2026-05-22T14:14:55.616435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18648","snapshot_observed_at":"2026-08-07T11:28:56.015260Z","title":"Image, text, and speech data augmentation using multimodal llms for deep learning: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T15:38:03.456563Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:56.015260Z"},"links":{"cited_paper":"/paper/2501.18648","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:be637069efa57bdf6f0c38442db3fe8c21c036b7e6b8a9ae7051052b152da2cc","observation_id":"80ddc295-914b-43f5-864b-888679f4acd2","resolution":{"observed_at":"2026-08-07T11:28:56.015260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"cited_work":{"arxiv_id":"2501.18648","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18648","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image, text, and speech data augmentation using multimodal LLMs for deep learning: A survey","venue":null,"work_id":"bad10dd8-3ffd-4b72-bfda-c6ca39c31148","year":2025},"citing_paper":{"arxiv_id":"2604.12048","last_updated":"2026-04-13T20:40:34Z","snapshot_observed_at":"2026-08-09T08:21:26.117598Z","submitted_at":"2026-04-13T20:40:34Z","title":"ORBIT: Guided Agentic Orchestration for Autonomous C-to-Rust Transpilation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T15:19:09.020005Z"},"links":{"cited_paper":"/paper/2501.18648","citing_paper":"/paper/2604.12048"},"observation_digest":"sha256:3961c2317577f46f24618f7025a5722893641cb53304092bb2dee95f66fb858f","observation_id":"73b99071-00fa-46f8-a614-09d889d6ee33","resolution":{"observed_at":"2026-05-11T10:46:05.073472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18648/citation-record","integrity":"/paper/2501.18648/integrity","json":"/paper/2501.18648/citation-record.json","paper":"/paper/2501.18648"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.882692Z","title":"Data aug- mentation techniques in time series domain: a survey and taxonomy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.882692Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:4e3576e3313350766f6dca4621c2e6a339b142f148a97a84606487a0339bb928","observation_id":"94d0501c-c7b6-4496-bedb-c82058bfdcd7","resolution":{"observed_at":"2026-08-10T04:36:36.882692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.889081Z","title":"A survey on image data augmentation for deep learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.889081Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:7f1cc9d3bace7e183b7c28702e7214ad03c8916b82b6113bd310590db7534b4b","observation_id":"20bd4bed-e38f-4823-824d-d3e311f414ef","resolution":{"observed_at":"2026-08-10T04:36:36.889081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.894427Z","title":"Learning to compose domain-specific transformations for data augmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.894427Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:2204f9d0bf2f34420d61756a20b23c205edf5f718f09125247503e7477dd7e77","observation_id":"b01d5ada-6bf2-4c3e-ac15-12d20e9640d5","resolution":{"observed_at":"2026-08-10T04:36:36.894427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.899931Z","title":"Data augmentation: A comprehensive survey of modern approaches","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.899931Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:aab9bd5d5fe7c65b190de96817b210800b6512f80af0a331325c482b38627a1e","observation_id":"b26f48a1-fb4c-4c98-9440-e59df99fe6b4","resolution":{"observed_at":"2026-08-10T04:36:36.899931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.905473Z","title":"An empirical survey of data augmentation for time series classification with neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.905473Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e90f4ab64ddbb6ce828875a21537692d60321f4add47bf9920e8476351b18d11","observation_id":"65bc3357-0870-4050-a371-68321bc4a7d5","resolution":{"observed_at":"2026-08-10T04:36:36.905473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.910502Z","title":"A review: Data pre-processing and data augmentation techniques","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.910502Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:d96c2dceb3e59730b01041f55b97051f551395a9b822856d83336619615bd3a1","observation_id":"69544c12-a2d4-4e00-9be4-f5b29c07e2ca","resolution":{"observed_at":"2026-08-10T04:36:36.910502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.916917Z","title":"Data augmentation in natural language processing: a novel text generation approach for long and short text classifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.916917Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:2da5f5d384235fa63cc3f3de160743e1cb54ec99e605478d1c7224890b4b36ca","observation_id":"23dfb845-987a-42cb-ae4e-9133f8a8eedc","resolution":{"observed_at":"2026-08-10T04:36:36.916917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.922131Z","title":"Data augmentation for object detection: A review","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.922131Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:fe3b097cb5af165b295741c4e4675942a37f9e031642bb94b1ed6de505fda966","observation_id":"ac373589-e0e0-4b5a-a2da-78972ce89953","resolution":{"observed_at":"2026-08-10T04:36:36.922131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.927850Z","title":"Toward text data augmentation for sentiment analysis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.927850Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:fd21567435f9c395e9cfaebabd357786b12490e179501655a13ca20f7e054ccb","observation_id":"1656c9c8-34cb-4acc-b7bb-3aaee5d37680","resolution":{"observed_at":"2026-08-10T04:36:36.927850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.932916Z","title":"Incorporating noise robustness in speech command recognition by noise augmentation of training data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.932916Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:dc4b7ebb1fc26d02018b4180e9bceb3ff05cb8262a45dd6301ba0d5eefdfe5ec","observation_id":"d1b250b3-82a4-481d-845d-12d74d746c04","resolution":{"observed_at":"2026-08-10T04:36:36.932916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.937860Z","title":"Look once to hear: Target speech hearing with noisy examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.937860Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:f628307db8f7ee78ca19162df4ea6f54d502db385940b73e1c91c4b029a681b2","observation_id":"6c546a1b-7839-4b22-bcd0-701a925fd8ee","resolution":{"observed_at":"2026-08-10T04:36:36.937860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.942752Z","title":"Perception and sensing for autonomous vehicles under adverse weather conditions: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.942752Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:d82d37658ec015dddf3c154774e1e39a38387fed0252bc1ecb878923c3050c89","observation_id":"3ec26437-5cca-4fa3-a71c-013d6283463c","resolution":{"observed_at":"2026-08-10T04:36:36.942752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.947984Z","title":"Safe traffic sign recognition through data augmentation for autonomous vehicles software","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.947984Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:3cec574bee223f579e774a92fdfdacf7d31943ef8b680bc2dfa8020b498092b6","observation_id":"44d4164b-6f92-4d7a-9b79-409a3bf233fd","resolution":{"observed_at":"2026-08-10T04:36:36.947984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.952931Z","title":"Medical image synthesis for data augmentation and anonymization using generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.952931Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e973d671b9fc838e70d6914c2728ce368702525a45a0a770472b01cebdc8d75b","observation_id":"aeeb538b-4661-475d-92d7-3e5b9b28a6c9","resolution":{"observed_at":"2026-08-10T04:36:36.952931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.957673Z","title":"A review of medical image data augmentation techniques for deep learning applications.Journal of Medical Imaging and Radiation Oncology, 65(5):545–563, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.957673Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:61200fabe6545332c05525251626e5dbc5832c4d5b642327d9d2131ed6df9cfc","observation_id":"0b48cd95-74fd-4f39-94ad-1ebdb353cf5a","resolution":{"observed_at":"2026-08-10T04:36:36.957673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.962899Z","title":"To augment or not to augment? a comparative study on text augmentation techniques for low-resource nlp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.962899Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:52b4faddaa0493083afdaced60b4de32924ccd1d22a8ad85f0c23580af982168","observation_id":"ffbb7c91-e59f-417c-a1d2-cb3347b4b00f","resolution":{"observed_at":"2026-08-10T04:36:36.962899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.967816Z","title":"An empirical survey of data augmentation for limited data learning in nlp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.967816Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:c1bc3eeb5c431b2213f477fa363c060a316312bb9685be87d4fc6016a555b924","observation_id":"f6eb9db6-a210-4066-83fc-3733966f8f9b","resolution":{"observed_at":"2026-08-10T04:36:36.967816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.972680Z","title":"A survey on face data augmentation for the training of deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.972680Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e5dae2ccb014ef422f519231e3345ef72c0ed53de0eba602e99c1d4e128a9c6f","observation_id":"e70e85cb-7f39-4938-a2ca-adf29bf514b5","resolution":{"observed_at":"2026-08-10T04:36:36.972680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.977773Z","title":"Data augmentation using llms: Data perspectives, learning paradigms and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.977773Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:87626a2428b15e3f5b1b8d46ec27f40be33482f9e52d9b529bacb36afab44698","observation_id":"3781bc13-09fe-446d-a57b-804a6e91993d","resolution":{"observed_at":"2026-08-10T04:36:36.977773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.982770Z","title":"Generative pre-trained transformer (gpt) in research: A systematic review on data augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.982770Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:84f3626db7bad2041f94f5ae376ae1aef19f81e92e3ce424429752eceef554a3","observation_id":"f981ae2a-9272-418b-bcd4-aabf4b8a2005","resolution":{"observed_at":"2026-08-10T04:36:36.982770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.988561Z","title":"A survey of knowledge enhanced pre-trained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.988561Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:458b2b89dc44764e7b79ed41ccb0f4acae6e703a0262700bbed899d145cc4fb0","observation_id":"d4c3769f-f12c-4f90-a753-1620f27d0569","resolution":{"observed_at":"2026-08-10T04:36:36.988561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:36.994495Z","title":"Data aug- mentation techniques for machine learning applied to optical spectroscopy datasets in agrifood applications: A comprehensive review","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:36.994495Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:4c8d190002abe557872e00b805b463347111d3f5be4f2d84f42859a2a7d889b7","observation_id":"7069f3ff-85e4-41dd-938e-12130db40877","resolution":{"observed_at":"2026-08-10T04:36:36.994495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.000143Z","title":"Speech recognition utilizing deep learning: A systematic review of the latest developments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.000143Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:22b9a197e8f8d8afbea0c7477e6f51061f913a0f7982439a9539dd5116a3929b","observation_id":"94144259-c452-47de-ade0-308dff5e95d1","resolution":{"observed_at":"2026-08-10T04:36:37.000143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.005219Z","title":"Data augmentation and deep learning methods in sound classification: A systematic review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.005219Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:aeba60c027100575445a578882b14141c2bfde8d751ee3242eea64ddaf788c23","observation_id":"047f96a9-2391-4926-b513-b54fab76ed98","resolution":{"observed_at":"2026-08-10T04:36:37.005219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.010677Z","title":"A survey of text data augmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.010677Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:9044a4cff1ba67f8dc20835741b5c203af5cc12959203ceede2ec97ca821cab2","observation_id":"2e211e99-4f1e-48de-bc6c-6631d6603018","resolution":{"observed_at":"2026-08-10T04:36:37.010677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.015809Z","title":"Survey on videos data augmentation for deep learning models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.015809Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:f9a4565d4336dd6074c13062309cf6649bbeb7478d6fbd099e421d2d6fb40f27","observation_id":"a98588ea-9db6-47de-9db7-3847882f0d71","resolution":{"observed_at":"2026-08-10T04:36:37.015809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.020680Z","title":"A survey on data augmentation for text classification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.020680Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:d7c31d4cb342cca131f1e04c3ef596bbc03539f3791b74167f2bc808f14d7da9","observation_id":"22afe267-0dcc-4ff7-8be7-07b0fbbba6f9","resolution":{"observed_at":"2026-08-10T04:36:37.020680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.025611Z","title":"Image data augmentation approaches: A comprehensive survey and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.025611Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:7c4ce4380e965ede12f4a310adabd6651b926354f0be10166447c81fcf211cd8","observation_id":"e4ba067a-8f49-467d-b3c6-70d28121070e","resolution":{"observed_at":"2026-08-10T04:36:37.025611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.030778Z","title":"Advancements in data augmentation and transfer learning: A comprehensive survey to address data scarcity challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.030778Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:3d12cbf78ccdb75f569fe96c3489e7b44d8959d06d23fdce9481c0615256bbad","observation_id":"b279c55f-c18b-411e-96fa-36716654ebe6","resolution":{"observed_at":"2026-08-10T04:36:37.030778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.035750Z","title":"A survey of synthetic data augmentation methods in machine vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.035750Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:2c0d00d666fe2acfa9af83423cb9cca1b117fa039176656978ee4158a42652aa","observation_id":"85ef3018-772c-4e36-be50-720de1cf302b","resolution":{"observed_at":"2026-08-10T04:36:37.035750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.041084Z","title":"Data augmentation using conditional generative adversarial networks for robust speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.041084Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e50ebb309d34c49b51a4479cf16d30a91d608421fab6a4bc7c2376423b7291f3","observation_id":"64c7f8ed-f1b6-4290-ba28-baee0b8c38bd","resolution":{"observed_at":"2026-08-10T04:36:37.041084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.046168Z","title":"Data augmentation using generative adversarial networks for robust speech recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.046168Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:717232233f710584ad5db5911d1dbbbaf7dcccc595247f79766ded11b5909e45","observation_id":"812a16ff-185c-428a-96de-98b1c32daeb4","resolution":{"observed_at":"2026-08-10T04:36:37.046168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.051070Z","title":"Generative adversarial networks for speech processing: A review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.051070Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:0de5b3e1f403bab95789cd2fda14b9f735d0b69b83750354049632a67b800895","observation_id":"4f9ad1ec-e938-4979-ab92-8d86744c1885","resolution":{"observed_at":"2026-08-10T04:36:37.051070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.055982Z","title":"How-to conduct a systematic literature review: A quick guide for computer science research","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.055982Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:2b97ac76f0bd0336ab6decead2905893eb4cad8266a8466848208b2ac836417e","observation_id":"42ed4e35-1a8a-418d-b404-a16de0ce5541","resolution":{"observed_at":"2026-08-10T04:36:37.055982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.061218Z","title":"Guiding principles for ethical research, n.d","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.061218Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:889e74ed66dc09c7c2b2ab5b43ba998f09cdf71222f96a109942aac7f2b19a89","observation_id":"812304f3-c063-445b-87c9-f5ed85d9604a","resolution":{"observed_at":"2026-08-10T04:36:37.061218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.066104Z","title":"Colour retinal image enhancement based on domain knowledge","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.066104Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:4fe2e94e16ca747e50af2cfae16e4bdcd4a879c2e916f893828ab26b77d1facf","observation_id":"fa3b37fd-cdbc-4130-9030-b38d857da8b2","resolution":{"observed_at":"2026-08-10T04:36:37.066104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.071219Z","title":"Gray and color image contrast enhancement by the curvelet transform","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.071219Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:f35c5895306c64045a14d189a2feddf6c91099dbaa8be133f987bdb11617b2c2","observation_id":"fe7313cd-b819-4aca-af93-c941c1c12e9b","resolution":{"observed_at":"2026-08-10T04:36:37.071219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.076068Z","title":"Image enhancement by histogram hyperbolization","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.076068Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:7475a47d8e3a57c03213f987d9a3eb81472cddce95ec742c9931a04b09d14bbd","observation_id":"b34d0f07-e213-4148-9a67-c9d361340df7","resolution":{"observed_at":"2026-08-10T04:36:37.076068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.081172Z","title":"Digital image enhancement and noise filtering by use of local statistics","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.081172Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:adf8278f76586ac42796333e58b77da4970e082047a0156a163ccb291437afe1","observation_id":"528e136e-bb63-4323-ab48-cabce6eef727","resolution":{"observed_at":"2026-08-10T04:36:37.081172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.085957Z","title":"Real-time image enhancement techniques","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.085957Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:aea949281f5da23180bd14f9722f61c70820333275e40a7b77a8877b34c729a9","observation_id":"96a247ae-f5a8-4d27-94ab-b2de65b06d5a","resolution":{"observed_at":"2026-08-10T04:36:37.085957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.090697Z","title":"Feature-oriented image enhancement using shock filters","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.090697Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:7c0b00c2231ad38f2f5db46ff6d04db38899518619f729c818891f62641b6dff","observation_id":"7faa3157-fb83-4560-96fd-7b399af47c1c","resolution":{"observed_at":"2026-08-10T04:36:37.090697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.095664Z","title":"Image enhancement using fuzzy set","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.095664Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:b7dd8f4934107da0d13aa9ce884de4f7c0eaa70a59c0247ef7552e413b7f3f27","observation_id":"83004d1f-c87c-483f-b52d-ab6a1d90613a","resolution":{"observed_at":"2026-08-10T04:36:37.095664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.100884Z","title":"Super-resolution image reconstruction: a technical overview","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.100884Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:afe1de0428cb94c9a82163b3249b4396084c48d4ea7fa7b3313e3addd0e910c0","observation_id":"175827d8-b896-42ac-ba4c-d582dcb0519f","resolution":{"observed_at":"2026-08-10T04:36:37.100884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.107949Z","title":"Accurate camera calibration for off-line, video-based augmented reality","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.107949Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:f2622f4e33142540cbed38a092007487199530d20c8acb5b4f749668bfc94789","observation_id":"990bbeb4-8203-4ee4-9592-d2ef5784367d","resolution":{"observed_at":"2026-08-10T04:36:37.107949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.113472Z","title":"A statistical approach to material classification using image patch exemplars","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.113472Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:c401ed1909624055127d921f2744167ce51eb07b77ca61727036b6e86e19d236","observation_id":"7da54937-9cf4-4220-9d59-6b4b00b0a8e2","resolution":{"observed_at":"2026-08-10T04:36:37.113472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.118287Z","title":"Jittering reduction in marker-based augmented reality systems","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.118287Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:4c126d42c551d8f804b90b14fa238724401c19c135e93e55ab0750b8ca49570d","observation_id":"f6a059e3-fde3-47d8-a5a3-4524f00033c2","resolution":{"observed_at":"2026-08-10T04:36:37.118287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.123096Z","title":"Transform image enhancement","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.123096Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:590d279ee6ecf18f5c66edf06abd54abda67ca87719cb7201a28d48a5796b3da","observation_id":"f1fc3810-cf00-4a21-8c32-a4b9896f447b","resolution":{"observed_at":"2026-08-10T04:36:37.123096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.128344Z","title":"Camera identification from cropped and scaled images","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.128344Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:97080ffeb3c7046874e394cadc4e38f02b5f3505b36f0a4d0a14169dbd48181c","observation_id":"2e56f12f-af01-43bc-96ae-73e94f361680","resolution":{"observed_at":"2026-08-10T04:36:37.128344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.133661Z","title":"Image enhancement by nonlinear extrapolation in frequency space","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.133661Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:d233c8550f4f90bb71946b390bcecfc551ec262e2a738575e254abc3aff3f048","observation_id":"b9eed5c1-c58d-4b34-8d6a-ce3d7a217034","resolution":{"observed_at":"2026-08-10T04:36:37.133661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.138683Z","title":"A text-to-picture synthesis system for augmenting communication","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.138683Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:370629c8b494c47a8046f66b1290bc5bd181777fc3cb979fbaabf7fd43e8a3fd","observation_id":"edc5880b-f68e-44e1-9a5c-0e4d3c784343","resolution":{"observed_at":"2026-08-10T04:36:37.138683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.143570Z","title":"Semantic representations of near-synonyms for automatic lexical choice","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.143570Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:98c6c7ab4349f30587a11c4ebf247e6b5a7a4ed1d20f4de1af1f49bc35dab946","observation_id":"79d4184e-1a34-4194-a742-04b9b0229ffa","resolution":{"observed_at":"2026-08-10T04:36:37.143570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.148422Z","title":"Word sense disambiguation with pictures","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.148422Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:378b04ef8607980adc4ff58289222fb97914748e04b72d9a4bacaccbee3c4649","observation_id":"cbf2b730-d0cc-4065-94a7-b3923a72f6ee","resolution":{"observed_at":"2026-08-10T04:36:37.148422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.153908Z","title":"Text classification by augmenting the bag-of-words representation with redundancy-compensated bigrams","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.153908Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:40d48408359ce4ae0d603f2dd8f6dd8c6120b148d912d033dc0b251f6c133845","observation_id":"e82c4bbf-ffc6-4448-a768-c78a6d2236c7","resolution":{"observed_at":"2026-08-10T04:36:37.153908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.158661Z","title":"Addition–deletion networks","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.158661Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:c5be44c564b3644f2c3eb43e4bb6fbf48226ea27bef8621eca0fa5dae473102d","observation_id":"6c2e3b0b-3789-4881-a5e8-4e2aef11c6c5","resolution":{"observed_at":"2026-08-10T04:36:37.158661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.163568Z","title":"Are good texts always better? interactions of text coherence, background knowledge, and levels of understanding in learning from text","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.163568Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:cf3f19253f03ea4e408e7cfd09cc485e6b35c191e1685ed42728de3517d20a49","observation_id":"efb7ac88-e8ea-4fee-835d-16114cba5a36","resolution":{"observed_at":"2026-08-10T04:36:37.163568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.168609Z","title":"Missing inaction: the dangers of ignoring missing data","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.168609Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:5d13e95ceab2fa889756ecbfb65fb8abdac640de49283e68aeeb2e5e8ee7925e","observation_id":"47aa5e3a-a54b-4d19-8362-55c6779ca1db","resolution":{"observed_at":"2026-08-10T04:36:37.168609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.173447Z","title":"Techniques for automatically correcting words in text","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.173447Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:be3c86ddf5b2a6d6f9064f786374d00ec7d3d14409f0b13378256ada76e31b86","observation_id":"0fe8770a-c501-4df3-90a4-29f580b48d33","resolution":{"observed_at":"2026-08-10T04:36:37.173447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.178231Z","title":"An augmented template-based approach to text realization","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.178231Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:c00e6330681798a74d2e3ac13be6b8f3a0d28d3d87a1d597ef397e3013bb4236","observation_id":"51312975-2988-4c94-b3aa-4588c66283ea","resolution":{"observed_at":"2026-08-10T04:36:37.178231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.183331Z","title":"Scene text extraction and translation for handheld devices","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.183331Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:bf72a0b1aadcbfb27e5f32700313ef786937e4bdca24e71951f89a623c5e88b2","observation_id":"6a8205ec-b85d-44a5-9935-364ac6061e59","resolution":{"observed_at":"2026-08-10T04:36:37.183331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.188607Z","title":"Augmenting the power of lsi in text retrieval: Singular value rescaling","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.188607Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:0a07b6b864faa9336d939535af0628f591e2c139612d4894ca74704ff2e5e0ac","observation_id":"f51130ce-83e6-459e-b0fc-e0630a9dd286","resolution":{"observed_at":"2026-08-10T04:36:37.188607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.194122Z","title":"The proper place of men and machines in language translation","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.194122Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:acfdd64437bd2241dbbcfe080d4839983033b5d7f609f8d8701ab5b2b92ce192","observation_id":"7f78fc6c-2303-47e7-8799-8b34c9d84090","resolution":{"observed_at":"2026-08-10T04:36:37.194122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.199312Z","title":"Embedding web-based statistical translation models in cross-language information retrieval","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.199312Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:aa9aaa452149327d5f98febaadcbf1601bf534342bf5f08e54bf1c5663be09ff","observation_id":"b29a1f95-5189-4d32-bc61-34e6b7ac6288","resolution":{"observed_at":"2026-08-10T04:36:37.199312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.204671Z","title":"A technical word-and term-translation aid using noisy parallel corpora across language groups","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.204671Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:ace48228ff7bd83ff376e4fef9d9a262df05786c349603bbeb3b15b313d013cc","observation_id":"f764078f-f7fd-4fb1-ba20-082ce830bde4","resolution":{"observed_at":"2026-08-10T04:36:37.204671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.210201Z","title":"Iterative clustering of high dimensional text data augmented by local search","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.210201Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:ddb0ac667eee0a8f46381e71bdc2071b4dcfe42f6f972e18e6e35a199f831ed9","observation_id":"caf2b31b-d28b-446a-b3f2-405c6ce696dc","resolution":{"observed_at":"2026-08-10T04:36:37.210201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.215357Z","title":"Augmented audio reality: Telepresence/vr hybrid acoustic environments","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.215357Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:8d38254d3fc052244dd7b94beb5aed1fab3daa3232f7ff55d80081779a7ccbe2","observation_id":"1df9d0f5-65cb-41d9-9e85-cefb82e68153","resolution":{"observed_at":"2026-08-10T04:36:37.215357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.220186Z","title":"Vocal cord augmentation with autogenous fat","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.220186Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:feb5c71dc6dbce7231a456da014cb04105f105020bf0f70cff0c791fb3d2415a","observation_id":"42897cc0-5516-46e4-94ed-d98d133e5635","resolution":{"observed_at":"2026-08-10T04:36:37.220186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.225307Z","title":"Audio and visually augmented teleconferencing","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.225307Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:ed6c2764e14407407403ae1cd424bf46dfbfe206f33d0e7bda87bf10cffdd3e1","observation_id":"6b01ec0d-1268-4c79-8737-fb9ee07b3ad1","resolution":{"observed_at":"2026-08-10T04:36:37.225307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.230099Z","title":"Ackerman, and Debby Hindus","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.230099Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:0790d371267fbe10ca12a89c60cbe38c5ad7e7fc7a42fba20167eb876d572c89","observation_id":"ef72fd8c-b6d2-4a92-9412-4f156063c2f0","resolution":{"observed_at":"2026-08-10T04:36:37.230099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.235099Z","title":"Can the lombard effect be used to improve low voice intensity in parkinson’s disease? European Journal of Disorders of Communication , 27(2):121–127, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.235099Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:9035a221e23cdad21d9d159bce2f3fadde302686dcf76eef67d708b8b3e93691","observation_id":"d30e73a8-294e-48d7-a27e-2f431bf18d8e","resolution":{"observed_at":"2026-08-10T04:36:37.235099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.239690Z","title":"Speech perception, localization, and lateralization with bilateral cochlear implants","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.239690Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:39452a2c9cda696631a6387f6f8474da502a603ed1be1b822d796e315b5dcbc9","observation_id":"32902113-038e-4a72-b45f-6e7cbd72e8a6","resolution":{"observed_at":"2026-08-10T04:36:37.239690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.244655Z","title":"Improving performance in noise for hearing aids and cochlear implants using coherent modulation filtering","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.244655Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:0e258e76ef959faeb987ae153000eb1df0d163b332831e22527fa3446160fb2a","observation_id":"7e7c8182-2a5d-41a7-baab-7d5730cb3611","resolution":{"observed_at":"2026-08-10T04:36:37.244655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.249717Z","title":"Speech recognition for a humanoid with motor noise utilizing missing feature theory","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.249717Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:5af8bf4d276dfe77e8dd41a50b8334c45483f14c4efdb5225f62244e41fce409","observation_id":"4d824749-df9e-4229-9065-ec4133a6bfbc","resolution":{"observed_at":"2026-08-10T04:36:37.249717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.254610Z","title":"Augmented reality audio for mobile and wearable appliances","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.254610Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:4c3027c4dfd4def7e051044207a8df356b28036b102902202470ab562faa4063","observation_id":"80b8c125-affd-40cb-b290-e20e686ed734","resolution":{"observed_at":"2026-08-10T04:36:37.254610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.259505Z","title":"Power supply noise in analog audio class d amplifiers","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.259505Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:c73636abf45187ff5d5eeec73a4662a6aca7fd224aae9c806d750da82a147cab","observation_id":"61b3996c-e4c7-4e28-bf19-f9ae3f4af0e4","resolution":{"observed_at":"2026-08-10T04:36:37.259505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.264379Z","title":"Deep convolutional neural network based medical image classification for disease diagnosis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.264379Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:1b7d3a511e0ffb2fc585bbaf0e9afc7f316077c85db3a94636348b6701ce32ff","observation_id":"b7b396fc-ee80-4798-a315-eb60b9c05f85","resolution":{"observed_at":"2026-08-10T04:36:37.264379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.269219Z","title":"Going deep in medical image analysis: concepts, methods, challenges, and future directions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.269219Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:808d3c4c81b93c270caf3529e09fec7a0509b6241d34bd9c00248645ded99d46","observation_id":"25e9b7e2-f5c9-4c1f-be9a-6c3398ab068f","resolution":{"observed_at":"2026-08-10T04:36:37.269219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.274303Z","title":"Adversarial differentiable data augmentation for autonomous systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.274303Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:1c08e41d1de61b856e8c6875fe159f8b128e5fa31af85ee7e043ce7919e635f3","observation_id":"ea5177f1-14c0-444e-98ed-48c19828a46d","resolution":{"observed_at":"2026-08-10T04:36:37.274303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.279774Z","title":"Data augmentation for deep learning based semantic segmentation and crop-weed classification in agricultural robotics","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.279774Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:c85a3a458ab6bd68862178a3470328424bc3e7f59b69cfdbb9e79ff4812a80db","observation_id":"11a311c2-d345-4bf3-a521-b44d9567cfa4","resolution":{"observed_at":"2026-08-10T04:36:37.279774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02633","last_updated":"2022-04-06T07:20:45Z","snapshot_observed_at":"2026-07-06T12:57:16.351782Z","submitted_at":"2022-04-06T07:20:45Z","title":"DAGAM: Data Augmentation with Generation And Modification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02633","snapshot_observed_at":"2026-08-10T04:36:37.284791Z","title":"Dagam: data augmentation with generation and modification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.284791Z"},"links":{"cited_paper":"/paper/2204.02633","citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:cf96dfedf4356bf5f5fb9a68071f896769ef5d8bcdd88ab8c907ada15ec5309b","observation_id":"f338ce1e-4f3a-4453-9a37-0b07c3278872","resolution":{"observed_at":"2026-08-10T04:36:37.284791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08789","last_updated":"2025-07-26T20:09:18Z","snapshot_observed_at":"2026-07-06T15:55:02.011880Z","submitted_at":"2023-07-17T19:17:10Z","title":"Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities","version":6},"cited_work":{"arxiv_id":"2307.08789","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.08789","snapshot_observed_at":"2026-08-10T04:36:40.545390Z","title":"Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities","venue":"cs.CV","work_id":"243ce9cd-9678-4753-92e6-97004b7629a8","year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.290650Z"},"links":{"cited_paper":"/paper/2307.08789","citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:a7259e270323a958975e3b3550574663095dcf23492f90c9e31cafaa50826dbb","observation_id":"7ae1d42d-27a9-4f11-a1f6-dd6f5df6df43","resolution":{"observed_at":"2026-08-10T04:36:40.551209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.296356Z","title":"Synthetic data generation for tabular health records: A systematic review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.296356Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:edb3c6ed194dd217de830d1835721750b44800e7550a651e4e39e1a408cb6233","observation_id":"66cda6a2-0cf3-4af4-8763-b9000de2769f","resolution":{"observed_at":"2026-08-10T04:36:37.296356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.301684Z","title":"Data augmentation for medical imaging: A systematic literature review","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.301684Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:fef87890a72e7f4ab125e719b0b5f8453c30cd32d42da240464887266500b6c2","observation_id":"ef86f27d-84d5-4c4d-bfe1-1b3f042ebc67","resolution":{"observed_at":"2026-08-10T04:36:37.301684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.306903Z","title":"Multi-modal llms in agriculture: A comprehensive review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.306903Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:76278714a1568441da98daf60a59fb8ab683d862694d8d31732ea85a27392736","observation_id":"c848dc83-e0e6-4821-8644-be026470ab82","resolution":{"observed_at":"2026-08-10T04:36:37.306903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.312065Z","title":"Research on data augmentation for image classification based on convolution neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.312065Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e920745216e683ea16b413e5234d5e87c972441cb5959575e523a4d9b17be3bd","observation_id":"1859460f-82db-41c6-bd72-383f27b9a4bf","resolution":{"observed_at":"2026-08-10T04:36:37.312065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.317193Z","title":"Data augmentation and generative machine learning on the cloud platform","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.317193Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:167183d8c38bde637ed4f7ce9552e43d49ac5bb46df8899f314ac2b609c57f5c","observation_id":"7cf4a101-8fd4-4295-8906-671ef30ae74d","resolution":{"observed_at":"2026-08-10T04:36:37.317193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.322050Z","title":"Data augmentation using deep generative models for embedding based speaker recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.322050Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:6aaecef14b3a4251138a900f2cb075163b34b904845ab719c6ca91646406ba15","observation_id":"f99bdc6d-2f1f-4985-aa55-124ffe2e1be6","resolution":{"observed_at":"2026-08-10T04:36:37.322050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cmp-lg/9406015","last_updated":"1994-06-07T18:17:15Z","snapshot_observed_at":"2026-07-07T01:33:19.217632Z","submitted_at":"1994-06-07T18:17:15Z","title":"Statistical Augmentation of a Chinese Machine-Readable Dictionary","version":1},"cited_work":{"arxiv_id":"cmp-lg/9406015","doi":null,"metadata_source":"pith","pith_arxiv_id":"cmp-lg/9406015","snapshot_observed_at":"2026-08-10T04:36:40.519135Z","title":"Statistical Augmentation of a Chinese Machine-Readable Dictionary","venue":"cmp-lg","work_id":"e0abc5a3-2390-4a39-b8a5-14eff01bb18e","year":1994},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.326820Z"},"links":{"cited_paper":"/paper/cmp-lg/9406015","citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:9ef7de0b6d3d6ef12046b9ef22b60dd252267193dfaedf6d8f0db31cfd1268b1","observation_id":"93ce9540-afb3-4093-bf4a-d7df71200239","resolution":{"observed_at":"2026-08-10T04:36:40.524795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.332059Z","title":"A comparison of id3 and backpropagation for english text-to-speech mapping","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.332059Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:8051fc89feb3c63bf893e2f537b77553158dd758f5a67f44b3bb8d7d2f8840d3","observation_id":"25744ac4-66a5-4abf-bf79-8ed70b2a9c03","resolution":{"observed_at":"2026-08-10T04:36:37.332059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.336892Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.336892Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:fe1e8383e55b965505a4038ceb155d8ce0f309fe5a3110f0db969f145be4f106","observation_id":"5b0ba7af-0f83-4446-9faf-6b1d4923bf61","resolution":{"observed_at":"2026-08-10T04:36:37.336892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.341637Z","title":"Srl-aco: A text augmentation framework based on semantic role labeling and ant colony optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.341637Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:153d9d9c9352d817e13ee436356d3836d016e037d5bba376cf6e4634b019c396","observation_id":"5ef8e37c-f0ff-4371-8ae0-70c261709fb3","resolution":{"observed_at":"2026-08-10T04:36:37.341637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.346759Z","title":"From theories on styles to their transfer in text: Bridging the gap with a hierarchical survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.346759Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:16ce700ffd57dc4ce282ece30c48dc40ad3dc71c719d496aec8b0d673e68ee2e","observation_id":"24e63926-3e4d-468b-a93e-1c35a2c781f9","resolution":{"observed_at":"2026-08-10T04:36:37.346759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.351795Z","title":"Summary of chatgpt-related research and perspective towards the future of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.351795Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:5407dad2b37de8cbcbc478123594eba38b2e1ad86eacc2f77fdf7d36a7d6edd7","observation_id":"8662a7b1-9908-44b4-b1d8-d66254b59665","resolution":{"observed_at":"2026-08-10T04:36:37.351795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.357623Z","title":"Survey on deep neural networks in speech and vision systems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.357623Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:0e3c8c88342a2b7b4a2fc60bead96fa77b33e8459137185aae39efdafdedee7c","observation_id":"25ef9681-2fbe-4811-8d35-af8604763111","resolution":{"observed_at":"2026-08-10T04:36:37.357623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.363135Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.363135Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e165d6481a7b4d182cfeb45b57b41467d2e42ff83ee63c413b50c696fa085cfc","observation_id":"7fa32c4f-8dbe-4dab-a294-3ee124a44298","resolution":{"observed_at":"2026-08-10T04:36:37.363135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.368046Z","title":"Automated building damage assessment and large-scale mapping by integrating satellite imagery, gis, and deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.368046Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:db4bf2ad12b467d36458693123eb9eae87c3669ecbc5c7d7729814f697978cd2","observation_id":"abd27d9c-19ff-481e-8596-2c3c65e3ebca","resolution":{"observed_at":"2026-08-10T04:36:37.368046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.373656Z","title":"Machine learning for advanced emission monitoring and reduction strategies in fossil fuel power plants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.373656Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:daa9aacac7f77709bd975cdacbdc1c0fb2e58e979f7e97f011680c5e5d67ff32","observation_id":"e117fe4c-cbf5-48d1-9a64-f181e685b8ac","resolution":{"observed_at":"2026-08-10T04:36:37.373656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.378456Z","title":"A review on large language models: Architectures, applications, taxonomies, open issues and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.378456Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:d97c81a76f4b209277379ced0b1ceeaf484565a3b90ee531d3c0ca86e771ed81","observation_id":"8a93cebc-465f-4130-8bcd-1fd05bad4371","resolution":{"observed_at":"2026-08-10T04:36:37.378456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.383521Z","title":"A comparison on data augmentation methods based on deep learning for audio classification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.383521Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:4efac05872b829a63d01d3834381a395ea003fd21117e712155aac6e736befd7","observation_id":"c7d05b4c-179d-4d19-aedf-b3ae5ddff980","resolution":{"observed_at":"2026-08-10T04:36:37.383521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.388689Z","title":"A study on data augmentation in voice anti-spoofing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.388689Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:fc2aef53b241afcd9c679dfb61c36d2dfe4938e9d275f592740eefae8b8010d5","observation_id":"6fcc3640-d25c-4f29-83d7-16ef18effa2c","resolution":{"observed_at":"2026-08-10T04:36:37.388689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:36:37.393483Z","title":"On the analysis of data augmentation methods for spectral imaged based heart sound classification using convolutional neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:37.393483Z"},"links":{"citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:e72e9a8bcadb28c8508ca081e30620a8d1f1873a98f88504027ea42e9d5742a5","observation_id":"052846a0-90c6-4626-aa5d-9913de8dbf8d","resolution":{"observed_at":"2026-08-10T04:36:37.393483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 3 inbound Pith citation observations for arXiv:2501.18648."}