{"as_of":"2026-08-10T02:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ee01a59a316e34fecabc9c584cbea7cc8980dc44991365c20aca8d31feb53db","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:00:27.624272Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04606/citation-record","integrity":"/paper/2509.04606/integrity","json":"/paper/2509.04606/citation-record.json","paper":"/paper/2509.04606"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.347629Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.347629Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:cc2b75765dc8f6cf11c1f683f3914a55ecf626dcef23eae7c9a0521b2ff6a131","observation_id":"2f8a0821-0365-4ce2-8ef7-be3ab526b42a","resolution":{"observed_at":"2026-08-05T06:00:27.347629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.351735Z","title":"METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.351735Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:70ad99e726488acd221e56fa44b361e0262280ab8397475830004ac69011ea2d","observation_id":"35edd962-0a12-493b-81a6-a225b62e64e1","resolution":{"observed_at":"2026-08-05T06:00:27.351735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.355363Z","title":"SciBERT: A Pretrained Language Model for Scientific Text","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.355363Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:99ec9b564b6881003cf5fe0a7df530910e9e20655aaf78cd0070becab6748312","observation_id":"729df4e2-7fdb-41c5-89f6-4abbd5723dbd","resolution":{"observed_at":"2026-08-05T06:00:27.355363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.700012Z","title":"NLTK: The Natural Language Toolkit","venue":null,"work_id":"fb03b812-fe06-4230-b667-1e4cd093f1f9","year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.358727Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e1fe03e868977011585eab5265abffb207f8fcbc47e5f3dc373b05ca6f16f8e4","observation_id":"52b3f11a-abd8-44a2-9194-f1f5d591dc3d","resolution":{"observed_at":"2026-08-05T06:00:28.703504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.681193Z","title":"Principled Weight Initialization for Hypernet- works","venue":null,"work_id":"ea8bd10a-16ed-440d-8691-06855b164a5f","year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.365462Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:4ec2baa6793292fce28d655211b553e0fcd1946721ab6142b91ae8394f3beeaa","observation_id":"bbd15379-b951-4764-81f9-08beaadec2c3","resolution":{"observed_at":"2026-08-05T06:00:28.685327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.670202Z","title":null,"venue":null,"work_id":"d9579761-667b-4cab-a03e-8b663ccd4172","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.368816Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:fbe448a7af970c3fc0e7fa7b595690d130b0945f50fe08def1d5fbe6780c0580","observation_id":"9ce7754a-25e9-4a83-a14a-92d454518309","resolution":{"observed_at":"2026-08-05T06:00:28.673581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.659086Z","title":"Model Composition for Multimodal Large Language Models","venue":null,"work_id":"ae62471d-4e9e-4a4c-9a6c-0b1ba34b223d","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.371871Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8b81aa8e08d6ac7fa0ea56e2a02101f551a4ba5c0a0508488027a41997084ad1","observation_id":"19d6a5c3-2dcb-4106-9e8e-a3aa651fc2e0","resolution":{"observed_at":"2026-08-05T06:00:28.662659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10407","last_updated":"2022-03-30T06:27:02Z","snapshot_observed_at":"2026-08-08T23:59:41.812457Z","submitted_at":"2021-02-20T18:02:42Z","title":"VisualGPT: Data-efficient Adaptation of Pretrained Language Models for Image Captioning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10407","snapshot_observed_at":"2026-08-05T06:00:27.375861Z","title":"VisualGPT: Data-efficient Image Captioning by Balancing Visual Input and Linguistic Knowledge from Pretraining.CoRR, abs/2102.10407, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.375861Z"},"links":{"cited_paper":"/paper/2102.10407","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:d4b568bc4adc630b483040980a72f2baad82f2c924e48abebae55b695b0f4c6c","observation_id":"fe851190-7f20-4bbe-8c17-a8977c1193f0","resolution":{"observed_at":"2026-08-05T06:00:27.375861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.647732Z","title":"ShareGPT4V dataset on Huggingface, 2024","venue":null,"work_id":"702b48b8-22aa-4b53-bd92-df3f9ac6a8a2","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.379381Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:6d6cdbddf64e46e56da4866c9f4517791695aa8a54440469940cfd7d1a5735c6","observation_id":"e24a920f-f6b6-4ac8-9638-295cd646cb97","resolution":{"observed_at":"2026-08-05T06:00:28.651036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T06:00:27.382458Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.382458Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:96f6ffc35ec2277bc2f15d947654514167058fe067108fa20088d99736f36209","observation_id":"3eca805e-75f3-48af-84b9-e36cdc55ae61","resolution":{"observed_at":"2026-08-05T06:00:27.382458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-05T06:00:27.385958Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.385958Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:064861effd9ffaa8f4f73e545923b86c91983f532aa5adf50e7e65609bc8f113","observation_id":"0aa4d782-5645-4153-abea-5c2f8d9af55e","resolution":{"observed_at":"2026-08-05T06:00:27.385958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.636556Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":null,"work_id":"fdd95d2a-db2b-46c8-82cc-b977937097b0","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.389467Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0b01c65a49e37fffee8f8a646bc702f67bcb4af110644dd5b2926122ac139e71","observation_id":"14282f81-28c1-4c87-baac-c5f0769d31ae","resolution":{"observed_at":"2026-08-05T06:00:28.640423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.625784Z","title":"Clotho: an Audio Captioning Dataset","venue":null,"work_id":"0d203448-ccfe-4645-89fc-e7905fbc01c6","year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.392519Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:b80812ae4ed2a7eee8ad00578293b6d75de3d8dd5d79e7cc951954bd942f60b5","observation_id":"b7772c53-2d53-42a6-8b50-6866bcdceab5","resolution":{"observed_at":"2026-08-05T06:00:28.629325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T06:00:27.395415Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.395415Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:b689e698e96ef09034160ad9c74b8306fc14814eb2a3709c659d12e90763a817","observation_id":"64d0fa1a-de22-41d4-83a9-4f47178f035a","resolution":{"observed_at":"2026-08-05T06:00:27.395415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.613692Z","title":"Translation between Molecules and Natural Language","venue":null,"work_id":"9eaf0f37-e3ad-4ece-9064-302c6e525f91","year":2022},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.398553Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9398c88dc77a6128c24a555e2e32bf7f2a9ea8a60f9132e351ba843278959cda","observation_id":"1ba264ee-f0f7-426d-82cb-12b582238489","resolution":{"observed_at":"2026-08-05T06:00:28.617697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.599880Z","title":"Text2Mol: Cross-Modal Molecule Retrieval with Natural Language Queries","venue":null,"work_id":"ffa37239-aa00-4501-a619-363e00697b43","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.401720Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:4a7d06f628f94d533a4f528d41a29844312b95b57e8ca2f46514b3e997e8f661","observation_id":"1ebccddf-3e33-4d6f-b15e-0aee71e19356","resolution":{"observed_at":"2026-08-05T06:00:28.604214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.585225Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","venue":null,"work_id":"fdb14aa4-bd09-42e0-8210-710cc9e9c413","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.405152Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5c894761b5342c3d945ef137a158c8c5cb9e756b33747249d0e0e89ef1a22232","observation_id":"6e368e0f-ea9c-4e09-8204-85e6726c689d","resolution":{"observed_at":"2026-08-05T06:00:28.591261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-05T06:00:27.408297Z","title":"LLaMA-Adapter V2: Parameter- Efficient Visual Instruction Model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.408297Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:daafe6a6520688b7b058f5b101027da80671b247aaedd99caf74a25156b8a10a","observation_id":"1103c595-0c97-45a9-950a-6ee92563f76d","resolution":{"observed_at":"2026-08-05T06:00:27.408297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-05T06:00:27.412176Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.412176Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:35e264dc4d57e9db75f1ba7f66e88a41b3a08785fc321ca0f2b4e312fe7004b6","observation_id":"27c96fe5-b1de-46d0-b399-c6852e091228","resolution":{"observed_at":"2026-08-05T06:00:27.412176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02080","last_updated":"2025-06-10T22:29:42Z","snapshot_observed_at":"2026-08-07T04:26:25.661223Z","submitted_at":"2024-10-02T23:00:31Z","title":"EMMA: Efficient Visual Alignment in Multi-Modal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02080","snapshot_observed_at":"2026-08-05T06:00:27.415722Z","title":"EMMA: Efficient Visual Alignment in Multi-Modal LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.415722Z"},"links":{"cited_paper":"/paper/2410.02080","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5365fc0f05b89cc86434631e8961881cf78438f319c25ff5a6829f5cbd7becd4","observation_id":"912c348b-6a3c-48db-96fc-aa5f64be68fc","resolution":{"observed_at":"2026-08-05T06:00:27.415722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.571556Z","title":"Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast","venue":null,"work_id":"7fbcb21a-2f75-4f79-bc4b-2086b7342716","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.418978Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:88a3330640159d2f57f05a57b4ffb66be34f4b30f75b6507f54c9c7f7ae64055","observation_id":"5eda6399-96e9-45f9-af9a-e946405d6d62","resolution":{"observed_at":"2026-08-05T06:00:28.575918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.556933Z","title":"LLaV A-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","venue":null,"work_id":"9a5518e5-e626-45ce-927c-7c5da24469fb","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.422124Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:1cb372df1cc0b5fcf35e5fd16690c220a5559870c6c01d8d733eb762a936292e","observation_id":"79ad8104-c7ca-4c61-8ac2-8b86a7a5e8c3","resolution":{"observed_at":"2026-08-05T06:00:28.561245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.425765Z","title":"Dai, and Quoc V","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.425765Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a7a9ad2548d520a9fa361466eae1f4e939e92678dcb22d61b0bca634dc16cf31","observation_id":"a549f9c2-ebdf-4abc-a3ff-a396a4ce82ea","resolution":{"observed_at":"2026-08-05T06:00:27.425765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.534540Z","title":"OneLLM: One Framework to Align All Modalities with Language","venue":null,"work_id":"4fb72fe7-fd08-478d-a972-49b3cdae6af3","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.429211Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:33fb635cbe7f476d7459ddc773687503b67a366a44c3788e8828b8ba57a31bd2","observation_id":"4d8b8bbb-665b-4024-9e3f-73964e03a978","resolution":{"observed_at":"2026-08-05T06:00:28.538597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-08T23:15:31.134799Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-05T06:00:27.432652Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.432652Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:7ff24f5b999bc2b41c56b2101bc4273af4688196c385df06cbb3a2be83acc993","observation_id":"8fb48564-3338-471f-88f6-13dfb234a78f","resolution":{"observed_at":"2026-08-05T06:00:27.432652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.522283Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"b367d2aa-89a6-4b75-853d-c3a7d6d6403f","year":2022},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.436010Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:3ff2bee411446b048de3281bad8d74aaaf47b2b3fa30a61544efdd15e813baca","observation_id":"3756b43c-dc7a-4a96-ba0f-8f101e1ff9a1","resolution":{"observed_at":"2026-08-05T06:00:28.526391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.509011Z","title":"LLaSA: A Multimodal LLM for Human Activity Analysis Through Wearable and Smartphone Sensors, 2025","venue":null,"work_id":"5a65f917-fb04-4515-8a02-5a86f9b2065d","year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.439379Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:bffc39796ca695d436ed2dc1adcc13f1be079ee7aeccc708130c24b04c3655c5","observation_id":"993d4154-8fc3-44c6-896a-9daf23210c83","resolution":{"observed_at":"2026-08-05T06:00:28.513624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.496636Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"cadfa308-eed6-4f35-a086-f552336f4560","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.442577Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:3b954471c0c28457c88e34e6d74ef0f3a81718a0901608a817df7e56bbe22bc0","observation_id":"3e8306e1-0848-46f6-8487-e35a0a2f6913","resolution":{"observed_at":"2026-08-05T06:00:28.500779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11694","last_updated":"2025-03-04T01:47:20Z","snapshot_observed_at":"2026-07-06T20:07:41.462631Z","submitted_at":"2024-12-16T12:12:45Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","version":3},"cited_work":{"arxiv_id":"2412.11694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11694","snapshot_observed_at":"2026-08-05T06:00:27.821608Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","venue":"cs.AI","work_id":"340e1bc3-d96f-4bad-b23f-afa1b011a51e","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.446056Z"},"links":{"cited_paper":"/paper/2412.11694","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:ab6a4bced0f669aded012fbe958ca4934087010f37fe516b153fbc071abbc011","observation_id":"6a7c9cf0-32e4-4045-b016-693b24c42168","resolution":{"observed_at":"2026-08-05T06:00:27.825437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.483965Z","title":"BRA VE: Broadening the visual encoding of vision-language models","venue":null,"work_id":"0d9e3a9c-8af2-42d6-84d4-c2a61d957316","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.449348Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9ef076442c1a1d20dd3c47c3e23876b63d7d7153df8c86f4216b36bafeda7d70","observation_id":"6ccff54a-d44c-4845-b21d-471410198c47","resolution":{"observed_at":"2026-08-05T06:00:28.488538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.471675Z","title":"AudioCaps: Generat- ing Captions for Audios in The Wild","venue":null,"work_id":"a7caa924-cca9-4b0c-a913-e15ef2f3d8d5","year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.452422Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:d57cb099828e69fa14c2afaab70ebf680eeff4136035140afa3a2ce63eef3ace","observation_id":"5edaaa22-d115-4203-880c-7d10b2aae347","resolution":{"observed_at":"2026-08-05T06:00:28.475757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.459504Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":"92c3bbfa-5ed7-4d2a-8f26-5a66958d69be","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.455363Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:ad63f276528f14ea7cff3286bbf1523c4872c95933733d2c24f896ac3b49d0ec","observation_id":"e5a895ed-7f85-40bc-bd2c-95ed9902fdfb","resolution":{"observed_at":"2026-08-05T06:00:28.463360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.446502Z","title":"Grounding Language Models to Images for Multimodal Inputs and Outputs","venue":null,"work_id":"6689c5c7-0719-4bef-8e6d-7298372a19f2","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.458606Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:6a275bbc1deb6c7bfa298e460123c9071cba5490dc63bb797e67c8bc12ce5c70","observation_id":"70e4e688-3944-4b69-ba28-cdcfd69fbb46","resolution":{"observed_at":"2026-08-05T06:00:28.450784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.433497Z","title":"Similarity of Neural Network Representations Revisited","venue":null,"work_id":"54df2ceb-94e3-4a88-afed-1b2332d0c081","year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.461671Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:7489019f2ab0b1b39e245e5d8b1dca9df0960146415276b4ea048a39130b568c","observation_id":"410e7e59-5465-4f53-9c74-82f025fd582c","resolution":{"observed_at":"2026-08-05T06:00:28.438000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.419895Z","title":"BLIP-2: Bootstrapping Language- Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"8df29366-944d-4113-9161-2fc940008fcb","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.464656Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e4fd9f7c69ae13a42e674cb97e8fda9c3389b1dd3b7469d672999ed96fe4cf4f","observation_id":"47bbeb76-782f-479b-b373-16a39136b1c4","resolution":{"observed_at":"2026-08-05T06:00:28.424302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.405086Z","title":"ROUGE: A Package for Automatic Evaluation of Summaries","venue":null,"work_id":"2652c993-bc6c-4c17-b602-5ac46cf0599f","year":2004},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.467551Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:10ef8245cdfc141eb9fa0693104a517f327e9790e322c73fbed89b8422118560","observation_id":"3b6937e0-cc9f-42bf-941b-486f4c5c9a54","resolution":{"observed_at":"2026-08-05T06:00:28.410018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.387386Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"ba87087e-d859-4276-927f-fea2a4cf06b1","year":2014},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.470601Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:fbbe0744eb0e51b44de42600e8f027d916db3cc1f6af8de7826398d4aa1a7e2a","observation_id":"1b2041eb-84c7-4528-a5e9-8425833a6672","resolution":{"observed_at":"2026-08-05T06:00:28.390858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.375477Z","title":"RemoteCLIP: A Vision Language Foundation Model for Remote Sensing","venue":null,"work_id":"c459dcaf-7f6e-4cc7-a47e-ae0cdfbf8920","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.473606Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:ebfad01d1aeb34910f45e66111a855597550a9eaa11ac93494e141efb58cbe4a","observation_id":"1530c413-d2ef-4443-9c87-2b92df2bdeff","resolution":{"observed_at":"2026-08-05T06:00:28.379327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.363959Z","title":"Visual Instruction Tuning","venue":null,"work_id":"c77dac36-ca11-4067-a408-71a0975fbc55","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.476988Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:71b64b25ca6ed5501a321ded1c925feb8db4cf9c478131a74dd05d131aa807fa","observation_id":"f00a18b6-377b-4d8a-8914-157951fad862","resolution":{"observed_at":"2026-08-05T06:00:28.367870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18277","last_updated":"2025-08-04T02:46:55Z","snapshot_observed_at":"2026-07-06T20:12:40.901520Z","submitted_at":"2024-12-24T08:38:35Z","title":"Towards Modality Generalization: A Benchmark and Prospective Analysis","version":3},"cited_work":{"arxiv_id":"2412.18277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18277","snapshot_observed_at":"2026-08-05T06:00:27.805853Z","title":"Towards Modality Generalization: A Benchmark and Prospective Analysis","venue":"cs.CV","work_id":"785f334c-814e-4f2d-a042-a14b7872f00c","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.480243Z"},"links":{"cited_paper":"/paper/2412.18277","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a4817c8abc5ec868f60c9e0b9b8d4f73ea4b9e798a919d2f87be193331675a3a","observation_id":"aba6bf0d-27e2-487e-a2ea-e18e0be18511","resolution":{"observed_at":"2026-08-05T06:00:27.809540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.351275Z","title":"MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter","venue":null,"work_id":"5c5ad169-7520-4752-a97d-7b425a6b367f","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.483716Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:577aa62784ef456c120f5cd8b093aff93fdf13154434a65ba8057247aef34454","observation_id":"7145ebd3-d921-42d2-b6fc-0ae92354a1e1","resolution":{"observed_at":"2026-08-05T06:00:28.355361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.338327Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"c059765d-ab68-46dc-8651-6cb2fe3ff2e1","year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.486991Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0c70f647c89504beb0f6be94adb52c570765f731bd61594f82cd0bb002ba0fe3","observation_id":"b068d0a7-f7fb-4fd8-b534-1c9debf1bf03","resolution":{"observed_at":"2026-08-05T06:00:28.341981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.325487Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and Action","venue":null,"work_id":"344c3524-511a-4e72-8916-b03ebaad574e","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.490226Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:f75c550f584d77081200fd26569fff6722eccc6b0b6ee2c49929ea77791063d0","observation_id":"aeaf28d6-da97-4e4f-bdf3-fbeffc03cd5b","resolution":{"observed_at":"2026-08-05T06:00:28.329505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-05T06:00:27.493319Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.493319Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:461b317926acd4cd922d8842029a5106d1a6dd4ec5ea78b8257cfb1ed0fb4f55","observation_id":"99f01e68-3340-4ab5-be81-98fc9dd23528","resolution":{"observed_at":"2026-08-05T06:00:27.493319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11795","last_updated":"2025-04-06T18:52:08Z","snapshot_observed_at":"2026-08-04T05:24:14.383678Z","submitted_at":"2024-08-21T17:36:37Z","title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11795","snapshot_observed_at":"2026-08-05T06:00:27.496538Z","title":"Ee-mllm: A data-efficient and compute-efficient multi- modal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.496538Z"},"links":{"cited_paper":"/paper/2408.11795","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e3177109ad78e7b1501aaa8286ec9d1f217147d321722e2b06d021584f85f560","observation_id":"4372f23f-e849-4011-8f2b-518adbcbefae","resolution":{"observed_at":"2026-08-05T06:00:27.496538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.204494Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":"31572375-1cce-459d-836d-cea58b8d25d8","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.499842Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:c7d1c4d378a72d80490929ebe21d6a07976512e3445e001f12277b43c432105a","observation_id":"116e1676-346a-4046-8834-fae435df3ac7","resolution":{"observed_at":"2026-08-05T06:00:28.315326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.192518Z","title":"Llama 3.2: Model Cards and Prompt formats, 2024","venue":null,"work_id":"ef8fe5df-b520-4e5f-90d9-ba978c0e8638","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.502939Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a4786ae45e0da1506143ebcd9049053759c12497e77b8386ae248e4f44587afc","observation_id":"2ad69d09-bf8d-44c9-9275-b7aa87aa94ff","resolution":{"observed_at":"2026-08-05T06:00:28.196530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.506008Z","title":"How to generate random matrices from the classical compact groups","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.506008Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:423a909bd508d0c15ac00b294526ebd5ba79b3f5280efed9ac6924ff707dcb33","observation_id":"d1028c33-f00c-49c3-b1c5-5f327fd2f56d","resolution":{"observed_at":"2026-08-05T06:00:27.506008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-05T06:00:27.509894Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.509894Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:963ca3c1a382d2f8a0858a06ecb4852851b63b5a5899515654d64bedc8a48197","observation_id":"5d63d557-c52c-4e6c-9495-328a74914cf5","resolution":{"observed_at":"2026-08-05T06:00:27.509894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.173192Z","title":"AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model","venue":null,"work_id":"1abd684a-6544-421d-b32e-ad8a68fa28d8","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.513165Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:1a1fcd7a9285090d0e94f5fd0b62a5303e5d833b75d20da8707214a87d3857d2","observation_id":"0a628394-0a09-4331-b85c-a18ea26eb6e3","resolution":{"observed_at":"2026-08-05T06:00:28.176631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.162563Z","title":"OpenVid dataset on Huggingface, 2025","venue":null,"work_id":"e31f3522-caaa-4b6d-b551-8451129f72ff","year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.516484Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8530dffdc49eae92a28ec68a2f3c23047d24d67931f2bca667fb2ff400fc81dd","observation_id":"c0b7fb79-d23f-4684-9764-60dda416267b","resolution":{"observed_at":"2026-08-05T06:00:28.165935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-05T06:00:27.519716Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.519716Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:870dbc3424b1908ca2daab709b70fa6c4c8ca9d22618e8f8f093e8ef47f8f795","observation_id":"b91db0cc-236d-4a03-a3c4-de4658f9d540","resolution":{"observed_at":"2026-08-05T06:00:27.519716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.152043Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"be0e9588-0d96-47bd-ad4f-7531b2f3d0a9","year":2002},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.522906Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8921f940af555f4cbca949b5fbe9232039b701b359a261191436ad6d3074abe9","observation_id":"e82ef18e-2ef2-4cb8-89ea-d3bb25a089cb","resolution":{"observed_at":"2026-08-05T06:00:28.155546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.141591Z","title":"Modular Deep Learning","venue":null,"work_id":"434b281e-87ae-4bd0-8340-5d2defbe3626","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.526137Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:2ab8d3a9df2dff320c8db8540fadecac013d4f7221ee6c526d7978cd5f1e01bf","observation_id":"45355158-fd17-4652-aa87-465c17214da6","resolution":{"observed_at":"2026-08-05T06:00:28.144811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.130875Z","title":"Deep semantic understanding of high resolution remote sensing image","venue":null,"work_id":"a57c705d-2d38-4315-a8d0-bf473142cbbe","year":2016},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.529445Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:bc59fd5ad8946d5dc0d5fc652a1543bf36ec5f0a3904797a3fba1ff5f6a3cdb4","observation_id":"88bb21eb-b2c7-48ae-b731-94cb9a456215","resolution":{"observed_at":"2026-08-05T06:00:28.134440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.118937Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"c5d43d6b-276c-451c-9a93-d38b2069ebab","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.532742Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:66bde7e50b3bf2a24881e5c6b4227fd2efc5438792dd71d513c2f05201682936","observation_id":"2471ce79-5042-4631-9297-e580c3a5cf42","resolution":{"observed_at":"2026-08-05T06:00:28.122972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.107645Z","title":"Infinite Feature Selection","venue":null,"work_id":"e57eb588-1723-4697-8eab-e81710f1e1a5","year":2015},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.536144Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:466fa1e59af9cd54e19f2d6d8badef6e334c725fcb25ec501ca932b6bd373c1e","observation_id":"09cff91f-84e2-44ef-9153-db1ab708336d","resolution":{"observed_at":"2026-08-05T06:00:28.110868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.096499Z","title":"Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks","venue":null,"work_id":"cfde05a4-a98a-4cdb-932f-3b8ed9ff0940","year":1992},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.539441Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:3c1f63ec7f4a7c86c6f997aa4321a92da77e70f07742a99b1439df277187e2e5","observation_id":"df8e9ebc-f2d4-4190-abc8-4a6b7f8280e9","resolution":{"observed_at":"2026-08-05T06:00:28.100280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.085889Z","title":"UnIV AL: Unified Model for Image, Video, Audio and Language Tasks","venue":null,"work_id":"d5d5cfbe-4a59-478c-add0-5adb6006fd47","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.542610Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:41666c750e46970deacb201943954a813b707e879a23b53294b9964e3e074d67","observation_id":"b65c02e6-114d-4691-9073-3af225c6bbe5","resolution":{"observed_at":"2026-08-05T06:00:28.089097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.075534Z","title":null,"venue":null,"work_id":"9574f1c7-0c32-433b-a40c-2c0c039808a4","year":2016},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.545801Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9af18cb3835184d966a0425520789eef7e8188505b6c536a6993af8b1b8adba1","observation_id":"065fe912-a0a2-40fb-bb8c-2b7844c3de9b","resolution":{"observed_at":"2026-08-05T06:00:28.078605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T06:00:27.551011Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.551011Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:dddccc78751cefd3c9dd29f92dace42cfa43f9b39c845bdab175207025922b84","observation_id":"06cd99be-7f6e-4b47-a0a9-b8759a0335c2","resolution":{"observed_at":"2026-08-05T06:00:27.551011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.064888Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"5092dbe6-4865-4127-a916-2d7a89989f8d","year":2015},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.554566Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:ec9688de81d5c651524f3a1ea36d7073d31bc5c3d3eb0e24cd20afa4ec49ed0c","observation_id":"83ee673b-fed5-4190-9dbc-1a784b41c091","resolution":{"observed_at":"2026-08-05T06:00:28.068294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.557681Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Cournapeau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, Stéfan J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.557681Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:606662c58a59299ce7175f7533bae96e0b9c12ba1b2399165ccff80c3d7b4498","observation_id":"2aa65663-85ad-4b37-9acd-f26d47b7cf75","resolution":{"observed_at":"2026-08-05T06:00:27.557681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.046404Z","title":"Lintott, Anna M","venue":null,"work_id":"78acbcb5-7460-47ce-84db-f73274f53373","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.560972Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:f7db83b076412e947166253e0768949e8323e593aa48719287dd0737708d6534","observation_id":"714d31d7-7257-474c-b718-a6ff75543756","resolution":{"observed_at":"2026-08-05T06:00:28.049939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.035552Z","title":"VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models","venue":null,"work_id":"85fc0aa1-f16d-494e-b809-0e1005682cff","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.564228Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:45c64668c543945c0bd9cfee0c9de739e7b95561b8f71eba0f2cad4ae54f696e","observation_id":"ba69f3cf-0738-4f6a-82a3-b0475ae8264c","resolution":{"observed_at":"2026-08-05T06:00:28.039379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.024835Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":null,"work_id":"528de7d1-eed9-4d20-999f-0a2fb0294881","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.570781Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:270618f5ee16626cd3616ee7b020cf3f4528f80c55812257f3ba4f3cc50f5ecc","observation_id":"f8971ecb-6003-4539-ba2a-3fcfbe8ffbae","resolution":{"observed_at":"2026-08-05T06:00:28.028294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-05T06:00:27.573725Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.573725Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0d47607ad2e1ddd44ceb29015f2a121629884c40ffffc1e6b5e7ff06ae899d50","observation_id":"38a5db5a-596c-4fbb-9e11-11d8df1baf15","resolution":{"observed_at":"2026-08-05T06:00:27.573725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.013746Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":null,"work_id":"f498c34a-611b-4c93-adeb-c86595a72b69","year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.576922Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:ff6b509054f441191636703711cec19eb07acb65a4a2fcca7a1b335a322dbfbb","observation_id":"35ae5dbd-7ec6-4a06-917d-7b61e45e5cc5","resolution":{"observed_at":"2026-08-05T06:00:28.017360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.002020Z","title":"Limu-bert: Unleashing the potential of unlabeled data for imu sensing applications","venue":null,"work_id":"97a231a2-9472-4904-bfe6-0bcdfb8c2cf5","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.580025Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:c1a43ccd40288bdab6ff1d5fd29bfda0c15a55e5501fd0ea065c020c37ed98d8","observation_id":"d57081dc-078e-482f-869d-5bf3a69b0578","resolution":{"observed_at":"2026-08-05T06:00:28.006073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T06:00:27.582998Z","title":"Qwen2.5-Omni Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.582998Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:4e4620913cbe9ed7dff48e6243a8d6774c259d3cdfc60995093d9d22b6aaa474","observation_id":"396c02a5-18ac-4eff-9306-1495825b592a","resolution":{"observed_at":"2026-08-05T06:00:27.582998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.991246Z","title":null,"venue":null,"work_id":"762ab18a-2e0c-4dac-b56f-9faac869ac7e","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.586159Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0221a950b86f9330459a1b333c4592709040a23c87887927ac483e9f7e25b4c1","observation_id":"3fdba7af-492d-4d0f-b0dd-cec169b87870","resolution":{"observed_at":"2026-08-05T06:00:27.994488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T06:00:27.589509Z","title":"Qwen2.5 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.589509Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:be921fa27b0ee81a1391441c2d0e5ccc09d1da47f06847fd511c7bb3befc1dff","observation_id":"d2816582-8cf1-40cd-a92b-c27dbebd0320","resolution":{"observed_at":"2026-08-05T06:00:27.589509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20178","last_updated":"2024-11-12T14:45:18Z","snapshot_observed_at":"2026-07-06T19:40:08.700220Z","submitted_at":"2024-10-26T13:19:57Z","title":"LLMs Can Evolve Continually on Modality for X-Modal Reasoning","version":2},"cited_work":{"arxiv_id":"2410.20178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20178","snapshot_observed_at":"2026-08-05T06:00:27.696089Z","title":"LLMs Can Evolve Continually on Modality for X-Modal Reasoning","venue":"cs.AI","work_id":"04bc0b25-cda5-4f32-a2da-1856871ebb82","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.592640Z"},"links":{"cited_paper":"/paper/2410.20178","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9792b1ec819abe3d8eed335f7fa178ff57707ac960808810a29d98e3322b19dc","observation_id":"2af74947-098a-483b-ab64-0990bff056af","resolution":{"observed_at":"2026-08-05T06:00:27.701532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.979498Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","venue":null,"work_id":"72bd982c-67bc-4195-a178-c9e6a52c0bf9","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.595818Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:678073cda2ad5099b3e9b1789b2951679c1f486da03c8cd5c1ec47f84b491451","observation_id":"c7bb3cb0-985f-44da-912d-6e0014e90558","resolution":{"observed_at":"2026-08-05T06:00:27.983294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.968052Z","title":"mGTE: Generalized Long-Context Text Repre- sentation and Reranking Models for Multilingual Text Retrieval","venue":null,"work_id":"3412d5c7-41ee-4271-805d-045c2cd894c5","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.598926Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5eac900fabe4145ced6a576834f2c0a6fcd4e610fbf7de381a4738358591e618","observation_id":"e0cbbb4c-d38f-494b-a063-ed1dea6042b5","resolution":{"observed_at":"2026-08-05T06:00:27.971424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-06T09:32:33.122628Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-05T06:00:27.602134Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.602134Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:d91bbd48c0c06fb2d9d77e09763f87dd3db56dc911d553b62cd4fb0da2c9523b","observation_id":"53b8dd4b-32b5-4d04-9ea1-3fbce746d8fd","resolution":{"observed_at":"2026-08-05T06:00:27.602134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16103","last_updated":"2023-05-25T14:34:08Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:34:08Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16103","snapshot_observed_at":"2026-08-05T06:00:27.605436Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.605436Z"},"links":{"cited_paper":"/paper/2305.16103","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:c873ea7f7efbc342ea20f3cfb2e252c2318e7ec063d732e76e6227fdfdb7cff2","observation_id":"6a7a34cb-c281-41c8-abac-505375f9ec0c","resolution":{"observed_at":"2026-08-05T06:00:27.605436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T06:00:27.608859Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.608859Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5a71eea326b2471c466273786977112ab608107fd7fd3eacdcb1f809c21ad228","observation_id":"9b8ceade-5c08-4bbb-9497-fdc74bf1db83","resolution":{"observed_at":"2026-08-05T06:00:27.608859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.957205Z","title":"Is the galaxy simply smooth and rounded, with no sign of a disk?","venue":null,"work_id":"4776b66b-3988-466c-adb5-830e2fed0532","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.612486Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a355324595dc509667eef4c0df4cb464bc68763e605610718b7dab2d4dddd5ba","observation_id":"254d9617-c361-47c5-b298-3e8e563902a8","resolution":{"observed_at":"2026-08-05T06:00:27.960786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.946401Z","title":null,"venue":null,"work_id":"3d1b941e-f622-4b76-92dd-320d9d10e5ef","year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.617130Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:b6a9f63b15376a6cc898f9f0d65d5e3239f25f6c32a8bde94ceb21813608d975","observation_id":"7291263e-a0ad-480d-af16-6666aa8f9f78","resolution":{"observed_at":"2026-08-05T06:00:27.949757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.935528Z","title":"The data is relatively stable, with slight variations, suggesting a stationary position","venue":null,"work_id":"29bb6f10-159a-48ba-93e7-e4d5a7b3120e","year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.620778Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:706a9b9c86058383a31b25454eb3cd364f611bf658eece538b0e3c322ff5be85","observation_id":"e31ae708-c7e4-44cc-98ae-9ae3a20f21a7","resolution":{"observed_at":"2026-08-05T06:00:27.939037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.924597Z","title":null,"venue":null,"work_id":"2755884a-a0fa-45a7-a9aa-cbfd68d4a3c8","year":2048},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.624272Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:f61b51e96013fed1c8d21cda1c34636d9ccf41502502e9b182dab3fcba95e941","observation_id":"55f64af5-3588-491d-93aa-da81bf28f94b","resolution":{"observed_at":"2026-08-05T06:00:27.928041Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.567671Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.567671Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:c7f7e682414d1b689c76a59ddd0b79a0990ca798baf05d3d77da27cecce51748","observation_id":"82894495-20ad-4c57-bf11-a92290711c48","resolution":{"observed_at":"2026-08-05T06:00:27.567671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":3,"verified_fuzzy":49},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2509.04606."}