{"as_of":"2026-08-05T23:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbcce768ee2cf68528c34e3a768b4a6bb077ff5c360f61e898c848af027553c5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:53:24.189799Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T00:27:50.594729Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:17638a12b1a00a692cd0024dd36fd63fad1164c07b187bdabd906468c07b1bba","observation_id":"19aef4f9-61fe-45d6-a1c1-b9b5cf7cd034","resolution":{"observed_at":"2026-05-16T02:56:41.968189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:54f142a2264c264d3389fd251fef64588ea98842b1abd6e68f9d17a804c80ce8","observation_id":"d3f4e443-b1cd-43da-8290-b36562c5ec4a","resolution":{"observed_at":"2026-05-17T07:44:47.467568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T00:26:21.313005Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2409.04429"},"observation_digest":"sha256:676fe87aaaebe7bd0767f8bc7f6d79b887d6f10ea80a2697bede845ab79c9beb","observation_id":"a583e6f5-cf07-4c80-bf93-2be4a2b2c17a","resolution":{"observed_at":"2026-05-16T00:26:21.388246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2409.07825","last_updated":"2026-02-04T04:12:12Z","snapshot_observed_at":"2026-08-02T14:14:17.863359Z","submitted_at":"2024-09-12T08:15:39Z","title":"Deep Multimodal Learning with Missing Modality: A Survey","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T22:26:03.706725Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2409.07825"},"observation_digest":"sha256:5913a938aedd4f47dd1e6fa054c4e5d0198eb47922ec32e61c6c8484274b5e63","observation_id":"b198f446-cef7-4eb5-8110-8581f14aece3","resolution":{"observed_at":"2026-05-17T22:26:03.959221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:398e02d84440b32d3c49ef35c98d51d24fb2eb61b1491f5b0680ae216e911e26","observation_id":"952a0763-c33e-4044-a508-360593a97f5d","resolution":{"observed_at":"2026-05-17T21:08:19.612711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":213,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:dd8ef2f3de195f113d2dc49aae0e4067ffbae8fc542084cd72ba31dfae784d92","observation_id":"f1209626-3438-41a3-9db3-3db1e996524a","resolution":{"observed_at":"2026-05-15T17:18:53.088051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:cf0d3a80c526e6a76f99183f564dbf1d0157db7643a9deca2c05a63fd1ee26af","observation_id":"c326b9e8-d853-4f1f-bc4b-c562c5c40dfb","resolution":{"observed_at":"2026-05-10T17:54:03.371019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-05T13:53:24.189799Z","title":"Anygpt: Unified multi- modal llm with discrete sequence modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-05T13:53:22.566210Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.189799Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:dda466ec000157ddeebc86947a6dd7e2f3a4beaa69971e3b85298ce0e18faf0c","observation_id":"e8c6534f-ef50-4d68-aef2-43dc18d60de8","resolution":{"observed_at":"2026-08-05T13:53:24.189799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:39080e3a75af38072c58d35ac04f6e3c52ae86ea9a544be9781e49cbcd74b388","observation_id":"865e7739-98d2-4c3d-b428-2484a2811029","resolution":{"observed_at":"2026-05-21T18:20:29.187851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:fa69e7b513d805a0ad892ecc7b34eb63d533f222e16d3650069375b6410198c7","observation_id":"00eb7ac9-d2fb-49b4-8f37-42ed96fc2aed","resolution":{"observed_at":"2026-05-16T22:08:36.216907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2512.20901","last_updated":"2026-05-22T15:06:27Z","snapshot_observed_at":"2026-08-02T04:42:54.079175Z","submitted_at":"2025-12-24T02:59:01Z","title":"Benchmarking and Enhancing VLM for Compressed Image Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:06.192538Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2512.20901"},"observation_digest":"sha256:acecc60b064eddba005a908ad6d426d20f4c80e45609400f360f5b9751108b20","observation_id":"46f89378-7081-4658-9560-11410ee6f9cb","resolution":{"observed_at":"2026-05-25T07:26:41.821712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2604.08125","last_updated":"2026-04-10T10:48:12Z","snapshot_observed_at":"2026-07-31T09:02:47.778850Z","submitted_at":"2026-04-09T11:46:14Z","title":"PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:26.910105Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2604.08125"},"observation_digest":"sha256:6650c51ee9971d6438cd8fdefa0fed5482309bb0efb0247351867216244bb5de","observation_id":"9394b685-dcd2-4ef3-8b50-a2ee92c9b7b2","resolution":{"observed_at":"2026-05-11T00:30:54.803391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T22:02:57.841111Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2604.21921"},"observation_digest":"sha256:d85701debc5f8a7fea3eea7a93e8599ab804ff9227fd404591f5723bd1e6f0ce","observation_id":"df7444ad-9e6d-4463-ae30-47a181b20c57","resolution":{"observed_at":"2026-05-11T14:21:04.879271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:0549b8dbed09dd6387679b834a428ca261ce9d1e24b16a7a68aa7a58d857ebee","observation_id":"7262370a-9725-46c9-8304-e10518785462","resolution":{"observed_at":"2026-05-13T02:02:06.312638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:b53e0499a196a2fb954e3be62987e3f5fa3b26827b907703af5d140bcf45c664","observation_id":"5de52724-6a68-48e7-ae09-d24d0e158630","resolution":{"observed_at":"2026-06-29T23:04:01.631420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:7a7a6572b34e7c40c37b0136ec722ac6b846958c05efcb68f5b8ec38d0afbf9f","observation_id":"01482320-8175-4f71-ae28-60370b3353d9","resolution":{"observed_at":"2026-07-01T23:06:21.398632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:2d539b7562d4c818f47f19c7c367757aa418d80c870ae96dacae0405105805fd","observation_id":"446a62ad-e5fb-4165-93e0-617d8e6b943a","resolution":{"observed_at":"2026-07-03T16:08:37.416070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-02T23:29:21.699637Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":2},"reference_index":300,"source":"arxiv_source","source_observed_at":"2026-06-26T09:19:50.623741Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:2eeb2b1bebb596ffdec400322e09d6a370b9c62999e909c6ad6a6e0872ec23e8","observation_id":"d7115c61-2317-449d-9185-b06cd9508c8e","resolution":{"observed_at":"2026-07-04T09:59:44.792436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-02T23:29:21.699637Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":3},"reference_index":299,"source":"arxiv_source","source_observed_at":"2026-06-29T01:18:19.195007Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:28ce644d2001bf3e0ad43f6ae9689226ed9c8fa40af95165597f7d7157cfdb70","observation_id":"e2588dcf-7472-4df6-89d4-15c112287ea1","resolution":{"observed_at":"2026-07-01T18:55:59.424290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2607.06649","last_updated":"2026-07-07T16:28:54Z","snapshot_observed_at":"2026-08-02T22:06:07.271160Z","submitted_at":"2026-07-07T16:28:54Z","title":"POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T00:23:30.377235Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2607.06649"},"observation_digest":"sha256:85e95d955bd13dbf35675ff7d3cebb26de9105748102282319bc594bfe005eec","observation_id":"4021b98c-f757-48e0-8b11-34f352a0c298","resolution":{"observed_at":"2026-07-11T00:27:50.614075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.12226/citation-record","integrity":"/paper/2402.12226/integrity","json":"/paper/2402.12226/citation-record.json","paper":"/paper/2402.12226"},"outbound":[],"paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2402.12226."}