{"as_of":"2026-08-17T18:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cbe48cc30ac8d76312db7a0e6cfdb9d78ea8ceb4d41d8e478bc25e0a73498673","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T11:13:07.775436Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07279/citation-record","integrity":"/paper/2608.07279/integrity","json":"/paper/2608.07279/citation-record.json","paper":"/paper/2608.07279"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T11:13:07.632006Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.632006Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:0c57032e55aa12609f8fc6d287c04a3d0e1f02aac3129727a028f9c6d39170c5","observation_id":"7ecaad9c-8d8b-4506-b89d-9adb72e8e9ae","resolution":{"observed_at":"2026-08-10T11:13:07.632006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T11:13:07.636889Z","title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.636889Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:aad1a9a8a577324603b136692081f92cad426ff1725d7fe66b0ad47c8011d26b","observation_id":"a5db22f9-d36f-4ce1-97e9-7c72983add4f","resolution":{"observed_at":"2026-08-10T11:13:07.636889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T11:13:07.641325Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.641325Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:6b2530f15f5844e24c3b49b8302c202a18b5f1866cf75f08cc51e71c034771c2","observation_id":"bbf9c675-e846-45cc-b5c7-4a800a01415b","resolution":{"observed_at":"2026-08-10T11:13:07.641325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-10T11:13:07.645580Z","title":"Qwen3-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.645580Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:38caa93cab51c99bbc9803eb74dc6c8cd9e2e52a656d79ed7728eabe23d7f8b2","observation_id":"7153ef3e-b8b9-4038-b605-09d8508c45c5","resolution":{"observed_at":"2026-08-10T11:13:07.645580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.054949Z","title":"Attention is all you need,","venue":null,"work_id":"975a47b1-dec9-47d6-84b1-a771a589114e","year":2017},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.649471Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:63dacba452c371dff59f7d22649ee3bb35dc9a73699411fd5b000ecb73b04afd","observation_id":"855e989b-70ce-4808-95ec-40eb6bb7ad47","resolution":{"observed_at":"2026-08-10T11:13:09.058515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.653190Z","title":"State of AI: An empirical 100 trillion token study with openrouter,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.653190Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:7e6975a6b1f24aa6c33bca157e7f396faefffa5405938e7286182b371f0e9212","observation_id":"888e5bbc-85e5-4bcb-a713-1c94cebfac09","resolution":{"observed_at":"2026-08-10T11:13:07.653190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.043589Z","title":"Token communications: A large model-driven framework for cross-modal context-aware semantic communications,","venue":null,"work_id":"b89b8ed1-ad81-4289-a0ff-910198be92f5","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.657057Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:7a367c2b188469122f2f4cd861b1ba32f65596558cb50af4b45fbf339690ee39","observation_id":"98920b2d-aa90-4611-9177-bb0b1f590f15","resolution":{"observed_at":"2026-08-10T11:13:09.047850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.031904Z","title":"Adaptive semantic token communication for Transformer-based edge inference,","venue":null,"work_id":"63cb9f5a-6562-4ace-b710-d2f3c5903275","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.660459Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:5e8632834d4e042c040552b170cae503907426631a78ea0974b5f45b9de6710b","observation_id":"bcd11c82-346c-4ccb-818a-026a3019c624","resolution":{"observed_at":"2026-08-10T11:13:09.036162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.020588Z","title":"ResiTok: A resilient tokenization- enabled framework for ultra-low-rate and robust image transmission,","venue":null,"work_id":"de8b0103-9ce3-47f8-b959-a34d6c6d6380","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.663886Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:f7dcfbb7e2678e1f64f650c9d1ac9ff5258e0e83a57af2c31197d33534fcfeaf","observation_id":"0faf6efa-f02f-416d-bf62-9454c1f8736d","resolution":{"observed_at":"2026-08-10T11:13:09.024453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.667285Z","title":"Joint semantic-channel coding and modulation for token communications,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.667285Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:97e2568cf299ae8d1c6ac9a9e062ea9d29c3903a36381714b331fe3e93ea0a35","observation_id":"53ef0cef-ddbe-48fa-87cf-f983fe34e989","resolution":{"observed_at":"2026-08-10T11:13:07.667285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:09.003055Z","title":"Towards practical real-time neural video compression,","venue":null,"work_id":"510332a8-6e59-415b-aa79-1a761731ae0e","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.670497Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:734f05c8dfbe6e52145c0d2d307a1530d4278f1fed1f15e00c50188a2850b38d","observation_id":"5360908d-3f45-436c-9f14-52728af9f7ae","resolution":{"observed_at":"2026-08-10T11:13:09.006774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.992639Z","title":"ELIC: Efficient learned image compression with unevenly grouped space- channel contextual adaptive coding,","venue":null,"work_id":"7735da48-c099-4ae1-b07d-5402b2330733","year":2022},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.674091Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:f91e7d87e5bcc5b10985cfb4e0c9cbc903fd76d36f6a15fa90456e49449aeebc","observation_id":"774c5ba9-3112-4a31-bc91-973c930037de","resolution":{"observed_at":"2026-08-10T11:13:08.996273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.982316Z","title":"Cache-to-cache: Direct semantic communication between large lan- guage models,","venue":null,"work_id":"d7fe9ec4-a27d-466f-8655-4999ad61cb7a","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.677376Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:6db600f5f09872f42b2a44dd907adcb7bfbdade71532deb9683bd82a29846655","observation_id":"d19045bc-e121-48b4-ade7-c00e01d47e4a","resolution":{"observed_at":"2026-08-10T11:13:08.985849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21454","last_updated":"2025-07-29T02:47:23Z","snapshot_observed_at":"2026-08-09T09:04:20.551201Z","submitted_at":"2025-07-29T02:47:23Z","title":"Transmission With Machine Language Tokens: A Paradigm for Task-Oriented Agent Communication","version":1},"cited_work":{"arxiv_id":"2507.21454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21454","snapshot_observed_at":"2026-08-10T11:13:08.494996Z","title":"Transmission With Machine Language Tokens: A Paradigm for Task-Oriented Agent Communication","venue":"eess.SP","work_id":"24f36ebf-73a4-45a2-9d48-247e075c4d39","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.680779Z"},"links":{"cited_paper":"/paper/2507.21454","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:5a576f74e47198ffa99e85db69b1049c67c4daf28d0c947ec1140f8dbe4ee511","observation_id":"8a5e0cce-f707-4287-b5a5-4e5159a1190f","resolution":{"observed_at":"2026-08-10T11:13:08.499206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.971903Z","title":"Video coding for machines: Compact visual representation compression for intelligent collaborative analytics,","venue":null,"work_id":"42778eb3-6b0f-41db-bb9c-3f73d4f65468","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.684504Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:32ae20633852eca61ee4c200fbdd442f43945bb6f80f9f84c5959aa5918653c1","observation_id":"45f102f9-a02a-4783-998e-39f9f8d459e8","resolution":{"observed_at":"2026-08-10T11:13:08.975666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.961394Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"f83c43f4-5bcc-4f51-9c7e-4cb1e8eb981e","year":2021},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.687950Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:71bff602d8040b9fe7d5bf0303d2e57e05dfb315600a1761bf5e9f2d63f5f5bb","observation_id":"dad7d109-7b26-47bd-b32e-385d048287fb","resolution":{"observed_at":"2026-08-10T11:13:08.965249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.951620Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"f90fa00e-315e-4c32-8bbe-38aa015d0898","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.691678Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:4894d0d1c59e9f6c90b42fba30099820ffdaf3319ba8257ddbda2b0e1396d0ba","observation_id":"dddb6459-27f1-4f03-97d1-5f2186057d3a","resolution":{"observed_at":"2026-08-10T11:13:08.955174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-10T11:13:07.695904Z","title":"SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.695904Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:d91cde9486f3b6d579467af3fffc42e856eeace6e6cd9ea10946615e77c21442","observation_id":"5f90155f-efc7-482f-89fa-8ba0e75786c4","resolution":{"observed_at":"2026-08-10T11:13:07.695904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.941863Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"53cc1ffa-8e67-4a7b-9cc9-5e0811f75ebe","year":2018},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.699701Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:284c62370e995762c11d81c94a78b02f58b61418c07fabaacfb4d301036e19e7","observation_id":"927cf759-a421-45b5-8124-c9557287e158","resolution":{"observed_at":"2026-08-10T11:13:08.945436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.703005Z","title":"Video tokencom: Textual intent-guided multi-rate video token com- munications with UEP-based adaptive source-channel coding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.703005Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:288f00e6803859a5480d92e0c44ffd873235bd25d4fea247166b57b8e6b572ec","observation_id":"c034656f-aca6-429a-94bb-8a9fd4d49eb1","resolution":{"observed_at":"2026-08-10T11:13:07.703005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.930250Z","title":"Tokencom-UEP: Semantic importance-matched unequal error protec- tion for resilient image transmission,","venue":null,"work_id":"3228bdaf-d3fd-4003-8464-5cec80af4a51","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.706786Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:ae5a0b267837ee0c6e28fde93d45f315b1ad896f45bf5f7c0539b8219d4e0f29","observation_id":"ddf72d9f-e075-4134-a2b7-d38ba30fd2c4","resolution":{"observed_at":"2026-08-10T11:13:08.934886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.920113Z","title":"Semantic Packet Aggregation for Token Communication via genetic beam search,","venue":null,"work_id":"0d4ffdc5-8618-4699-aa2d-5249350d5f33","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.710123Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:1d232bc09d05b8c446605088bbee874826a5c99413972d8e1e4ef62306641a34","observation_id":"d173f0e0-cbec-4829-9f1f-162432ab935f","resolution":{"observed_at":"2026-08-10T11:13:08.923828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.909562Z","title":"Vector quantized se- mantic communication system,","venue":null,"work_id":"cf482db8-bd03-4c63-8325-b1cc7aa9d90f","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.713881Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:49d0ec98283178f263225dacab88c577757b9deab646421baded156932a46238","observation_id":"541ad56a-b543-4f96-9afe-ed9c7da91386","resolution":{"observed_at":"2026-08-10T11:13:08.913321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.717438Z","title":"TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.717438Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:fd791fd63f187c7bb161bec71c7dde6955b7ddf08a5940581a5745e7a2e02ba8","observation_id":"9e96452b-eee0-4301-ac7f-e1f9140813ea","resolution":{"observed_at":"2026-08-10T11:13:07.717438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.898191Z","title":"VILA-U: A unified foundation model integrating visual understanding and generation,","venue":null,"work_id":"689f9e1a-864f-4c49-a7a2-2e9666038f2c","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.720344Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:26e3d79e6eb7b4edd9f0d2fa83c9994f780ea3d87e23bd5808cc3f5ece246740","observation_id":"078f5ff2-1485-42be-87a6-914b35814f3a","resolution":{"observed_at":"2026-08-10T11:13:08.901925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.887733Z","title":"BPG Image Format,","venue":null,"work_id":"79aeb135-b50a-42b5-be3b-a56431ff2d25","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.723210Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:871f2ae0025b286fd9e4c212d85f0aebb1b16b8eeeace4f9dbc3c1f0057e8153","observation_id":"f7c954d0-481f-4901-bf9f-a70be26be229","resolution":{"observed_at":"2026-08-10T11:13:08.891074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.877498Z","title":"VVC Test Model,","venue":null,"work_id":"1544a16f-4566-4f18-9e3e-e37fc961e015","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.726261Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:97df6652763314f84187c71e32865fdd07f7a2c59e1416341538cd008fda0841","observation_id":"9ef23ea2-cd1d-406b-9d6b-40c50e7c09e6","resolution":{"observed_at":"2026-08-10T11:13:08.880908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.867222Z","title":"Generative latent coding for ultra-low bitrate image compression,","venue":null,"work_id":"cf670747-aff5-4c47-ad5f-340655642bff","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.729308Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:a5d5a79617b893ee7c3f4c5ab07f2284c2235a3ed5d9d376ed86d016ba2a3300","observation_id":"2badacf3-8c4f-49da-817b-18633f90c9de","resolution":{"observed_at":"2026-08-10T11:13:08.870828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02897","last_updated":"2026-05-22T07:42:19Z","snapshot_observed_at":"2026-08-16T23:51:18.130364Z","submitted_at":"2026-03-03T11:47:05Z","title":"ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":"2603.02897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.02897","snapshot_observed_at":"2026-08-10T11:13:07.817677Z","title":"ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization","venue":"cs.CV","work_id":"8924af33-640a-4bbb-ada9-053a9fc33117","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.732195Z"},"links":{"cited_paper":"/paper/2603.02897","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:784cd5ca71128bca2e5ffc6f773a5223db0345398044531c2a7b6d3d2ea5ca8e","observation_id":"fd8b8371-275f-4f28-877e-9c1ffcbff8b0","resolution":{"observed_at":"2026-08-10T11:13:07.824823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.856006Z","title":"TransTIC: Transferring Transformer-based image compression from human perception to machine perception,","venue":null,"work_id":"70de1b59-8263-4275-9e53-f2630e802da0","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.735347Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:b47379858899351d099c34bdd2f6fa9b85a4e66a963f04e0fc37db5c32bb9095","observation_id":"c8e0059a-576e-43b0-8343-2033df4b29f9","resolution":{"observed_at":"2026-08-10T11:13:08.859941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.844514Z","title":"High efficiency image compression for large visual-language models,","venue":null,"work_id":"34c7473c-a83d-47f1-9e4b-db5f0e877ec3","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.738505Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:2f2d8295e188e19ec30c419f355e721e09b7cd19523ae2b53edea52d902a075b","observation_id":"79ecba71-da28-4fcb-a584-28c608137512","resolution":{"observed_at":"2026-08-10T11:13:08.848679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.833628Z","title":"Bridging compressed image latents and multimodal large language models,","venue":null,"work_id":"3d3a7ff2-0dc2-45da-aa69-41763e37a21b","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.741570Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:e15b4500f5dc5247dba463463cde7266cd8e9def4314ab4a645d0f041323ffbd","observation_id":"b5a30225-6560-4c45-b896-b19b1500cc10","resolution":{"observed_at":"2026-08-10T11:13:08.837576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.822273Z","title":"When MLLMs meet compression distortion: A coding paradigm tailored to MLLMs,","venue":null,"work_id":"63b59790-d198-4535-a108-226c850df3d1","year":2026},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.744536Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:2de8df7e4be63dea3be401975032d5c09345345c8aef6d259caf1c38acf5fa8b","observation_id":"e59c94a8-4d6a-4ddf-865c-978c7f874692","resolution":{"observed_at":"2026-08-10T11:13:08.826328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.810337Z","title":"Variational image compression with a Scale Hyperprior,","venue":null,"work_id":"2cc3c0a5-659a-4db1-ac9c-f7572fea203d","year":2018},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.748016Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:ee20a2cac25729f45dd80d4bc68f3d3fadec543075c538ee51c982694560681e","observation_id":"f7ebd7c4-0b21-4201-9a06-f44acca20650","resolution":{"observed_at":"2026-08-10T11:13:08.814243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:07.751553Z","title":"Deep joint source- channel coding for wireless image transmission,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.751553Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:ad277df6221ece6d453f489f930f24dc0b8f861b5bcdafcaaa8aa06359f49afd","observation_id":"a22fd1e2-0f2c-42c1-a700-d72dd191200a","resolution":{"observed_at":"2026-08-10T11:13:07.751553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-10T11:13:07.755370Z","title":"Qwen-Image technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.755370Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:8d7f74f7da00e7b8eef93b44b9fb2bc9741455a4c2f192417a6c08766934dd67","observation_id":"1e87d3b4-ce2e-4e55-91a1-157cc5fff32c","resolution":{"observed_at":"2026-08-10T11:13:07.755370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.789856Z","title":"RoFormer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":"a7c9a51f-e967-4788-b766-99effd7e1a89","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.759074Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:fcfaba47a5cbf2eb1ac09a6618bac98af8c50f1043702d3b181991aa2216fe1a","observation_id":"1c680780-4ab5-4fe4-afa5-a90c939647ee","resolution":{"observed_at":"2026-08-10T11:13:08.794331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.776961Z","title":"LLaMA-Adapter: Efficient fine-tuning of large language models with zero-initialized attention,","venue":null,"work_id":"030fd7a8-5a9f-4eb2-b041-faceb20e4675","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.762426Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:29bbb89f516aebfb64ca2f8ebb93b785d86a4db9b9cf4a47f441eb658aeff823","observation_id":"03d46eb8-dd22-46a2-b7ad-dae4a800caeb","resolution":{"observed_at":"2026-08-10T11:13:08.780968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.764537Z","title":"MME: A comprehen- sive evaluation benchmark for multimodal large language models,","venue":null,"work_id":"65dacee6-1e12-4cf9-8217-10507ad46938","year":2025},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.765590Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:0d7f6249ea7abb22102303c1f305e228b4ad79d0bb4443dccbd23124de9ef4e0","observation_id":"5de70b01-9f75-4c32-a013-bc5e60a6bc2e","resolution":{"observed_at":"2026-08-10T11:13:08.768647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.751785Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":"deb95292-d741-4423-a690-93dda9dd0bbf","year":2023},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.768948Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:02a576bdd743beb3830f365246a71d6a837e50217e97f389167cd437c86ee18f","observation_id":"84fce95a-d273-4994-96e6-61589768554b","resolution":{"observed_at":"2026-08-10T11:13:08.755815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.739286Z","title":"SEED-Bench: Benchmarking multimodal large language models,","venue":null,"work_id":"06633e09-2b22-449c-8707-24e7278b55b6","year":2024},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.772067Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:70d92703a11df34ad5870e1c1a0a137b2767e71c8b17cf172bf49525e644411e","observation_id":"ec0a164b-bf2c-4c03-b2e8-1e7f83cc6415","resolution":{"observed_at":"2026-08-10T11:13:08.743228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:13:08.725456Z","title":"Deep visual-semantic alignments for gen- erating image descriptions,","venue":null,"work_id":"96e2a923-b313-41e2-a429-8c1f6892bab7","year":2015},"citing_paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T11:13:07.775436Z"},"links":{"citing_paper":"/paper/2608.07279"},"observation_digest":"sha256:e8285ab78ad8f02b40c29a628849efa2c18c753d765a8ab2a3d415ac7fbf7425","observation_id":"00ae0b86-3e77-46be-939d-ed1154bc40a9","resolution":{"observed_at":"2026-08-10T11:13:08.730688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07279","last_updated":"2026-08-07T14:38:55Z","latest_version":1,"primary_category":"eess.SP","snapshot_observed_at":"2026-08-17T13:49:34.436943Z","submitted_at":"2026-08-07T14:38:55Z","title":"Token Communication for Multimodal Large Language Model"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2608.07279."}