{"as_of":"2026-08-15T00:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f198bea28684ae51596efff940e8534b91e488e2742b8ddc13a4090ab8b2e703","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:57:29.583850Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11167/citation-record","integrity":"/paper/2608.11167/integrity","json":"/paper/2608.11167/citation-record.json","paper":"/paper/2608.11167"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.196786Z","title":"Visual Instruction Tuning , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.196786Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:28916b77077e926eae61cba6e0e28e958c10a806dc8aa6e1885b340638a08e34","observation_id":"565c71e8-44ee-40a7-bc9c-ca5e5cff1448","resolution":{"observed_at":"2026-08-12T04:57:29.196786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.205718Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.205718Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:b0a5de7806161250f178b48c0e3325c8d85a61b5e7598743a1cdba522b2cdb12","observation_id":"885c6a52-3474-490d-95a4-3e54da950b4a","resolution":{"observed_at":"2026-08-12T04:57:29.205718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.210383Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.210383Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:2caf3f12fffbf83403266679f4dcb08903b3538ddb641dc052e549dc072a1348","observation_id":"4b2b103e-19f2-4ef5-8ddd-af34039fd017","resolution":{"observed_at":"2026-08-12T04:57:29.210383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T04:57:29.214140Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.214140Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:46e61c96a8665380492b7e15e5c5ab69d6b3a5119234d1c8077114d0c7af0f46","observation_id":"0bc2528a-21ed-49d6-afd1-97a4894d6f61","resolution":{"observed_at":"2026-08-12T04:57:29.214140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-12T04:57:29.218561Z","title":"Qwen2.5-VL Technical Report , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.218561Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:2052db0496cef99ccb58bdb028f72d00de5506fc716892cd315493225de8c7ec","observation_id":"754d5abb-09e1-49bb-a305-b31610cae958","resolution":{"observed_at":"2026-08-12T04:57:29.218561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.223012Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.223012Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:c9138c339ccc8f2a3221c4d83ab24a5ecc6727af131ab0c6dadef7c4718a891c","observation_id":"a3f5ab58-210a-4f26-be6b-b9e5e7637237","resolution":{"observed_at":"2026-08-12T04:57:29.223012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-14T07:46:43.583789Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-12T04:57:29.230150Z","title":"MiMo-VL Technical Report , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.230150Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:449c2cef480bc3cbd4b80bde2bf541d508c260e00cfe90a8b462adee1c262e22","observation_id":"ec6fb014-cc3f-411c-97ab-3317bc25fe51","resolution":{"observed_at":"2026-08-12T04:57:29.230150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.234182Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.234182Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:83fbad74f5b0582d496c575e16e1e3c8bb1d15e98ac84b1fbff44955798d8d9e","observation_id":"c498bd22-1e36-48e9-8295-3b69342f6ca9","resolution":{"observed_at":"2026-08-12T04:57:29.234182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-12T04:57:29.237647Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.237647Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:623a96a8e10c7d5b59520217427b136966f71e1ddd87cba6aab6890add3404cb","observation_id":"56cd082d-a781-48ff-a7b9-25ea335c561a","resolution":{"observed_at":"2026-08-12T04:57:29.237647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-12T04:57:29.241637Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.241637Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:f000bf13e4d67a914938407bdb39644b067dc30b38280dc768c501a9c30c0cb5","observation_id":"9700f8ad-d9d6-4c9c-9ab2-e256ead06748","resolution":{"observed_at":"2026-08-12T04:57:29.241637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.245635Z","title":"Scalable Vision Language Model Training via High Quality Data Curation , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.245635Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:2763912d1af4308c48d1672ba6d831a3e42160378a769f621819c8a58921bd6b","observation_id":"a98493a4-1f8a-4c78-8c33-d5e957b981c8","resolution":{"observed_at":"2026-08-12T04:57:29.245635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.249132Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.249132Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:a8fcd92a6c30bc26b430680f21aa0dce932334f141bbd500a231432731a43ec5","observation_id":"f4742661-3eac-49a7-96af-d507aed679e0","resolution":{"observed_at":"2026-08-12T04:57:29.249132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-12T04:57:29.253141Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.253141Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:1fd8ffa25806cfd33e47de59efb3aa7c8913450acd3966a1f359cafa7089055d","observation_id":"5e997eb9-1d21-4376-aba1-c8cb9b751f88","resolution":{"observed_at":"2026-08-12T04:57:29.253141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-12T04:57:29.257406Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.257406Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:badaf114179e5c93cf12caa485fee1873be06d12cc1ed2ddf57b325b7318a942","observation_id":"a1ca3212-96f5-4120-8be9-32b9fd38b029","resolution":{"observed_at":"2026-08-12T04:57:29.257406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2510.14979","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:30.175963Z","title":"CoRR , volume =","venue":null,"work_id":"5621a2f6-130e-4f0f-9dce-44c0780a6121","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.261748Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:2dfc4a8db48fbb6c77915a1a285433638e2f1875a0569414756faec7b39e49dd","observation_id":"606d72bd-1521-41af-86f8-ed8e16e64fee","resolution":{"observed_at":"2026-08-12T04:57:30.180987Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.265494Z","title":"Computer Vision -","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.265494Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:b505f1df686e7718a3378b2b783eb06b30404d700704c28bc6ee107a0cab16c4","observation_id":"ea48c056-da6f-48a1-ab50-01bb588aa137","resolution":{"observed_at":"2026-08-12T04:57:29.265494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T04:57:29.269711Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.269711Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:c2af1a52c7f39e0c07db97f1dcb955395c38bbb32dba70e84a8c5ae79523012d","observation_id":"a47e8c63-bfea-4588-8ce7-f1fe15e5d248","resolution":{"observed_at":"2026-08-12T04:57:29.269711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T04:57:29.273623Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.273623Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:fc293dcfcb056a2e5ca9f09fc9a0c5e7858ff718fa720d7632b6e0525db24411","observation_id":"de5b4bd7-3978-4b42-83fc-81c5c01d00f2","resolution":{"observed_at":"2026-08-12T04:57:29.273623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T04:57:29.277639Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.277639Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:58bfdb53d73dd49576bcb1d8da121e7c084022248e74df0abf3e726379a26a26","observation_id":"8679e8f7-be7a-4ec3-9f82-ee1df8f835b9","resolution":{"observed_at":"2026-08-12T04:57:29.277639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.281596Z","title":"Making the","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.281596Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:827e81d6eb72ecb736d2508238367b1f9d6f1837f957f3bc3872f655dd75b4e4","observation_id":"cd8b26b5-f973-4828-8103-9c4e6686aec1","resolution":{"observed_at":"2026-08-12T04:57:29.281596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.285486Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.285486Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:71721e50d4b5313074ef4eb4da98d105764c8d33722e3d65b2d52bac24f7635f","observation_id":"7843997f-c70e-4364-835e-31a78e905f08","resolution":{"observed_at":"2026-08-12T04:57:29.285486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.289625Z","title":"MMBench: Is Your Multi-modal Model an All-Around Player? , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.289625Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:df1c1a922bfab4a2a9391fa0f75ab5fcd50200634fe5310d564d5ab3998d5c75","observation_id":"8fb8e444-3744-443c-9fa4-582fcb27a03e","resolution":{"observed_at":"2026-08-12T04:57:29.289625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T04:57:29.294805Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.294805Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:a6dcb0540608762de9f387a0cd03746794b7a14c16c74f33898266f3818aaa36","observation_id":"f478145a-65b0-4b2f-92cb-dec2857d45c9","resolution":{"observed_at":"2026-08-12T04:57:29.294805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.299431Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models? , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.299431Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:0f69db80a064de2f07c2ca3e9991005cf5e1dfd467309ad029cf65c69a50ae43","observation_id":"cc75e00e-fa7a-443b-9502-7c12dd2e591b","resolution":{"observed_at":"2026-08-12T04:57:29.299431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.297122Z","title":"Forty-first International Conference on Machine Learning,","venue":null,"work_id":"b677feaf-a0d8-413d-8b7a-b78f8d504524","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.307220Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:5c7192b9b0b1f55fecc24ff77e48d429ec6ca3fc2b006a7a1b47c3c77d0a235e","observation_id":"b6f4399b-c5c1-438f-832f-2d47f8d26dc6","resolution":{"observed_at":"2026-08-12T04:57:31.301283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.311156Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.311156Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:5eace34e1673f3e6152012a37117cead539245a3cb75844b7628c306b7474a8b","observation_id":"92af91a1-ab07-4a2f-bbd3-d324f400ce42","resolution":{"observed_at":"2026-08-12T04:57:29.311156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.314674Z","title":"A Diagram is Worth a Dozen Images , booktitle =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.314674Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:86779132247533b1b749fcf8f283127f76b95858361530f4a2812768fac25f44","observation_id":"b2889eba-9548-4e16-b9c6-e9ec1d9db9fb","resolution":{"observed_at":"2026-08-12T04:57:29.314674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.318875Z","title":"Joty and Enamul Hoque , editor =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.318875Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d92aed6a8406f0acd431a52e0175394bf5efe2af31760d220c75761efe4d8ca6","observation_id":"5d21991e-be69-43e5-b0e1-c1de80f27ee0","resolution":{"observed_at":"2026-08-12T04:57:29.318875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.285433Z","title":"Cambrian-1:","venue":null,"work_id":"ff882dd6-dc77-4c49-bf54-75b7a8a8deb0","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.322900Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:a863dc29127f9acb371451cf5bb438c5b452700abdabf380f268fe39409b4a2f","observation_id":"966b00db-cd54-4d65-85b5-0de2840a07ed","resolution":{"observed_at":"2026-08-12T04:57:31.289350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.327016Z","title":"OCRBench: on the hidden mystery of","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.327016Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:53621079eda1d905847399a52b42b5b5dee4678c55209a6994b0d9cc6fa4dc89","observation_id":"e8eb2ba9-63e7-4ac4-aa06-97e6ee4e2dfd","resolution":{"observed_at":"2026-08-12T04:57:29.327016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.330804Z","title":"2019 , url =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.330804Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:ae0f36e4b2be06291046658f4f7e8543cf1a9ac09e8fde510c439fd1af6b885e","observation_id":"0bb53f02-c088-4c53-9237-85ab45e99862","resolution":{"observed_at":"2026-08-12T04:57:29.330804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.337861Z","title":"Berg , editor =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.337861Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:5f0cd97ed9addd4e28a7cd8fb935806edfc12ace8d3aa127497e21253e9b03c8","observation_id":"8d61bc53-0d30-4d5b-8979-cb784e26e15d","resolution":{"observed_at":"2026-08-12T04:57:29.337861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.341502Z","title":"Yuille and Kevin Murphy , title =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.341502Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:565b883908ec92e5ede0e8d3f0ecc2a1af83d9f5008d4eaae6ca31595f566cce","observation_id":"438c1bf1-98ec-4d3d-8c16-65f9f746a306","resolution":{"observed_at":"2026-08-12T04:57:29.341502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.345672Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.345672Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:78016d96064e06ff3c70a2a64625ca3b14936fa23311c70bcf3944f1991e83ca","observation_id":"e74cd858-eb1d-44c7-9060-f68719cf461e","resolution":{"observed_at":"2026-08-12T04:57:29.345672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.349323Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.349323Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:1480b3a36dd864a9324839d06cebe82b1b012a5d0bf4f057fa27eea244587128","observation_id":"205dfa8c-497f-424e-a738-adee591aca4e","resolution":{"observed_at":"2026-08-12T04:57:29.349323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.352991Z","title":"ShareGPT4V: Improving Large Multi-modal Models with Better Captions , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.352991Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:0dfb2e27fc8e7a0709e0c01251a132dc090ac1f48be4a0b51e299f988e12abcd","observation_id":"45e93531-70cd-4e47-bbed-9e0b49aca790","resolution":{"observed_at":"2026-08-12T04:57:29.352991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-12T04:57:29.356681Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.356681Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:37ec7b7f465b62a64aa81ec2a4b590604b292ca0f9dddd25d5ace8dd6fe90544","observation_id":"3cec23b2-d15e-479f-8f48-d39036e9083a","resolution":{"observed_at":"2026-08-12T04:57:29.356681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.274080Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception , booktitle =","venue":null,"work_id":"1ee7f996-88c0-41f0-8856-5091a6d4e3bd","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.360560Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:238dcad9d378d3f8265515240bd92fdeadb9989b51cd1232a993dac9390c90e2","observation_id":"cef80f05-23ca-4fd2-b9f9-f0cdad2e25d2","resolution":{"observed_at":"2026-08-12T04:57:31.277887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-12T05:33:56.515699Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-12T04:57:29.366022Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.366022Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d2affba3647b63dac7430090acad08487781e159ae794ca4facb7bcca9de75b9","observation_id":"89047adb-f0dd-4db6-8626-d5c982287beb","resolution":{"observed_at":"2026-08-12T04:57:29.366022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.370959Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.370959Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:18b8f4b25271cabfca2181b193aa4eccbb849b8dfe60fee39d905bc317135446","observation_id":"21da1ec2-b606-4317-af1b-4c006199bc6b","resolution":{"observed_at":"2026-08-12T04:57:29.370959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.374937Z","title":"Computer Vision -","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.374937Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d90a4090f3a9237342e364848b04088496406edc4b0d8b64a823b3af59ee161e","observation_id":"4e2ded75-9897-483d-bdaa-3244b3cc8133","resolution":{"observed_at":"2026-08-12T04:57:29.374937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.22647","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.918034Z","title":"CoRR , volume =","venue":null,"work_id":"2d1fcde7-7bec-4011-a952-66f31786f6c3","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.380107Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:553d2db771808e7b1214229ff7a113ee9514336b23ef23c5f5b66344be1f9dd0","observation_id":"59fce482-b53e-4896-a479-f67ead3f281a","resolution":{"observed_at":"2026-08-12T04:57:29.921963Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.385103Z","title":"Microsoft","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.385103Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d43b8588a988dfd75896cdb2e4f021862a1db32715599976f370e03c3fc6a301","observation_id":"b417e9be-da9b-45fe-ade6-3cc9286b023f","resolution":{"observed_at":"2026-08-12T04:57:29.385103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.389041Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.389041Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:439e43908d30d757e263e96bbf3b2af0616ee6136c9bf1a4c8d16f07a01390e4","observation_id":"c5ddacd0-7702-4c31-95f8-6ca162d3a25d","resolution":{"observed_at":"2026-08-12T04:57:29.389041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.396828Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.396828Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:6e5f7e85b5e91790086540b2b22efff4cfefea91c2298de77650f57a84208af2","observation_id":"ce3f8042-9f48-4740-8fa3-884b0755b6c6","resolution":{"observed_at":"2026-08-12T04:57:29.396828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.402678Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.402678Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:c5e355ca4de0d28e1bfe0a7d77be4976013aa6a1ab45fb179be3f690f60c9897","observation_id":"9d10c119-6fdb-454c-b553-625a839350ea","resolution":{"observed_at":"2026-08-12T04:57:29.402678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.406419Z","title":"Segment Anything , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.406419Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:c9239399fcbf4a220f68b8a7ac58f3a9a3a6ecafcd77e278193c8ad129bc0ea9","observation_id":"abbab471-c565-464f-aea3-0451272a2df6","resolution":{"observed_at":"2026-08-12T04:57:29.406419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.410596Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.410596Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:1ebc01433f92c0005e264723e0db9ada5c4ca718d678b159ae0bb7eda9483d77","observation_id":"bb5db8b4-3b52-4168-a186-825279c19c33","resolution":{"observed_at":"2026-08-12T04:57:29.410596Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.414823Z","title":"2019 International Conference on Document Analysis and Recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.414823Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:0436447eae4692ad4e9989a9a1b5d0f191b1459c9ee24b2fd37c547ac1d27e48","observation_id":"70fb8413-9ed0-4208-8925-81225e0307ff","resolution":{"observed_at":"2026-08-12T04:57:29.414823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.418656Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations , journal =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.418656Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:1dabe39112183ba7a50df9192755ad816d7aab107c0d783893df7f440e75a94a","observation_id":"0be0bab2-6ab8-41c5-b7ff-f0acd559e871","resolution":{"observed_at":"2026-08-12T04:57:29.418656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.422714Z","title":"Price and Scott Cohen and Christopher Kanan , title =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.422714Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:ab9724d586791acd6dae657af9f724da909e9ee06bdec58245bd9ba37fd4e8e1","observation_id":"99e3d290-888c-4409-8749-adef6a03714e","resolution":{"observed_at":"2026-08-12T04:57:29.422714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.427268Z","title":"OCR-Free Document Understanding Transformer , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.427268Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d3d5f6fb2cc867462aae4a89aaf5acdf99a46c0ba2633f06b5880c3c128afe7e","observation_id":"e793620b-01d4-4fc2-8d3d-0b07548dbd58","resolution":{"observed_at":"2026-08-12T04:57:29.427268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.262556Z","title":null,"venue":null,"work_id":"38ba3dd9-1bc6-4ab7-a98b-b0063d623f10","year":2022},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.431339Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:dd98d87d189d17f321c1371d1f8155a87936054472c9ccc4dd0bf5c7f404c42a","observation_id":"d7e7e17a-16cd-40c2-9c9c-6fce36402e1b","resolution":{"observed_at":"2026-08-12T04:57:31.266267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.435187Z","title":"Grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.435187Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:13f59dded11799994813f487d54590f1c3f775ffd36628b43fae22aee338ffda","observation_id":"2ff79465-f090-4877-939c-03b535a9919f","resolution":{"observed_at":"2026-08-12T04:57:29.435187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.438815Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.438815Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d5c82f5a513c9987538d059770372e24bf33a7e9f90952fc2e25bebe6a9f892e","observation_id":"d872d31f-f3b5-4831-a098-3ecb84aa09a2","resolution":{"observed_at":"2026-08-12T04:57:29.438815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.242190Z","title":"Forty-first International Conference on Machine Learning,","venue":null,"work_id":"858d474f-7c72-4d66-a5a8-c355d1be2537","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.446143Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:d9322c476fc50993d2dcde9fe73ee4dacde4c18fefda5982b2be639bccdd8654","observation_id":"5f8c0848-552d-4c53-b33b-54ac20f4bec2","resolution":{"observed_at":"2026-08-12T04:57:31.246523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.230426Z","title":"Hinton , editor =","venue":null,"work_id":"bd126496-5787-4558-a950-840cceaa4dad","year":2019},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.450985Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:13004968a32c37f8d2eeeb96a20fd4a253520cf0bf943e3c441b63fb9e6594cc","observation_id":"bdaf6862-6507-4e7c-9463-79024530986e","resolution":{"observed_at":"2026-08-12T04:57:31.234332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.55","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.783709Z","title":"SEA : Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLM s","venue":null,"work_id":"3cdadbbd-b15f-4d0f-85f9-eeeef8c37a5b","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.456006Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:673dc8765ecd9a14ff067d8a6386816e08c5598cdb693f2858721f5cbb9a8ddd","observation_id":"9e0ab83a-63a3-4426-b20c-d62751cdb8e8","resolution":{"observed_at":"2026-08-12T04:57:29.788892Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-12T00:08:23.091413Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-08-12T04:57:29.460876Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.460876Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:be0961b64af67a4d6929e6c6c2faa482372e1b558bde140dcdb4da3522f0cf5d","observation_id":"d6ac425d-f669-4b50-ae94-43c4517bc5f7","resolution":{"observed_at":"2026-08-12T04:57:29.460876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.360","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.758511Z","title":"GroundingGPT: Language Enhanced Multi-modal Grounding Model , booktitle =","venue":null,"work_id":"518d2614-7092-48e4-b6a7-52cc53694259","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.469014Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:1053412b18a513c3c470a27526e6e6b70234b0f44ea30228a61a3a40869163f6","observation_id":"13a8c10a-4f3b-4043-88ba-1996568f87b1","resolution":{"observed_at":"2026-08-12T04:57:29.762427Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.721","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.745974Z","title":"Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models","venue":null,"work_id":"beeb9f63-e854-4f33-bb94-cd72a0f087a6","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.473156Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:21cc44eb59fec0ecf6256b1396f8802a28361adbe1b65e7e1fa621e11cfe2063","observation_id":"e4d0ef44-8a33-4824-a5f3-a1f312028ad2","resolution":{"observed_at":"2026-08-12T04:57:29.750175Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T04:57:29.477504Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.477504Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:5e0a354ee72a95ddf0e41bda3f6004a05e603b59b48f5030def1cc203aa22359","observation_id":"d34a3720-006b-476d-9616-28a8ab2b83c5","resolution":{"observed_at":"2026-08-12T04:57:29.477504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i7.32806","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.722402Z","title":"ParGo: Bridging Vision-Language with Partial and Global Views , booktitle =","venue":null,"work_id":"574a6b15-d11c-49e1-a9b6-a5a896d98f7e","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.486341Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:94139994d1560c5cc3c7f2e9d7366e88cb2ff58529f2feaef71e3e33d13fde39","observation_id":"771488ca-ee58-44b5-878e-c446e0a4dfe8","resolution":{"observed_at":"2026-08-12T04:57:29.726467Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T04:57:29.490215Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.490215Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:c30db495703cfc62d1e03fe67d5eb5582faa4db3189d6f53f0d40191dc3371d2","observation_id":"73485882-dd2d-4a8e-930b-2214a5f87f1f","resolution":{"observed_at":"2026-08-12T04:57:29.490215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.218451Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity , booktitle =","venue":null,"work_id":"0b1d5035-8a1f-4c90-9c98-ac25214e7183","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.494547Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:efc1e1dcd7016c8ea79663bd0acb6d91b66e4826f0e256b3f1eaceaa4e189ee2","observation_id":"b0b25b03-1f68-4821-9d4a-7fad0d63e5f6","resolution":{"observed_at":"2026-08-12T04:57:31.222667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.205757Z","title":"ICCV , year=","venue":null,"work_id":"805cb29a-3160-4f55-bfba-a36c10b53ca7","year":null},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.498269Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:45aa67616ffc82d986f247c8418cd692dcccf844e8b1cf615a7ad617b898b66d","observation_id":"2d1c01d8-6b9d-4668-901f-e007c922e92b","resolution":{"observed_at":"2026-08-12T04:57:31.210661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.193548Z","title":null,"venue":null,"work_id":"6e981b07-61de-4662-9b2a-5e78fb96ba99","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.502369Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:79868afe0a090eb05c31d5d841ebef9992c88db342563a55601fc470e7567575","observation_id":"2046d4a3-1d46-4e01-8fb0-c5a24677d9fc","resolution":{"observed_at":"2026-08-12T04:57:31.197617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-12T04:57:29.505985Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.505985Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:c2c1bd2ec1c38a26e36eba0c61b249e356425c365287c9af4349b2a57e5019c6","observation_id":"9aa41628-5252-4051-b715-16d7d06c68d3","resolution":{"observed_at":"2026-08-12T04:57:29.505985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.509977Z","title":"Learning Transferable Visual Models From Natural Language Supervision , booktitle =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.509977Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:60af734e787a742c503246f11a464ea63e57566bb2592da089b557b417159057","observation_id":"baf50106-d779-424c-acb3-61de245ec292","resolution":{"observed_at":"2026-08-12T04:57:29.509977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-12T04:57:29.513508Z","title":"Gritsenko and Xiao Wang and Muhammad Ferjad Naeem and Ibrahim Alabdulmohsin and Nikhil Parthasarathy and Talfan Evans and Lucas Beyer and Ye Xia and Basil Mustafa and Olivier J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.513508Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:9e416fd2c570b0880be03b80b37c54eec15315abd1ed2a2f4c5edc2817bf7142","observation_id":"1b9d230d-3562-416b-80aa-8a8b8503e51a","resolution":{"observed_at":"2026-08-12T04:57:29.513508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-91813-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest , booktitle =","venue":"Lecture notes in computer science","work_id":"36fed18b-a03c-494d-9511-4138da59fdec","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.518355Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:eae93854604579739dcdcd0b11f8e1fc8d0d29ff859a45918fa0849580d722f3","observation_id":"2d5521f7-924d-4bba-b023-f15988c62f71","resolution":{"observed_at":"2026-08-12T04:57:29.677408Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.522179Z","title":"Shaker and Salman H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.522179Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:48ac2880a0e4640b1ba48a8002f2e30963cd62c468d73902885e93f523b0c34a","observation_id":"02cc1978-67db-47a9-bbb7-fcad49a87637","resolution":{"observed_at":"2026-08-12T04:57:29.522179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.172597Z","title":"NExT-Chat: An","venue":null,"work_id":"4bdfd5b0-7d89-42f4-bc5b-d84b82be826c","year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.525748Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:f66b807aed74ec6177fd44e22d06a9c5db1eeb12a4969f850a838984eeb1a4bc","observation_id":"70b2912e-eb61-455e-8ada-155eaddd0cbc","resolution":{"observed_at":"2026-08-12T04:57:31.176905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.529634Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.529634Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:f3b6898fa75dca1c2990947995d416694f1ad459a9b8218802e9fc252224c7f3","observation_id":"e9d00afa-6941-4047-8a5c-b6247aaab4f7","resolution":{"observed_at":"2026-08-12T04:57:29.529634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.534030Z","title":"The All-Seeing Project","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.534030Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:cdc67fd31ac255a7e6eef2aa3d8443b1ecf4030c7135c0cc1c1d40af0305f01c","observation_id":"d660a6f6-af95-4a67-b46f-6defdd0d40d6","resolution":{"observed_at":"2026-08-12T04:57:29.534030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.158202Z","title":"Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training , booktitle =","venue":null,"work_id":"853b675f-d7cf-417c-93cd-ff3efdc4429f","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.537581Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:140f7ddaf3592a16c5dd3d225445ec359f363520f847d9474b68e1d8193f7d16","observation_id":"474a49c6-8f61-4d83-9ac5-b84e8e4d9867","resolution":{"observed_at":"2026-08-12T04:57:31.163045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.541551Z","title":"PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual Alignment , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.541551Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:473d4695bc2dede8d9bf22f9d43f826d89b115e755c71f941ebbbc8d556080f8","observation_id":"e313d1cf-c9e1-4d48-985b-13a69e1b5aac","resolution":{"observed_at":"2026-08-12T04:57:29.541551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.145228Z","title":"Code-Switching Curriculum Learning for Multilingual Transfer in LLMs , booktitle =","venue":null,"work_id":"666e93cb-4832-45c2-bd5a-846a74f47765","year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.545608Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:b4110028d098fefa170c7a8ef77f476264147332d56fb864e6cb84d69e6b41be","observation_id":"3f70b69b-cdfc-4972-b6fc-dbdce5df0209","resolution":{"observed_at":"2026-08-12T04:57:31.149501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12566","last_updated":"2020-10-23T17:53:11Z","snapshot_observed_at":"2026-08-09T15:59:05.070254Z","submitted_at":"2020-10-23T17:53:11Z","title":"DICT-MLM: Improved Multilingual Pre-Training using Bilingual Dictionaries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12566","snapshot_observed_at":"2026-08-12T04:57:29.549323Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.549323Z"},"links":{"cited_paper":"/paper/2010.12566","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:463531ede8abd656898200da377fcca07a90701ee59b96686050146179ba793f","observation_id":"cd13adba-e00f-494f-af79-67378847e00b","resolution":{"observed_at":"2026-08-12T04:57:29.549323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2020/533","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.638026Z","title":"CoSDA-ML: Multi-Lingual Code-Switching Data Augmentation for Zero-Shot Cross-Lingual","venue":null,"work_id":"eb1d946c-f2bb-469d-a825-8d03f50fcd5e","year":2020},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.554233Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:5a43bc73030aeb031d44ee8e88f2a3d37ff22eb291f5bd4ea1af8647b1aa40fe","observation_id":"d323adac-6712-4058-92e6-6a814d721a39","resolution":{"observed_at":"2026-08-12T04:57:29.642572Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.mrqa-1.10","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.622827Z","title":"Bilingual Alignment Pre-Training for Zero-Shot Cross-Lingual Transfer","venue":null,"work_id":"ff6a41bb-ef8b-417d-bfdf-ae8a1af6186c","year":2021},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.558383Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:169d0b9b71fc2a495bfcb963560a4b5a31c836e47f415277b09d48637a820d50","observation_id":"c4518eaa-3692-4674-9be4-5fb1b2a65984","resolution":{"observed_at":"2026-08-12T04:57:29.628745Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.130965Z","title":"Latino Language and Communicative Behavior , editor =","venue":null,"work_id":"4a404d4e-97d6-4ceb-8c86-99cb2d65a838","year":1981},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.562649Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:f1a8bc5c3cf89cfc16cbe5bf05e71106673f7884a18924312f50610f8d7ae6e3","observation_id":"ed807199-313f-400c-b98a-76c76d9c7e41","resolution":{"observed_at":"2026-08-12T04:57:31.135163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.85544","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:30.357785Z","title":"Thara and Prabaharan Poornachandran , title =","venue":null,"work_id":"4b6c22cf-d12e-496d-b49f-2e229c6e2ef1","year":2018},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.567258Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:0045f6d8b38098fb0c570efb6a300ff59ba58a624e0bb834c4efb65078760724","observation_id":"3626a8b2-33ad-484e-9e91-26d287c368d9","resolution":{"observed_at":"2026-08-12T04:57:30.364833Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:31.117448Z","title":"Alabdulmohsin and Avital Oliver and Piotr Padlewski and Alexey A","venue":null,"work_id":"d43e2b83-5fee-42c5-878d-e3a1fe66ebb6","year":2023},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.571385Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:0ee18593fed3d73dfbeb70e5435496671f0f338c4b0f8c4121d8aefa632317a6","observation_id":"0f9fbaa1-9520-482c-b3a1-b903594a379a","resolution":{"observed_at":"2026-08-12T04:57:31.121851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.575127Z","title":"Hu and Yelong Shen and Phillip Wallis and Zeyuan Allen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.575127Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:7cc53e42c18f1c771b7d2ba11f7c50c344fc7b789cdb0939fb695735134fd4fb","observation_id":"0fb93f31-adc7-44a4-9fd3-175496eb9a09","resolution":{"observed_at":"2026-08-12T04:57:29.575127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.579562Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.579562Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:07a8829fee20b33567a38e69dcd17b9ffa6cb2490a72b1af712c4e3dc415f1fc","observation_id":"aa44995f-2e8f-4629-81e1-0efa883a7051","resolution":{"observed_at":"2026-08-12T04:57:29.579562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:57:29.583850Z","title":"18th International Conference on Pattern Recognition","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.583850Z"},"links":{"citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:1f61cb3fb4a830101feed5620be32a4ca61f17503c01def427caddc12689edb5","observation_id":"e8ec4d31-14bf-4d50-ae36-e862ddc6b724","resolution":{"observed_at":"2026-08-12T04:57:29.583850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T23:12:38.988566Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":64,"verified_exact":9,"verified_fuzzy":12},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2608.11167."}