{"as_of":"2026-08-12T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf93c874a20689600efa8cca62a3c6986684655c6d1b46cf26384d7eafc9756d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:45:44.870849Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09817/citation-record","integrity":"/paper/2412.09817/integrity","json":"/paper/2412.09817/citation-record.json","paper":"/paper/2412.09817"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.659646Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.659646Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:0f0d714eda0f007859abdfff8c4da30a015bfe055167419b0f010696ddd6fd2b","observation_id":"ab2c5cd8-8afd-46f6-aff5-a1120b759a2c","resolution":{"observed_at":"2026-08-11T16:45:44.659646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.664145Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.664145Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:12bed87ee3f0abaa4ad94696a1f696209ca4fa695f00feb2411dd471c78cbe09","observation_id":"26459d2f-3047-470f-9171-71096ab547f7","resolution":{"observed_at":"2026-08-11T16:45:44.664145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.493243Z","title":null,"venue":null,"work_id":"e5be39c1-8fe0-4cca-b206-a9fed544f528","year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.668737Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:feff27b8f450d1f2c55845fc5c973f1fdb1d3a6ce971df7734584c6e47feabf1","observation_id":"aaf457e3-f2df-4deb-8169-82c9c15c62a4","resolution":{"observed_at":"2026-08-11T16:45:45.497001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T16:45:44.672692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.672692Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:53ac1fe3a9438890f6f94eab565bc13b19887e9d55a6c1d91ae5eea676d2be8b","observation_id":"de3f5a70-9bd8-4bca-bd00-eb1f083de74b","resolution":{"observed_at":"2026-08-11T16:45:44.672692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T16:45:44.677283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.677283Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a3b90c58f7cdacb0556ef8665d6f91ebc4e1aa6fb45b31898cdff6f242d6fcde","observation_id":"c065c839-cc18-4729-a2f2-bd9c412471da","resolution":{"observed_at":"2026-08-11T16:45:44.677283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.482669Z","title":null,"venue":null,"work_id":"c24085e8-7038-4b99-8375-a5a02bc1f4fb","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.681789Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:ee0500a0bb4d767b08ee97c679b9396529d1b7e5b951ae7498d0e1d6f616b42d","observation_id":"8deb9786-40bc-4052-b46b-5b4eeeda68e0","resolution":{"observed_at":"2026-08-11T16:45:45.486002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T16:45:44.689734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.689734Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:ecfc377335833c5b554e8e546d8353729856df9d40bde109808fa3f43852d350","observation_id":"dc2b24e6-c43d-4ecb-b453-762a7e6c9de8","resolution":{"observed_at":"2026-08-11T16:45:44.689734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-11T16:45:44.693657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.693657Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:872fa6e92c9dc6abaa588eae6f0b7d05b4f0e4d0fb4707e312f73490a36f2890","observation_id":"6b751465-a209-4e61-9e02-4ab9df02e2e7","resolution":{"observed_at":"2026-08-11T16:45:44.693657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.697445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.697445Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:086c9894dd4d4ae9e1332667ec9429aa089f22f91f65553297dba7054483ba11","observation_id":"18c75d0a-b2f2-4773-a2f8-8fc7c8dd3284","resolution":{"observed_at":"2026-08-11T16:45:44.697445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.701291Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.701291Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:089d04d5e9dbe09f016f957a39af161263e3e33bf07ab3d7d88d4ce373c6cd4d","observation_id":"3c3a9258-cdbb-4d5b-92a2-039e3c1d37d9","resolution":{"observed_at":"2026-08-11T16:45:44.701291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.456437Z","title":"K.-p.; Qian, T.; and Wang, S","venue":null,"work_id":"61996803-9581-44ac-88a1-33aa63543c01","year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.704823Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:696ede652b2057bb68287d369934fa02d8aa73db96d070c1d042466ebfb07e75","observation_id":"4adf3b1b-e2f3-4a84-8a27-eb4d1093642b","resolution":{"observed_at":"2026-08-11T16:45:45.462402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-07-06T05:51:36.145913Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-11T16:45:44.708251Z","title":"J.; Kiros, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.708251Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:81c01230f165e4b67beab21d9fb085fa76e90b36fa624b46fda3b4129843b8ca","observation_id":"57a9ad2d-a67b-4079-a171-e7daf591b99f","resolution":{"observed_at":"2026-08-11T16:45:44.708251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.711987Z","title":"S.; Shlens, J.; Bengio, S.; Dean, J.; Ranzato, M.; and Mikolov, T","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.711987Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a815ebc87555b425cf6c5dd093e49a904df2186005cc831a2f62276847455131","observation_id":"b3883893-5b76-4d5c-a712-3e810113d082","resolution":{"observed_at":"2026-08-11T16:45:44.711987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.715548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.715548Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a4f4376464df7a29984c75df3927a8290ce4d8c7ef15e52ae324d901961bbbf7","observation_id":"7821a4e7-f3e3-4e19-926c-50d9ee9197ce","resolution":{"observed_at":"2026-08-11T16:45:44.715548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15421","last_updated":"2024-11-26T13:25:34Z","snapshot_observed_at":"2026-08-12T14:17:16.896517Z","submitted_at":"2024-11-23T02:53:08Z","title":"OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15421","snapshot_observed_at":"2026-08-11T16:45:44.719020Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.719020Z"},"links":{"cited_paper":"/paper/2411.15421","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:51a9520bbb88c2d0bc4669393645318e2add2872de0697fba47d8d70a7424468","observation_id":"4a80bfb5-b0b2-4573-94b9-876f2eb89f3b","resolution":{"observed_at":"2026-08-11T16:45:44.719020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.428390Z","title":null,"venue":null,"work_id":"13c1869a-0603-46ea-92a5-defb9088cc17","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.726564Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7dc0ee2aea0cf5060edf306ae5d27ebc04dae729b99bd7c19a02c4c39bbe03c3","observation_id":"bce94d8c-11e7-4d67-beda-510fc5ad6544","resolution":{"observed_at":"2026-08-11T16:45:45.431894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-07-06T04:00:05.122784Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-11T16:45:44.730495Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.730495Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:ed7d073e23ef813d6d1180a2dca7dfe3986b9c912a849cedcb2280023d45e657","observation_id":"34dbc0fd-30fc-44bf-afd8-40fdd24a42f4","resolution":{"observed_at":"2026-08-11T16:45:44.730495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.736267Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.736267Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:ffdac04ea022cfa88e110776cd5c9c1aa34ce82a5c0ef3512f5679dbbab6efe4","observation_id":"5d6d876d-f52e-4c50-b6bc-c7d7e7457558","resolution":{"observed_at":"2026-08-11T16:45:44.736267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.740539Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.740539Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:eebb1b09ca2712dd3cf60f2e63d97d19f65fe0bb46d361dd372ccf4c44ad5cef","observation_id":"a09af1a3-2b9b-46bd-ac49-81e4258ca51d","resolution":{"observed_at":"2026-08-11T16:45:44.740539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-12T09:36:48.705293Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-11T16:45:44.743967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.743967Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:5f28309929434d38c420631cd2959d8bea48b11aea9886341f9de7ace938ad7b","observation_id":"0f706992-c754-4cc4-8ed3-cfa581e8a94e","resolution":{"observed_at":"2026-08-11T16:45:44.743967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.405573Z","title":null,"venue":null,"work_id":"25f88f30-5a72-4952-988e-6af58e2757cd","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.747739Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:86b283c4f4da78c7c47c24eaa43098dbde035c1e89474e14761d542bd1651eef","observation_id":"3d81ac7a-ff0c-4cff-8b33-21f531c92a70","resolution":{"observed_at":"2026-08-11T16:45:45.409110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T16:45:44.751352Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.751352Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:137a696cd2d9c37e7dde4f29e7c430a6605ed3fda3fc7f8032c8e9e5726a379c","observation_id":"9bc62403-be46-45df-b7b9-ac5c02775dc1","resolution":{"observed_at":"2026-08-11T16:45:44.751352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.395222Z","title":null,"venue":null,"work_id":"75aa3340-c27f-4101-97c8-a580d9910c40","year":2021},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.755283Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7394f75ab6bae2cd3e557b50ba8d6e733798b3439b912cc3753b42f5ee8d100a","observation_id":"620194f9-467b-4a8a-85a8-c0e622fdbf23","resolution":{"observed_at":"2026-08-11T16:45:45.398877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.758732Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.758732Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:b1e0e269bab8d303fdda140adf3ceb28716e98710bcc2cb343baa37072dbca31","observation_id":"e42b04e2-881a-4cf1-9295-94638494492f","resolution":{"observed_at":"2026-08-11T16:45:44.758732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.762111Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.762111Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:d13b6087c3dff2a7fbf83111077f97708594d16d485f8324532727c4ffdabda2","observation_id":"76bb4713-f1db-4249-a7d3-f824a59d7501","resolution":{"observed_at":"2026-08-11T16:45:44.762111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.765864Z","title":"J.; and Yan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.765864Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:b9d7fddb2741110048af91a5c14ed9addf97d3b040451dbb0e248bcc5693b55f","observation_id":"d88a1c08-ceea-4557-8d90-ebd642c51052","resolution":{"observed_at":"2026-08-11T16:45:44.765864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12705","last_updated":"2024-08-06T13:06:26Z","snapshot_observed_at":"2026-08-09T18:34:17.959690Z","submitted_at":"2024-07-17T16:26:30Z","title":"IMAGDressing-v1: Customizable Virtual Dressing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12705","snapshot_observed_at":"2026-08-11T16:45:44.769254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.769254Z"},"links":{"cited_paper":"/paper/2407.12705","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:d29b2d4405ecd7156578d5a5432e29491bb00ecf069441424c90ac74f503735f","observation_id":"7b70f671-3c40-4dfb-8340-20523a88b89a","resolution":{"observed_at":"2026-08-11T16:45:44.769254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.773148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.773148Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:5af8990ac1de88956f12b82f1c91f2a54141056a7947c800b33da2d698dbb4d1","observation_id":"b5ed5497-9a08-4ec5-b7b1-52e0524d14a6","resolution":{"observed_at":"2026-08-11T16:45:44.773148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02482","last_updated":"2024-07-03T18:17:01Z","snapshot_observed_at":"2026-08-11T10:38:17.860536Z","submitted_at":"2024-07-02T17:58:07Z","title":"Boosting Consistency in Story Visualization with Rich-Contextual Conditional Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02482","snapshot_observed_at":"2026-08-11T16:45:44.776695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.776695Z"},"links":{"cited_paper":"/paper/2407.02482","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:58fb497309b63fd7ac5beef153543a5c47351544265ce2d04c8227ef8fec73ec","observation_id":"2a03c5ce-a27c-4224-ad62-437f84aff12a","resolution":{"observed_at":"2026-08-11T16:45:44.776695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.363536Z","title":"???? Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models","venue":null,"work_id":"59db7870-0297-4bf3-879c-55718fe56352","year":null},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.780400Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:4395bcf988440ea49aadec0b58a7b2538a447b4b6bc3944f71df8820d79d162e","observation_id":"d74a7b21-5708-4231-a500-46c57347085b","resolution":{"observed_at":"2026-08-11T16:45:45.368028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02539","last_updated":"2025-05-26T03:47:46Z","snapshot_observed_at":"2026-07-06T18:25:22.852874Z","submitted_at":"2024-06-04T17:56:28Z","title":"Parrot: Multilingual Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02539","snapshot_observed_at":"2026-08-11T16:45:44.784099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.784099Z"},"links":{"cited_paper":"/paper/2406.02539","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7f9e16cf7a8c531117b68e264133f3f1479ff87f45adff7aff7793ae4f2d4bda","observation_id":"3e395ca2-e21a-4d8c-a5a8-a44655a5da63","resolution":{"observed_at":"2026-08-11T16:45:44.784099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07117","last_updated":"2025-03-08T08:26:47Z","snapshot_observed_at":"2026-07-06T16:18:06.415304Z","submitted_at":"2023-09-13T17:55:11Z","title":"PILOT: A Pre-Trained Model-Based Continual Learning Toolbox","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07117","snapshot_observed_at":"2026-08-11T16:45:44.788078Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.788078Z"},"links":{"cited_paper":"/paper/2309.07117","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:072424eea9b5828a8f4848cf9b3972323cd0869bbd942aa2c6644ffe103ff2b8","observation_id":"34a5d01c-c8e4-45f6-aac7-c14682479013","resolution":{"observed_at":"2026-08-11T16:45:44.788078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.352922Z","title":null,"venue":null,"work_id":"2e930179-f496-403d-8343-e8198408bbc1","year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.791824Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a7f00ea6def8d593bc4b0cae889b9e81583dca62e3f3504047917417b2d0c810","observation_id":"396e2e59-ce9f-4521-8481-8b8377aa5703","resolution":{"observed_at":"2026-08-11T16:45:45.356442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12803","last_updated":"2025-06-11T03:20:44Z","snapshot_observed_at":"2026-08-05T02:34:05.403776Z","submitted_at":"2024-04-19T11:38:08Z","title":"TextSquare: Scaling up Text-Centric Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12803","snapshot_observed_at":"2026-08-11T16:45:44.795528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.795528Z"},"links":{"cited_paper":"/paper/2404.12803","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:27e340cd32930ea68acc2238226122111429f4eba49a5c826796a265f01ebd53","observation_id":"56b8f89a-496f-47a4-b0a1-88e60bc87b48","resolution":{"observed_at":"2026-08-11T16:45:44.795528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-12T02:26:36.784726Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-11T16:45:44.799374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.799374Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:88eba92d512281ff80bdab714c18ba34ff06aef956b72cd6a8e1728266ccaf75","observation_id":"642c7b47-686e-4b37-9202-3497554fc21a","resolution":{"observed_at":"2026-08-11T16:45:44.799374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.341798Z","title":null,"venue":null,"work_id":"9e4d4be5-a0cd-40bf-9442-e601db7b4162","year":2025},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.803209Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7e45ccddfaf35a1e6731cd53f07bd3bf4443c5e10b7073301b8b4733aaf79d14","observation_id":"442acfa7-1bd9-4235-8824-f33b9a04493c","resolution":{"observed_at":"2026-08-11T16:45:45.345348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.330570Z","title":null,"venue":null,"work_id":"d0414ff7-3e41-42cf-9f67-1729d9eddf71","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.806264Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:e3156a8d9c6a7f7a4dbb5bb3ebc658c4a2e6f62f6165d4724993cac5a2cefa9e","observation_id":"c3ab9fa4-b95d-4483-8a88-3c089406603b","resolution":{"observed_at":"2026-08-11T16:45:45.334384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.319771Z","title":null,"venue":null,"work_id":"30fcf1f2-3f6c-43d9-b670-63b5bbe0febe","year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.809370Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:595bd1b4c8f74d5c3875aece1bad3a9a6c3c8c61a5845898648a843906112f87","observation_id":"56a4b260-275a-45f5-b687-9d6ec4439724","resolution":{"observed_at":"2026-08-11T16:45:45.323492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.812686Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.812686Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:9aa0a44501342231f8ecf25fdbd0d44369143f8f30c366c8245b6b7c485e963b","observation_id":"83f60d85-ae1a-43ce-bfa9-083fdd2e72ff","resolution":{"observed_at":"2026-08-11T16:45:44.812686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T16:45:44.816068Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.816068Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2a634175d843f46dd49b3e2c3d798db089318919325ff80349a4eba4c64de8e5","observation_id":"e68e8702-e122-46c0-9500-451de0b6bcb1","resolution":{"observed_at":"2026-08-11T16:45:44.816068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.819685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.819685Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2c05d9bc4eebc3a0fda36a99f872f9df37d94b5db6c48cfcf592f3eb5de10e8f","observation_id":"f8382428-2d73-451c-8dae-0309364dc75c","resolution":{"observed_at":"2026-08-11T16:45:44.819685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.823310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.823310Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:b6931e59fafe803ddb9e278c92b0e3617a70ff7de260f3bf631569dbed2e8ad5","observation_id":"f71c19a6-29b3-4554-89fa-06a4eb34e964","resolution":{"observed_at":"2026-08-11T16:45:44.823310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.286691Z","title":null,"venue":null,"work_id":"726f5f6f-879a-4e33-a630-b48c0e891054","year":2022},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.826541Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:692a92fb841b702651b1e752af59c5f7925f283682141e9bfdab69b08b071940","observation_id":"fc69dfbd-bff1-487c-adec-93489945bde8","resolution":{"observed_at":"2026-08-11T16:45:45.290479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20441","last_updated":"2024-10-31T03:34:33Z","snapshot_observed_at":"2026-07-31T07:01:24.766432Z","submitted_at":"2024-09-30T16:00:34Z","title":"Instance-adaptive Zero-shot Chain-of-Thought Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20441","snapshot_observed_at":"2026-08-11T16:45:44.830014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.830014Z"},"links":{"cited_paper":"/paper/2409.20441","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:5c8c1fa3d390d2263db1ccd88003624f2d4e1b7c0f4368bbc63eb8c667f1cbc8","observation_id":"1b992b59-3a11-4214-8781-0888aec3cbb7","resolution":{"observed_at":"2026-08-11T16:45:44.830014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-03T02:27:58.110775Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-11T16:45:44.833743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.833743Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:d5d8a0938cb388fe2aa04e788b8683f73cf168dcd55963d62c63bddbda89fce0","observation_id":"c2a20de0-3f71-458b-b134-5d1d6262bc07","resolution":{"observed_at":"2026-08-11T16:45:44.833743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.275349Z","title":null,"venue":null,"work_id":"e619a293-9bab-4876-9115-0f3eef6363b2","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.837610Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:3c250c41e3ed86a88956cfe0537d75bb91f917424792766956e6946dbaf46fb2","observation_id":"5afc7bfb-70f5-45c0-86c0-7b265c26c9ad","resolution":{"observed_at":"2026-08-11T16:45:45.279234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:44.840954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.840954Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:7731f40fc7d4f2b04efcc91bb2427bbe64130e59659a5d4a1ed080ac9a37b5de","observation_id":"0695b377-4d15-41ff-9a21-6d63b07ac2d6","resolution":{"observed_at":"2026-08-11T16:45:44.840954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-07T09:15:02.322742Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-11T16:45:44.844437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.844437Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:05c6588acb6b5b08506d1255b3277ca400696636b46fb76685086130a77181e8","observation_id":"a995798a-d4f3-4859-90c3-06a9585b31c1","resolution":{"observed_at":"2026-08-11T16:45:44.844437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06579","last_updated":"2024-10-17T01:17:25Z","snapshot_observed_at":"2026-08-10T09:51:05.995018Z","submitted_at":"2024-06-04T13:52:54Z","title":"From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06579","snapshot_observed_at":"2026-08-11T16:45:44.848057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.848057Z"},"links":{"cited_paper":"/paper/2406.06579","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a4ac9812ee5f5f3045872c757d88f178760bacea4ac158b5ef4aa37f41ff5ed8","observation_id":"74983426-dfa4-4d02-85e0-4281e23a878c","resolution":{"observed_at":"2026-08-11T16:45:44.848057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-11T16:45:44.852046Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.852046Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:4503060e73977841ee7aad34d4e295b139547cd85a16b2c9ecaa94af97d46e46","observation_id":"47904241-94ad-457a-85e9-7447f8ee7bd7","resolution":{"observed_at":"2026-08-11T16:45:44.852046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.257268Z","title":null,"venue":null,"work_id":"679d2bb7-2905-4556-94d6-ee927670968e","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.856179Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:73492ea10d6e88cfdc959e556d282dd85bdab131510bbbc18bebfb64d6e5360a","observation_id":"46d43404-51d8-4228-9e7c-5db68ea67d8e","resolution":{"observed_at":"2026-08-11T16:45:45.260897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.246027Z","title":null,"venue":null,"work_id":"48ee864e-4c03-475e-b225-5923664f5884","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.859985Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:61c912bcb86d80858fe2f955642b987e836274fde6c4e3bed5accb4e6a73af9e","observation_id":"6ea5cc41-ee29-46f1-ba0f-10ee75153277","resolution":{"observed_at":"2026-08-11T16:45:45.249757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.234798Z","title":null,"venue":null,"work_id":"98877177-2425-4dc6-9673-71aa5997960e","year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.863687Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:fb2a4d7c9b3f9afb1eccde5299f59ea7044fcc9b5211bcef7db7f4f5db427dbd","observation_id":"c4bba911-bde8-4b85-a860-85edb8eeb5a4","resolution":{"observed_at":"2026-08-11T16:45:45.238750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:45:45.222455Z","title":null,"venue":null,"work_id":"351fbf09-7191-4522-82a0-35170e92b707","year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.867315Z"},"links":{"citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:bc4e91ff6e678b1fd280a22986918541dbf31382e2ee5c1f7055bd03a639034d","observation_id":"3478655e-384c-403c-8842-4eb1ba3418d7","resolution":{"observed_at":"2026-08-11T16:45:45.227225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T16:45:44.870849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.870849Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2ebd9a5d35090991e2cb41454515514b274456acd14e092c45febb7b401ec7e6","observation_id":"29ae8978-1afd-4aa4-9e5f-a58527ee7e6d","resolution":{"observed_at":"2026-08-11T16:45:44.870849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2412.09817."}