{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df85b8c4aeb90f7d1f12fb142c4da6c540d3d3ff6041cd0dfb9310c52cdb1184","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1869,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:17:53.872394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:367ca56f8ceafb31b773140985c224b3144a287c5ddd674f3054f6ad1ccb5240","observation_id":"fe585dc7-9c0b-4d92-9e1e-a4bd2b0b919e","resolution":{"observed_at":"2026-05-23T00:22:18.787000Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:11.548885Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2505.17012"},"observation_digest":"sha256:3a748d0c2bf19984a27e984ec225d20ed2ff8d3d3b65275e6cefbd5dc15ac61d","observation_id":"ab1d400d-5dc2-4de9-9379-10855b88bb59","resolution":{"observed_at":"2026-05-22T13:11:35.674800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2505.19662","last_updated":"2026-06-07T05:49:00Z","snapshot_observed_at":"2026-08-01T14:27:47.969573Z","submitted_at":"2025-05-26T08:21:46Z","title":"FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T14:36:30.827705Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2505.19662"},"observation_digest":"sha256:538fb2dada2657f4cccabea24d16e7d884377fea4a7e0cf44455171ee4f8768d","observation_id":"bbd98ed3-fe46-4315-93c2-261e898b1235","resolution":{"observed_at":"2026-05-19T14:37:35.792455Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T04:17:53.872394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10912","last_updated":"2026-06-02T18:21:07Z","snapshot_observed_at":"2026-08-07T04:11:40.527786Z","submitted_at":"2025-06-12T17:25:53Z","title":"Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:53.872394Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2506.10912"},"observation_digest":"sha256:ff3a30cab5b4779e7b588ce57fad62e0889a269b4e41b1ca86e9da6cf279d30c","observation_id":"bd703d6e-3bec-4583-9014-7a79ec11f3e2","resolution":{"observed_at":"2026-08-07T04:17:53.872394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T23:57:21.126418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-06T23:49:22.433306Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.126418Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:7c8bb189a02aceaaa99d0ee7f5c42b2fcda780bb1e684301c925297b79af3754","observation_id":"e3e94efc-dcf7-41d6-a470-493466e02992","resolution":{"observed_at":"2026-08-06T23:57:21.126418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T04:27:04.607470Z","title":"arXiv preprint arXiv:2511.21631 (2025) 14","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03480","last_updated":"2025-08-05T14:13:31Z","snapshot_observed_at":"2026-08-06T13:04:55.199550Z","submitted_at":"2025-08-05T14:13:31Z","title":"VideoGuard: Protecting Video Content from Unauthorized Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:27:04.607470Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2508.03480"},"observation_digest":"sha256:e692dc6f7af44284d38c549623ac475f2798f669374553d671d02be374ada40a","observation_id":"1cab8f1d-c5f0-4b28-9d7b-118e6deff237","resolution":{"observed_at":"2026-08-06T04:27:04.607470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2511.18203","last_updated":"2026-06-05T20:18:33Z","snapshot_observed_at":"2026-08-03T20:53:27.827269Z","submitted_at":"2025-11-22T22:25:11Z","title":"SkillWrapper: Generative Predicate Invention for Task-level Robot Planning","version":6},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T05:43:56.774051Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2511.18203"},"observation_digest":"sha256:3e5a83ad6c68b2a8c6dc9b1540e12b26f733cf46795e93fae999b2cd5c1d60a2","observation_id":"cfae5e5e-4b17-4f63-898a-c6606e079d79","resolution":{"observed_at":"2026-05-17T05:44:07.201529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T20:53:33.614695Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18203","last_updated":"2026-06-05T20:18:33Z","snapshot_observed_at":"2026-08-03T20:53:27.827269Z","submitted_at":"2025-11-22T22:25:11Z","title":"SkillWrapper: Generative Predicate Invention for Task-level Robot Planning","version":7},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T20:53:33.614695Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2511.18203"},"observation_digest":"sha256:62ac9cc766dce3bf464f9452f9005729b1bf48cc342df19bd5c2ab5e6028097a","observation_id":"05b71cb1-b3c3-4e6b-8538-f15b051ac6e4","resolution":{"observed_at":"2026-08-03T20:53:33.614695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:d8fa0b6f1727acb345ce97c0a0628b915ca1b8c5e55529f89c254db35ea30a6c","observation_id":"39d336c0-c180-46fc-b34b-2885586ebb50","resolution":{"observed_at":"2026-05-17T02:11:26.492650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.03666","last_updated":"2026-04-04T05:41:47Z","snapshot_observed_at":"2026-08-02T08:47:15.090577Z","submitted_at":"2025-12-03T10:54:44Z","title":"ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T02:50:17.955287Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.03666"},"observation_digest":"sha256:c05c512fa53e75bf7f44ffe23bb7ed9635f3ec7cf9eb04d3ada8bd67e720ba3a","observation_id":"13e34751-035f-4fb0-9e60-2f3c880588ff","resolution":{"observed_at":"2026-05-17T02:51:28.038076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.04585","last_updated":"2026-04-16T07:12:40Z","snapshot_observed_at":"2026-07-06T22:37:45.947333Z","submitted_at":"2025-12-04T09:00:25Z","title":"SAM3-I: Segment Anything with Instructions","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T02:06:35.864921Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.04585"},"observation_digest":"sha256:665f48b72ab95a2c70e2aed98f355af2cac0d3860338999ad2b86fe1b6c80602","observation_id":"3f6a00a5-566b-4481-bf30-9f350e0fc805","resolution":{"observed_at":"2026-05-17T02:08:51.399219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T18:15:04.635320Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.635320Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:5d17ce77f27d5bfcb14a53c6989d2521450c498f1e38958f2030081b4821af5d","observation_id":"967822dd-61a2-4198-9923-dc5f5a705185","resolution":{"observed_at":"2026-08-03T18:15:04.635320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-07-06T22:38:45.907386Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:fb714f7c4d4f764ae432590b1c3622d41b8f37337380d060e7b577b62da37df2","observation_id":"03c856b0-d022-46bb-9ac0-9359badea614","resolution":{"observed_at":"2026-05-16T22:58:38.598410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.15977","last_updated":"2026-05-11T17:29:44Z","snapshot_observed_at":"2026-07-06T22:39:23.633419Z","submitted_at":"2025-12-17T21:22:44Z","title":"Are vision-language models ready to zero-shot replace supervised classification models in agriculture?","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-16T21:15:20.717705Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.15977"},"observation_digest":"sha256:a632bc572b871930aba93e3c6783d610af9193403fc0dbfac408b1e2b9dfe1dc","observation_id":"1c1e00cf-e3de-43f1-b1ac-6a77a874954d","resolution":{"observed_at":"2026-05-16T21:18:32.173903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.22519","last_updated":"2026-04-24T04:40:53Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-27T08:31:25Z","title":"Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T19:28:35.576661Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.22519"},"observation_digest":"sha256:4a30a56ad87defd71ab636b01143dd0ffd3ca8b42a1f6cbb00d18c3556aad0fb","observation_id":"16b730f1-8fb9-4e40-9ae2-c3da6938de0b","resolution":{"observed_at":"2026-05-16T19:31:13.416234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2512.22799","last_updated":"2026-04-14T01:38:15Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-28T06:12:28Z","title":"VPTracker: Global Vision-Language Tracking via Visual Prompt","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T19:02:27.777162Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.22799"},"observation_digest":"sha256:c7d9ef4a373a03473d032551714e3f340d800ea1ce33df111816990485e67fcc","observation_id":"2543ab7f-c882-41ff-a549-10703700eb72","resolution":{"observed_at":"2026-05-16T19:03:18.733192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.00264","last_updated":"2026-05-06T07:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-01T08:54:51Z","title":"S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T18:16:45.825451Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.00264"},"observation_digest":"sha256:ff9f4a84bacc1efe6014caf81a60853dba97b8ad9846354a6a5fc15e2f3d0e28","observation_id":"3bcc6ae7-329c-4345-af8c-2fd4eca81b51","resolution":{"observed_at":"2026-05-16T18:18:14.439263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T12:30:33.737643Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.737643Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:3466d13501172f7db2f2ca8d38e0e01362a1d433f0223a5a8da3da2034f130d5","observation_id":"e4b9d45e-f926-478d-a5e4-eac5d5258435","resolution":{"observed_at":"2026-08-03T12:30:33.737643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T11:25:36.210179Z","title":"Renée Baillargeon, Elizabeth S Spelke, and Stanley Wasserman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-06T08:25:18.657667Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.210179Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:eeb5c35adb31c63b5b44d9c76e481ed6a2ea1b333fa48d328699608dd09e7ec9","observation_id":"768ad5cf-84db-4e70-a90b-7928f392fe03","resolution":{"observed_at":"2026-08-03T11:25:36.210179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.06931","last_updated":"2026-04-20T10:53:42Z","snapshot_observed_at":"2026-07-24T23:19:23.281462Z","submitted_at":"2026-01-11T14:35:06Z","title":"Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T14:56:15.554554Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.06931"},"observation_digest":"sha256:827a87197734ab1c3c239aa48d017cb9adfa09d1f912055d8ed62b1a9070225a","observation_id":"357b5972-8863-4e53-870b-80c51b8ac1b2","resolution":{"observed_at":"2026-05-16T14:58:01.128329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:104aaf98aef79c4a443867a74a459d07e8100d17fb612d42fbcf3bd13fc18060","observation_id":"1142b4bd-0af4-493e-b6ee-7302f29b8ab7","resolution":{"observed_at":"2026-05-14T19:12:24.675756Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T10:49:58.837335Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08758","last_updated":"2026-06-29T18:48:00Z","snapshot_observed_at":"2026-08-06T02:33:07.002390Z","submitted_at":"2026-01-13T17:42:27Z","title":"M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:49:58.837335Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.08758"},"observation_digest":"sha256:c596838aa04ae9cdd9bade35138c91c5d7e2da1ec65c64410b1702a5fe481f71","observation_id":"223de39f-6967-4380-9bab-bf6031f185b8","resolution":{"observed_at":"2026-08-03T10:49:58.837335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:33aa184f391e64354dd997e1a3ed4f3c2fa35b0d0591bbe3a73b7850f640a307","observation_id":"233866a4-1b1a-4365-a3c8-527afeb6e726","resolution":{"observed_at":"2026-05-16T04:21:29.723925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.13606","last_updated":"2026-04-29T05:49:25Z","snapshot_observed_at":"2026-07-06T22:42:12.887517Z","submitted_at":"2026-01-20T05:11:44Z","title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:12:01.889341Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.13606"},"observation_digest":"sha256:1465f0fa6cb8226acef6a8efcce0734a90645c69455c090f19adfb52ad6a3da6","observation_id":"36d7964a-70ea-467d-975f-6f9dc0137e63","resolution":{"observed_at":"2026-05-16T13:12:54.854639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T09:29:58.420522Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-06T09:56:34.953833Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:29:58.420522Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:ae47484964712715b0f934ca9669ac6af456078fb762c7078ae8d3ea9a333f19","observation_id":"b9b5dc81-54ec-4d9e-8b4a-050b10c77247","resolution":{"observed_at":"2026-08-03T09:29:58.420522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:a04f67b5c00b78df2fee547b4da29cf9ba09c043137c736eeef82edaafa82574","observation_id":"70df9ede-de91-42c0-a414-7f8b96845227","resolution":{"observed_at":"2026-05-16T12:57:53.908356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.15550","last_updated":"2026-04-14T22:00:13Z","snapshot_observed_at":"2026-07-06T22:42:36.961014Z","submitted_at":"2026-01-22T00:44:26Z","title":"Common to Whom? Regional Cultural Commonsense and LLM Bias in India","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:37:25.252161Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.15550"},"observation_digest":"sha256:386f226929ffdd4f4baf09d409e63f56ca528a5e10a3fdd86afd69df0a0d8c53","observation_id":"80dce210-42de-4b05-a844-e28ab1cab5b6","resolution":{"observed_at":"2026-05-16T12:37:52.899451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T08:29:47.265364Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17151","last_updated":"2026-07-29T22:14:05Z","snapshot_observed_at":"2026-08-06T15:22:04.057661Z","submitted_at":"2026-01-23T20:14:21Z","title":"Scaling medical imaging report generation with multimodal reinforcement learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T08:29:47.265364Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.17151"},"observation_digest":"sha256:598073c500815cd36f283a7b9b487b5343ed86254a75025bbb18c4d1e7fc090c","observation_id":"d27e6d48-5024-4215-9ff5-7be6ff71a249","resolution":{"observed_at":"2026-08-03T08:29:47.265364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.18842","last_updated":"2026-05-13T07:11:36Z","snapshot_observed_at":"2026-08-01T18:25:13.403669Z","submitted_at":"2026-01-26T11:33:40Z","title":"GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents","version":3},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-16T11:31:16.087579Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.18842"},"observation_digest":"sha256:ea01248cee40a567a98876e190bf629957201e1ac6557ef9cbc8af9d0fff0c9d","observation_id":"03c9571d-0916-4217-badf-cdd4652565bc","resolution":{"observed_at":"2026-05-16T11:32:48.303676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.19640","last_updated":"2026-04-08T15:46:26Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T14:17:04Z","title":"Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T11:03:37.176829Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.19640"},"observation_digest":"sha256:8e2dfe13f726f16966d4ea81602d37c7f935facef6759984625a5e0fcb7c73ed","observation_id":"73410ca9-f773-4739-bc2d-a4c91508ac2f","resolution":{"observed_at":"2026-05-16T11:07:48.358867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T09:07:00.904794Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.20540"},"observation_digest":"sha256:6743a519e1e2302a4f9428ec20b24752b77510810b527fb1d9b347cc887b74da","observation_id":"b53df7da-44a1-4b47-b9e5-bb76d9e6d7ea","resolution":{"observed_at":"2026-05-16T09:07:01.026530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.21262","last_updated":"2026-04-16T06:59:30Z","snapshot_observed_at":"2026-07-29T16:09:50.031781Z","submitted_at":"2026-01-29T04:47:27Z","title":"CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T10:14:15.589472Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.21262"},"observation_digest":"sha256:721ada4ee10fbda02869f723ebb5601533d3841e869059562906257d02dac6ff","observation_id":"cc8683e6-e8bd-4cbc-8c80-c31113ec594e","resolution":{"observed_at":"2026-05-16T10:17:44.704604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T07:03:11.740274Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T07:03:11.740274Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.21406"},"observation_digest":"sha256:880a0e838689f552487ee0bcc89990e3bd02cabd07f71c3ce99eb4ab980fa73d","observation_id":"79ac3723-2a3c-4df7-80b3-aeb7e722c2a1","resolution":{"observed_at":"2026-08-03T07:03:11.740274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.21692","last_updated":"2026-05-22T01:46:45Z","snapshot_observed_at":"2026-08-02T10:02:20.704165Z","submitted_at":"2026-01-29T13:26:29Z","title":"TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T07:33:15.865358Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.21692"},"observation_digest":"sha256:4e8da68662be82524c07bca5b9add2aff18fc4dd7880f12af3c7f3a3794d8799","observation_id":"09b98cdc-1397-4b82-adef-3997f6b400fc","resolution":{"observed_at":"2026-05-25T07:35:28.715407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:530ebdfd57e65815da383b6925c5b1e039443c00f697a39aca7d35b10fe68059","observation_id":"9f433c2c-a656-463c-9866-010787960c87","resolution":{"observed_at":"2026-05-21T14:50:14.733038Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T06:36:31.646881Z","title":"org/abs/2511.21631","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-05T03:41:49.406487Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.646881Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:a3b3c2709739dbc1254c0d81790702299c113720b3d2c3a1742da70454eed3cb","observation_id":"11aa3de7-df12-4be4-9338-347592404301","resolution":{"observed_at":"2026-08-03T06:36:31.646881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:b3882d92f496d66407708029823878db00bd130c0bd8e413044a65a2cf7deef9","observation_id":"0c31f05b-b385-42da-a432-c1498d167a03","resolution":{"observed_at":"2026-05-16T10:02:42.459666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T06:04:50.189057Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.00471","last_updated":"2026-06-05T06:11:46Z","snapshot_observed_at":"2026-08-03T06:04:48.314183Z","submitted_at":"2026-01-31T02:49:10Z","title":"Dual Latent Memory for Visual Multi-agent System","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:04:50.189057Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.00471"},"observation_digest":"sha256:f86d3359237f3aef1f39ee45694896e44a5983ac021705a2a4d830823c167a9f","observation_id":"fa75d537-19ca-46fb-bce3-4b07da7aca58","resolution":{"observed_at":"2026-08-03T06:04:50.189057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.01785","last_updated":"2026-04-28T16:05:53Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T08:10:21Z","title":"CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:30:50.984873Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.01785"},"observation_digest":"sha256:11ef42549fe91bac5e9bf38f4676c65a6d85fb26f85083e6d7c55210220450c4","observation_id":"5943ccf5-4882-4409-bf94-b3a63ff65977","resolution":{"observed_at":"2026-05-16T08:32:36.542385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T05:29:27.189984Z","title":"Qwen3-vl technical report, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.189984Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:132a19a73b67960b313196b70318a75ca429e02a50ef99aee3f9e06039ffa9a5","observation_id":"da3fd933-8924-4d36-93e0-bd608cfddeef","resolution":{"observed_at":"2026-08-03T05:29:27.189984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T05:29:03.479558Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02220","last_updated":"2026-05-29T14:23:41Z","snapshot_observed_at":"2026-08-05T19:24:48.930060Z","submitted_at":"2026-02-02T15:26:19Z","title":"LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:03.479558Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.02220"},"observation_digest":"sha256:3add31753b55e9313be6cbf99f842214af59a05ae700befd52db7645a5648109","observation_id":"aefbea46-0aa4-40a4-84b7-404cf41b371f","resolution":{"observed_at":"2026-08-03T05:29:03.479558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:87ba67147ba9fea6293f26948cca55c588f0a42f45593e5e42404b7728470223","observation_id":"1b798d46-87d2-4ba7-9c74-07b0059f3204","resolution":{"observed_at":"2026-05-10T16:09:05.268836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:84ed6a6453e79ab790337098a312faa30ba0253fd868d9c17a99e641dd69045a","observation_id":"2d0bec1c-6591-4868-9f89-16e07bbc61a3","resolution":{"observed_at":"2026-05-16T08:40:46.405043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T05:14:22.508983Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:22.508983Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:5bd2a998d1dff7fdd6c0595c5706d59d1768d6b8bc12443673dafd6d3fec7382","observation_id":"f4288644-0504-42b7-9442-5a9859579005","resolution":{"observed_at":"2026-08-03T05:14:22.508983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T05:02:40.578669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-03T05:02:37.605380Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.578669Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:92c7a08e2420125b9f6312b878fb0fd35ce8b1647629109844a47403350aaba2","observation_id":"eb666695-a8e2-49f6-a2db-7e3bfd543aac","resolution":{"observed_at":"2026-08-03T05:02:40.578669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T04:37:17.655839Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:17.655839Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:d65bf70660e4cc1ee5f92ab0c745f5c660505b3d065108366d47669accd7cdc2","observation_id":"19b4b2cb-a4cc-4f11-b1b9-f826892306b0","resolution":{"observed_at":"2026-08-03T04:37:17.655839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T04:20:50.269672Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-06T07:33:30.943423Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.269672Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:31a73ed5b7de6e712f13018fe2f07d31725ee9e0bf03c10636380affe3ebd03f","observation_id":"166a2c47-85ae-4c04-906c-9eee29fe86a9","resolution":{"observed_at":"2026-08-03T04:20:50.269672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.05467","last_updated":"2026-04-12T10:59:16Z","snapshot_observed_at":"2026-08-06T13:35:50.387256Z","submitted_at":"2026-02-05T09:15:34Z","title":"MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:24:11.276711Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.05467"},"observation_digest":"sha256:095b6ae015f77d819a1f70546d359c2177953cd7d873c2bcf7487eac55a4b330","observation_id":"4b9e2f50-5aff-4032-a80d-7fb7772c10d2","resolution":{"observed_at":"2026-05-16T07:27:31.674384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T03:56:47.134762Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06508","last_updated":"2026-05-25T03:56:37Z","snapshot_observed_at":"2026-08-03T03:56:46.452714Z","submitted_at":"2026-02-06T08:57:55Z","title":"World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:56:47.134762Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.06508"},"observation_digest":"sha256:514b7232541e741dcb5394a37bfb036195516ccace1fd970548505b552d7d137","observation_id":"f6b0e7ea-2f1a-4be9-9163-f1c090d9150d","resolution":{"observed_at":"2026-08-03T03:56:47.134762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-03T13:22:02.057620Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:7cd6490053d970208cb3d58bd4245b30785dc67d980c03682c177255d0245fb9","observation_id":"990ac962-f728-465b-a11b-9560849c980d","resolution":{"observed_at":"2026-05-16T07:10:43.127503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T03:37:50.165649Z","title":"Christiano, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07533","last_updated":"2026-06-26T15:22:02Z","snapshot_observed_at":"2026-08-03T03:37:49.338075Z","submitted_at":"2026-02-07T13:09:41Z","title":"Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.165649Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.07533"},"observation_digest":"sha256:c9a956ed2cc2430e5b6cedafff8f0b03d6a0aa27a2827e4001184471e9067ce0","observation_id":"469223d4-0eed-45ea-a6ec-f883a1df4cc4","resolution":{"observed_at":"2026-08-03T03:37:50.165649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.08167","last_updated":"2026-05-16T05:42:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-09T00:10:17Z","title":"Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T14:03:48.795572Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.08167"},"observation_digest":"sha256:8b49f624191ebd7b45085b3cbda25e51b274b5dad853ce97c1e8e57785731313","observation_id":"495d751b-5049-4590-a6ed-885cc8edab04","resolution":{"observed_at":"2026-05-21T14:04:11.944041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T03:22:55.371524Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-03T03:22:52.672693Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:22:55.371524Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.08426"},"observation_digest":"sha256:75ae193a3cdaf6820f2fecf726ce1f0f33baec7c3ae6972c3a82288bdd38100f","observation_id":"a2fd6f15-800d-4fc6-b488-6859a4873b9e","resolution":{"observed_at":"2026-08-03T03:22:55.371524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T03:16:09.825495Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08792","last_updated":"2026-07-23T08:45:30Z","snapshot_observed_at":"2026-08-05T18:43:36.895095Z","submitted_at":"2026-02-09T15:29:19Z","title":"Multimodal Learning for Arcing Detection in Pantograph-Catenary Systems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:16:09.825495Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.08792"},"observation_digest":"sha256:ca17389a33c9c18280f4da46e655a77d0c9eb7ad0ca45cb5385ddb172672748a","observation_id":"c8e65144-6508-45a3-8d93-4f6280a36fd6","resolution":{"observed_at":"2026-08-03T03:16:09.825495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T03:08:29.381598Z","title":"Anthropic","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09012","last_updated":"2026-06-21T08:25:39Z","snapshot_observed_at":"2026-08-06T19:32:59.874369Z","submitted_at":"2026-02-09T18:55:33Z","title":"Next-Gen CAPTCHAs: Leveraging the Cognitive Gap for Scalable and Diverse GUI-Agent Defense","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:08:29.381598Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.09012"},"observation_digest":"sha256:97b67533aad74fc72fd73c7fde4a396f91f13198a817d178c2d94490e9e91429","observation_id":"f615c7e5-4e8c-4516-9c83-bc1fd9a19778","resolution":{"observed_at":"2026-08-03T03:08:29.381598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.09850","last_updated":"2026-05-08T01:43:02Z","snapshot_observed_at":"2026-08-02T13:38:36.392657Z","submitted_at":"2026-02-10T14:54:17Z","title":"Towards Explainable Industrial Anomaly Detection via Knowledge-Guided Latent Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T03:08:58.617137Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.09850"},"observation_digest":"sha256:a4ca7469462122edb6a21829e9068eadd4bf2c2b9c43632bd3112ab89d2d03cb","observation_id":"11cf1db0-9ef5-4f1f-bdd8-01bb1507c1c8","resolution":{"observed_at":"2026-05-16T03:10:31.981569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T01:02:32.574737Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-05T12:06:47.375443Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.574737Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:124459fe224c66d335fac87c230ffc97d339461ff038a85d28415baf7f6b95e1","observation_id":"b349e52a-5994-4ac3-97de-6beed00b7849","resolution":{"observed_at":"2026-08-03T01:02:32.574737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.11146","last_updated":"2026-05-22T14:43:10Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T18:57:29Z","title":"Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T06:41:33.493927Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.11146"},"observation_digest":"sha256:ed970af36b90044b5a1c0b232b8296910ff04d93f22db44358a002baa9680bfd","observation_id":"04a2e567-54f6-4f53-8fbd-1f3c19c7cee5","resolution":{"observed_at":"2026-05-25T06:45:26.198129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T03:11:52.645633Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.11236"},"observation_digest":"sha256:6908ff59bcc357c421c4cb72ad7abc92dbf600933e3f65d52b78b4642cddf77d","observation_id":"2388e3c1-f114-4da2-bc4e-ac6bc6ea63b6","resolution":{"observed_at":"2026-05-16T03:12:11.842647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T23:59:12.875366Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12155","last_updated":"2026-06-29T06:08:55Z","snapshot_observed_at":"2026-08-04T12:11:40.185011Z","submitted_at":"2026-02-12T16:36:33Z","title":"FAIL: Flow Matching Adversarial Imitation Learning for Image Generation","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-02T23:59:12.875366Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.12155"},"observation_digest":"sha256:8bc66cd5704deb834024873976f1630862f7803f4098c72a163ea31a4c8794f4","observation_id":"3ed0c257-6fec-4467-b33e-a268a69c9105","resolution":{"observed_at":"2026-08-02T23:59:12.875366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T23:49:54.782056Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12564","last_updated":"2026-07-22T08:22:17Z","snapshot_observed_at":"2026-08-06T19:29:18.040182Z","submitted_at":"2026-02-13T03:23:12Z","title":"CAPTS: Channel-Aware, Preference-Aligned Trigger Selection for Multi-Channel Item-to-Item Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:54.782056Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.12564"},"observation_digest":"sha256:39a897063d16a9d282353c4d62980e9fb04e8ebbb2746a412b2e7fd30cbce476","observation_id":"4a0c099a-dbb6-4ba8-b96f-722ebc087593","resolution":{"observed_at":"2026-08-02T23:49:54.782056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.12941","last_updated":"2026-05-07T10:12:01Z","snapshot_observed_at":"2026-07-06T22:45:49.118915Z","submitted_at":"2026-02-13T13:57:45Z","title":"JARVIS: An Evidence-Grounded Retrieval System for Interpretable Deceptive Reviews Adjudication","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T22:31:09.746554Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.12941"},"observation_digest":"sha256:263af18caf644150b205f11d7bbb519190d323ef4d1b5c1c3ebeb52d881ae809","observation_id":"4a9581ac-5a48-441e-a833-0c63b98d7c91","resolution":{"observed_at":"2026-05-15T22:31:43.758096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T23:44:34.956040Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12957","last_updated":"2026-06-29T06:43:50Z","snapshot_observed_at":"2026-08-04T00:07:49.527953Z","submitted_at":"2026-02-13T14:22:10Z","title":"HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T23:44:34.956040Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.12957"},"observation_digest":"sha256:1258fc949f4ddf3b0a428d56511c386aedf135ceed9e1b255eed8e26d5156b7e","observation_id":"f705114d-687f-4cf4-96ac-5af4d77ad5a5","resolution":{"observed_at":"2026-08-02T23:44:34.956040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.13310","last_updated":"2026-05-07T08:00:36Z","snapshot_observed_at":"2026-08-03T02:11:51.693223Z","submitted_at":"2026-02-10T03:53:25Z","title":"Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:53.694506Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.13310"},"observation_digest":"sha256:e3ebe73874728e919dd45b2565ccf28df7dcd4bea1d1d11d06710d9495bc75ce","observation_id":"792637b8-b22c-4e0e-93d8-fe3dff08b3d3","resolution":{"observed_at":"2026-05-16T03:30:33.088129Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T23:33:14.940131Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.13600","last_updated":"2026-05-28T03:40:51Z","snapshot_observed_at":"2026-08-02T23:33:13.904850Z","submitted_at":"2026-02-14T04:44:37Z","title":"SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T23:33:14.940131Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.13600"},"observation_digest":"sha256:7fbf59b0f328bc479b19a3bbd891142b0982073934f1d541baca3895edc9bc83","observation_id":"e4382789-4f06-4374-8035-9c43e06223f3","resolution":{"observed_at":"2026-08-02T23:33:14.940131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.14183","last_updated":"2026-05-10T02:57:23Z","snapshot_observed_at":"2026-07-06T22:45:58.457005Z","submitted_at":"2026-02-15T15:14:27Z","title":"Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art Activity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T22:10:37.970689Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.14183"},"observation_digest":"sha256:98a23138fd6ffdb05a860cdd59d3cb8a8b2c43eacefda2d2d59fa78ff70ad979","observation_id":"37eea6c8-c8d5-484a-95ef-ad0a1a6522ae","resolution":{"observed_at":"2026-05-15T22:11:42.404880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.14276","last_updated":"2026-05-01T17:32:06Z","snapshot_observed_at":"2026-07-06T22:45:58.457005Z","submitted_at":"2026-02-15T19:00:02Z","title":"ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.14276"},"observation_digest":"sha256:ccfe41a2570c6ca4bf73934346324bf69dc2d67a3aeff0aa1ca1ea8be9208ee9","observation_id":"f52e3b97-deae-46e5-a889-34adbc6bf5cf","resolution":{"observed_at":"2026-05-15T21:36:40.000612Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T22:58:04.174651Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15382","last_updated":"2026-05-28T08:46:27Z","snapshot_observed_at":"2026-08-03T23:19:36.572742Z","submitted_at":"2026-02-17T06:31:53Z","title":"The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T22:58:04.174651Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.15382"},"observation_digest":"sha256:51e1e6459fa2cbf70646ce53460a16fc1e117d8633d7c484772b377e25e7b8c6","observation_id":"aa6a7a59-a574-48e1-acbc-c67ed29039cc","resolution":{"observed_at":"2026-08-02T22:58:04.174651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T22:27:40.232320Z","title":"Qwen3-vl technical report, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16872","last_updated":"2026-05-27T14:51:57Z","snapshot_observed_at":"2026-08-05T10:58:01.074882Z","submitted_at":"2026-02-18T20:59:22Z","title":"DODO: Discrete OCR Diffusion Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T22:27:40.232320Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.16872"},"observation_digest":"sha256:c23eaf52d74e7ac6183656323aaa0ee4ff1b294ff404a498954ef2dc1de3e6b5","observation_id":"69d5d5c3-7316-4d86-b69b-d048f96e6ada","resolution":{"observed_at":"2026-08-02T22:27:40.232320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T22:08:39.292349Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-06T08:47:40.893793Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.292349Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:56198488e956c69a6f797ec4ca00e9131d019135200dcc3db6922805e14be6ce","observation_id":"66a0e07c-dd83-4b94-9929-b405c103bbd6","resolution":{"observed_at":"2026-08-02T22:08:39.292349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:3572d4a2f37cc56af1df385ef01892dc2be14b901229273a28a09c53adb40354","observation_id":"b2529d4c-c5b3-4386-af60-45f20360ac71","resolution":{"observed_at":"2026-05-21T13:00:09.843841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T21:47:00.159441Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-02T21:46:59.562400Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.159441Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:13d3c091330b77a0b4e8c9008cf3024b078b640584c63d7dc568cd42bf1e421a","observation_id":"4a1d9cd5-0a6d-4593-9242-8ac4b7c4089f","resolution":{"observed_at":"2026-08-02T21:47:00.159441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T21:43:06.921012Z","title":"Baumli, K., Baveja, S., Behbahani, F., Chan, H., Comanici, G., Flennerhag, S., Gazeau, M., Holsheimer, K., Horgan, D., Laskin, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19313","last_updated":"2026-07-22T22:14:13Z","snapshot_observed_at":"2026-08-02T21:43:05.758047Z","submitted_at":"2026-02-22T19:25:48Z","title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:43:06.921012Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.19313"},"observation_digest":"sha256:676a2b105812647ff70bba948359b5618754b19da804719dc5917cca9d8f100f","observation_id":"06d9cbd1-2ac9-4d59-a461-e906f25cf304","resolution":{"observed_at":"2026-08-02T21:43:06.921012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.19549","last_updated":"2026-04-20T01:43:08Z","snapshot_observed_at":"2026-07-06T22:46:45.213871Z","submitted_at":"2026-02-23T06:45:19Z","title":"Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:06.005832Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.19549"},"observation_digest":"sha256:8e5b6062020d30da2d3ccfc6a0c9b51f985320dd6c2745c3bb5b3f86a13dc735","observation_id":"43ab2a23-547a-4dd6-b6d7-5893326c027a","resolution":{"observed_at":"2026-05-15T20:56:37.029054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.20323","last_updated":"2026-05-03T05:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T20:18:35Z","title":"PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T20:05:30.324309Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.20323"},"observation_digest":"sha256:29c92e3b9267d411e2198474345a8d37961036587a63a077ce3bf7286f1f7995","observation_id":"3c42f98b-5a6c-4c41-b741-1c377628af9f","resolution":{"observed_at":"2026-05-15T20:06:33.818788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T20:59:24.170775Z","title":"Brandon, W., Nrusimha, A., Qian, K., Ankner, Z., Jin, T., Song, Z., and Ragan-Kelley, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21788","last_updated":"2026-06-08T12:37:51Z","snapshot_observed_at":"2026-08-02T20:59:23.294747Z","submitted_at":"2026-02-25T11:11:53Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:59:24.170775Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.21788"},"observation_digest":"sha256:c2b9f4f93369b3d01b68a5528203277339209c2fd3ff98a95b873fdbbbf560ce","observation_id":"a2e33ca8-ac2a-465d-8ccf-3a79d0f16854","resolution":{"observed_at":"2026-08-02T20:59:24.170775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T20:51:40.372101Z","title":"Qwen3-vl technical report, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22190","last_updated":"2026-05-25T21:32:44Z","snapshot_observed_at":"2026-08-02T20:51:33.578240Z","submitted_at":"2026-02-25T18:34:57Z","title":"GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T20:51:40.372101Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.22190"},"observation_digest":"sha256:a02af45cc024baf82a480ca8199f81586ced2422341ed063ae61f7b313d71526","observation_id":"d7567fb1-0730-4be7-9d34-20a5cd28eb33","resolution":{"observed_at":"2026-08-02T20:51:40.372101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T20:40:29.696203Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-06T01:15:52.220969Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":1971,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:29.696203Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:fe1ca142198dacbecaf4c98e0db000d402f9da33f92571835d075246d7704135","observation_id":"2d4e5937-16ab-44ae-b78b-56bf087e50c2","resolution":{"observed_at":"2026-08-02T20:40:29.696203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T20:38:23.446746Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22809","last_updated":"2026-07-16T09:58:43Z","snapshot_observed_at":"2026-08-06T20:32:37.167622Z","submitted_at":"2026-02-26T09:46:06Z","title":"PhotoAgent: Exploratory Visual Aesthetic Planning with Large Vision Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:38:23.446746Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.22809"},"observation_digest":"sha256:10f47bc8e131f64de6d5ad3f921e948cf7d9dab397aec0d7e27f6cb93b9bd17b","observation_id":"20d0d4a4-2c64-4f7d-8f5d-5fd0ad7a898a","resolution":{"observed_at":"2026-08-02T20:38:23.446746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T20:37:20.863237Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22959","last_updated":"2026-06-18T09:17:08Z","snapshot_observed_at":"2026-08-02T20:37:17.788325Z","submitted_at":"2026-02-26T12:53:50Z","title":"Can Agents Distinguish Visually Hard-to-Separate Diseases in a Zero-Shot Setting? A Pilot Study","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:37:20.863237Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.22959"},"observation_digest":"sha256:6e9a1d030d6107aa20bdd94d386a658b09d17cb2e33c8833c20f89e4531e2a9d","observation_id":"788c4ca7-7e55-40db-bbe8-21b1414254f0","resolution":{"observed_at":"2026-08-02T20:37:20.863237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.23452","last_updated":"2026-05-01T20:05:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-26T19:17:39Z","title":"CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T18:50:13.036260Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.23452"},"observation_digest":"sha256:b2a18f1dfc93851d4b060b3030dafc9338522aab1487240c41611ac2f7362eaf","observation_id":"1fc72b8e-0fd1-4fe6-a8f1-f87eb540b08b","resolution":{"observed_at":"2026-05-15T18:51:30.676601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T19:51:05.718724Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00777","last_updated":"2026-05-24T18:02:18Z","snapshot_observed_at":"2026-08-02T19:51:05.168188Z","submitted_at":"2026-02-28T18:46:45Z","title":"DUCX: Decomposing Unfairness in Tool-Using Chest X-ray Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:51:05.718724Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.00777"},"observation_digest":"sha256:fcb07946c0368cafedb9155acf914718988652d3755367180abeec547fc10953","observation_id":"8376e032-b09c-4640-abc4-20f5a17c8be1","resolution":{"observed_at":"2026-08-02T19:51:05.718724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.00977","last_updated":"2026-05-05T03:37:16Z","snapshot_observed_at":"2026-08-02T14:44:32.701926Z","submitted_at":"2026-03-01T08:09:03Z","title":"HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T18:35:45.900606Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.00977"},"observation_digest":"sha256:009e8b092561d64f8e826423f33f6dcece9e4c010277b25b6b9d813d0210394a","observation_id":"f8d0bc55-c0f5-4958-9db3-140b6651204d","resolution":{"observed_at":"2026-05-15T18:36:28.415729Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T19:46:43.537373Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01121","last_updated":"2026-07-03T08:44:20Z","snapshot_observed_at":"2026-08-07T07:31:54.804586Z","submitted_at":"2026-03-01T14:13:11Z","title":"HVR-Met: A Hypothesis-Verification-Replanning Agentic System for Extreme Weather Diagnosis","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T19:46:43.537373Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.01121"},"observation_digest":"sha256:4360da2c02acfaaaf397b52a7a724830257db0b4de045f6d1a9854dd3068da01","observation_id":"9c1d15f3-2039-474a-8bf9-59d136cf6d44","resolution":{"observed_at":"2026-08-02T19:46:43.537373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T19:35:37.630960Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01766","last_updated":"2026-05-27T06:18:12Z","snapshot_observed_at":"2026-08-03T05:37:00.928605Z","submitted_at":"2026-03-02T11:48:24Z","title":"Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:35:37.630960Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.01766"},"observation_digest":"sha256:3d500e372243bba0c2f053ccda9839a99fb1ca0ed064142b39c3b1df42846d2b","observation_id":"63e9e5d5-987d-4a92-98b3-2e9a28d28df9","resolution":{"observed_at":"2026-08-02T19:35:37.630960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.02115","last_updated":"2026-05-13T21:07:49Z","snapshot_observed_at":"2026-08-01T20:59:07.888539Z","submitted_at":"2026-03-02T17:38:58Z","title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-15T17:59:52.365630Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.02115"},"observation_digest":"sha256:7210b3be629b75c9e426363966c98126e0e57dbf904f2b8319a8085871e0b50b","observation_id":"8bbd1663-c092-4c95-98bc-67fea50770e0","resolution":{"observed_at":"2026-05-15T18:00:12.635655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T19:18:51.740315Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.02803","last_updated":"2026-06-16T07:58:47Z","snapshot_observed_at":"2026-08-02T19:18:51.325853Z","submitted_at":"2026-03-03T09:42:43Z","title":"Structure-Aware Text Recognition for Ancient Greek Critical Editions","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:18:51.740315Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.02803"},"observation_digest":"sha256:17df798d870862d2c5c4c4c43d95949f46d341b82625515df22192d185d38fc8","observation_id":"9c45cfd5-90ea-4e28-aeab-7beb28bdf80a","resolution":{"observed_at":"2026-08-02T19:18:51.740315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:54:55.012353Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.04205","last_updated":"2026-06-22T03:43:39Z","snapshot_observed_at":"2026-08-02T18:54:54.324790Z","submitted_at":"2026-03-04T15:49:06Z","title":"Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:54:55.012353Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.04205"},"observation_digest":"sha256:3d5ac1d2f9de1fb837859f77b901e54f2a9d033f6a6d7569e11e77124e3dadd8","observation_id":"3138430f-9e50-4162-bc2c-2a31fc4172ee","resolution":{"observed_at":"2026-08-02T18:54:55.012353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.04415","last_updated":"2026-05-09T08:44:16Z","snapshot_observed_at":"2026-07-06T22:47:50.848191Z","submitted_at":"2026-02-04T04:13:39Z","title":"Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:25.063204Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.04415"},"observation_digest":"sha256:fb15abc7975dcdcaf88610a9d4459e50a3f39a3bb28e0e7697a613b98ec66275","observation_id":"ae58ab0a-0b3f-43bc-aa63-f1328bccf7e7","resolution":{"observed_at":"2026-05-16T08:12:35.442378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.04676","last_updated":"2026-05-07T20:14:25Z","snapshot_observed_at":"2026-08-06T14:25:55.999897Z","submitted_at":"2026-03-04T23:34:39Z","title":"Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T16:04:58.851378Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.04676"},"observation_digest":"sha256:c54c68658fe9c9a0887a95071ec35c3e18dc1eecb5605b23c76baa05e42d9f97","observation_id":"7d0447e6-8406-4d11-b36f-1a22ab8430f8","resolution":{"observed_at":"2026-05-15T16:06:14.495880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:47:14.582142Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05353","last_updated":"2026-07-16T04:21:11Z","snapshot_observed_at":"2026-08-05T20:13:20.512147Z","submitted_at":"2026-03-05T16:33:20Z","title":"InfoFlow KV: Information-Flow-Aware KV Recomputation for Long Context","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:47:14.582142Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.05353"},"observation_digest":"sha256:e3271880c985a7f552fcbb0aebc4eca45b817cfd4776ae1b342ee947e04bc73d","observation_id":"d676fc0c-0864-4950-91a9-99bdc5bda74a","resolution":{"observed_at":"2026-08-02T18:47:14.582142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.06665","last_updated":"2026-04-10T08:38:35Z","snapshot_observed_at":"2026-07-06T22:48:08.821342Z","submitted_at":"2026-03-02T10:32:44Z","title":"Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T18:32:04.537458Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.06665"},"observation_digest":"sha256:68f5e0b50ef6a90ab0ff1dc0b35deeaeeb90e123e9eee6767e46285d0a4be6ef","observation_id":"8a6e3125-d124-4aa2-a667-d273fd0c59b7","resolution":{"observed_at":"2026-05-15T18:36:29.064109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.07119","last_updated":"2026-05-04T15:27:59Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T09:11:10Z","title":"TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T14:32:59.720416Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.07119"},"observation_digest":"sha256:dc009c2d7e7850c4b9cdf639fed4fb6a69934c04984d4e93770bb20c4e869552","observation_id":"820e71b2-b28c-409d-ae56-37d90b4b6b16","resolution":{"observed_at":"2026-05-15T14:35:55.884850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:40:08.348967Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07131","last_updated":"2026-07-29T14:56:01Z","snapshot_observed_at":"2026-08-02T18:40:06.588167Z","submitted_at":"2026-03-07T09:43:49Z","title":"Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:40:08.348967Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.07131"},"observation_digest":"sha256:4fbdcb23869b69fe5bbd4b9e878007c16bbe18c7d9f1c53d140e1b45590f4d8d","observation_id":"9933e431-8add-448b-b2d0-e385865d2774","resolution":{"observed_at":"2026-08-02T18:40:08.348967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:38:30.711742Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-03T21:25:29.846211Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.711742Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:8d480363c177164face4f42e0ef2a68ef8fdc421175b3b6566ba8d3675d8b4a9","observation_id":"2a75cda4-351e-4679-bacf-f1388c6c5b10","resolution":{"observed_at":"2026-08-02T18:38:30.711742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.08403","last_updated":"2026-05-21T13:59:14Z","snapshot_observed_at":"2026-07-06T22:48:21.803560Z","submitted_at":"2026-03-09T14:00:36Z","title":"SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T11:14:47.943242Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.08403"},"observation_digest":"sha256:62879777a68a3378ae55d9596c94973552366e759f9a373963dd2cdb659bbca3","observation_id":"5b6eefd0-b323-4a6c-8750-cca73fe3d73b","resolution":{"observed_at":"2026-05-22T11:16:27.898882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2603.09677","last_updated":"2026-04-08T07:57:35Z","snapshot_observed_at":"2026-07-06T22:48:30.706783Z","submitted_at":"2026-03-10T13:46:32Z","title":"Logics-Parsing-Omni Technical Report","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T13:37:44.189839Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.09677"},"observation_digest":"sha256:a9f3af5d4747b509db48119f8efca461a0cc0171900130b677c107c471652492","observation_id":"a55b1774-8239-4a4d-b69a-581af614b838","resolution":{"observed_at":"2026-05-15T13:40:01.762091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:31:40.087308Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.09971","last_updated":"2026-07-28T19:12:58Z","snapshot_observed_at":"2026-08-04T15:14:09.655279Z","submitted_at":"2026-03-10T17:59:00Z","title":"TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:31:40.087308Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.09971"},"observation_digest":"sha256:563b0cdd71c41fb53a6fd68b11a3506c5cc7ee3933dc9cb25383b3c0a8626a9f","observation_id":"997b43c7-f9b3-4b20-a73a-413775b14ed4","resolution":{"observed_at":"2026-08-02T18:31:40.087308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:25:51.149194Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-02T18:25:48.658946Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.149194Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:a86e99d3d97533860910108c1916ec0c39af99f887fbd7f44754bf324e42c494","observation_id":"c835e926-ff75-476b-bb2c-d70d00eff150","resolution":{"observed_at":"2026-08-02T18:25:51.149194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-04T05:50:27.140276Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12147","last_updated":"2026-08-03T09:43:55Z","snapshot_observed_at":"2026-08-06T23:30:44.941267Z","submitted_at":"2026-03-12T16:46:01Z","title":"EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T05:50:27.140276Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.12147"},"observation_digest":"sha256:0f549a2cf310b70a3fb4e92d001a8e24fc3637875a2600ccff8a84a24f6bb7cc","observation_id":"0409a229-3d47-4f6a-a19b-0ea9b7642dbe","resolution":{"observed_at":"2026-08-04T05:50:27.140276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.21631/citation-record","integrity":"/paper/2511.21631/integrity","json":"/paper/2511.21631/citation-record.json","paper":"/paper/2511.21631"},"outbound":[],"paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 100 inbound Pith citation observations for arXiv:2511.21631."}