{"as_of":"2026-08-05T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:119c83e0d246911706c2ec1667b4742e921029b9e45ed814f578fe707fde045b","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:27:59.419144Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:30:57.931134Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T11:53:23.711158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00705","snapshot_observed_at":"2026-08-02T20:30:57.931134Z","title":"Training-free uncertainty guidance for complex visual tasks with mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00171","last_updated":"2026-05-30T15:21:48Z","snapshot_observed_at":"2026-08-02T20:30:55.207815Z","submitted_at":"2026-02-26T15:41:26Z","title":"LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:30:57.931134Z"},"links":{"cited_paper":"/paper/2510.00705","citing_paper":"/paper/2603.00171"},"observation_digest":"sha256:6a65301cf8f3b3b890724a4598de085de6a7d4ffbb3e894133a37442a0a2c22a","observation_id":"658fb90c-48e9-46b5-9ec5-7ac6969bc808","resolution":{"observed_at":"2026-08-02T20:30:57.931134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"cited_work":{"arxiv_id":"2510.00705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00705","snapshot_observed_at":"2026-06-29T11:53:23.711158Z","title":"Training-free uncertainty guidance for complex visual tasks with mllms.arXiv preprint arXiv:2510.00705","venue":"cs.CV","work_id":"27e7ae02-8293-4c18-a0bd-802824b7e5bf","year":2025},"citing_paper":{"arxiv_id":"2604.15376","last_updated":"2026-04-15T20:47:08Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-15T20:47:08Z","title":"Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:01:21.985632Z"},"links":{"cited_paper":"/paper/2510.00705","citing_paper":"/paper/2604.15376"},"observation_digest":"sha256:5a7bb3aca5f5fe385172ab9c925aaab10b0f28e4ffb32f787ccbae38ede55a50","observation_id":"98a8be6d-bab6-4ddb-a9ee-16a8dd9656c2","resolution":{"observed_at":"2026-06-29T02:14:52.151779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"cited_work":{"arxiv_id":"2510.00705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00705","snapshot_observed_at":"2026-06-29T11:53:23.711158Z","title":"Training-free uncertainty guidance for complex visual tasks with mllms.arXiv preprint arXiv:2510.00705","venue":"cs.CV","work_id":"27e7ae02-8293-4c18-a0bd-802824b7e5bf","year":2025},"citing_paper":{"arxiv_id":"2605.28421","last_updated":"2026-07-30T08:43:29Z","snapshot_observed_at":"2026-08-02T23:18:00.565585Z","submitted_at":"2026-05-27T12:52:58Z","title":"DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T11:51:01.769882Z"},"links":{"cited_paper":"/paper/2510.00705","citing_paper":"/paper/2605.28421"},"observation_digest":"sha256:5bc37cb0f2d5e1ca10e9338aee1ba96f9338f47fe21c81fc91741f7b82e72432","observation_id":"d0ec393c-dffe-4757-af64-54b9d339b4d5","resolution":{"observed_at":"2026-06-29T11:53:23.712612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00705","snapshot_observed_at":"2026-08-02T12:58:10.911725Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28421","last_updated":"2026-07-30T08:43:29Z","snapshot_observed_at":"2026-08-02T23:18:00.565585Z","submitted_at":"2026-05-27T12:52:58Z","title":"DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:58:10.911725Z"},"links":{"cited_paper":"/paper/2510.00705","citing_paper":"/paper/2605.28421"},"observation_digest":"sha256:8043f788b163b347fcd66106b30cee84c880f66a0a8f30720b43d23afa99bb5f","observation_id":"3267df31-8efa-4278-a340-0a8425ae41b9","resolution":{"observed_at":"2026-08-02T12:58:10.911725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.00705/citation-record","integrity":"/paper/2510.00705/integrity","json":"/paper/2510.00705/citation-record.json","paper":"/paper/2510.00705"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:27:59.419144Z","title":"(2017) were sampled at 3 FPS, while videos from ActivityNet Captions Krishna et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:59.419144Z"},"links":{"citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:458a737b748c4f5af5d3475110b446d45d2c522e80627fb602ac4e2b0b203a94","observation_id":"fd28181a-4b7a-425d-80e1-0194aefd3762","resolution":{"observed_at":"2026-08-04T13:27:59.419144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T13:27:55.997413Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:55.997413Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:35360d1844b0ae5ac78d6fb5c13c5277265521955df91584d27006839bef9880","observation_id":"32918eff-f67b-4b0f-b8f4-dff201ae4846","resolution":{"observed_at":"2026-08-04T13:27:55.997413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-04T13:27:56.827613Z","title":"Language mod- els (mostly) know what they know.arXiv preprint arXiv:2207.05221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:56.827613Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:cac477a06d3dbe1af4bf8e276533d9e4cb2a22553fda603375b0d753a7fb901e","observation_id":"1977dc0e-43d8-426e-852f-1019f5773a81","resolution":{"observed_at":"2026-08-04T13:27:56.827613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07925","last_updated":"2025-08-11T12:38:46Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:38:46Z","title":"TAG: A Simple Yet Effective Temporal-Aware Approach for Zero-Shot Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07925","snapshot_observed_at":"2026-08-04T13:27:56.956200Z","title":"Tag: A simple yet effective temporal-aware approach for zero-shot video temporal grounding.arXiv preprint arXiv:2508.07925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:56.956200Z"},"links":{"cited_paper":"/paper/2508.07925","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:936ee8f33b79e87ba998598b1a182c9e40c99ec76e77d8f5d15d91af95aa9ec6","observation_id":"65eacf5c-4fdb-4d56-b248-02c3a025184e","resolution":{"observed_at":"2026-08-04T13:27:56.956200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T13:27:57.131368Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.131368Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:f88d92e1aad432db25b8fedb7e2366b23b7e3fdc53831fb722feef49a9294687","observation_id":"bcfa624a-27df-4efc-9fae-659e00ae8aab","resolution":{"observed_at":"2026-08-04T13:27:57.131368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09797","last_updated":"2024-04-15T13:54:35Z","snapshot_observed_at":"2026-08-01T20:39:33.434370Z","submitted_at":"2024-04-15T13:54:35Z","title":"TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09797","snapshot_observed_at":"2026-08-04T13:27:57.265975Z","title":"Textcot: Zoom in for enhanced multimodal text-rich image understanding.arXiv preprint arXiv:2404.09797,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.265975Z"},"links":{"cited_paper":"/paper/2404.09797","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:ff83bee2903371570ed2d5e2dc126a9b88728be38d18c19ae61df5634c1b8dc1","observation_id":"968f33d1-246c-4337-bb3f-7db71a08302a","resolution":{"observed_at":"2026-08-04T13:27:57.265975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T13:27:57.393319Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.393319Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:99d2d32dfc12a04f037a65bc38f4602942fad3fdbfa44097c1851f032cc50913","observation_id":"b2f74308-0b8f-4cda-a923-fb5fea0b3e70","resolution":{"observed_at":"2026-08-04T13:27:57.393319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-07-07T06:44:19.645435Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-04T13:27:57.524001Z","title":"The information bottleneck method.arXiv preprint physics/0004057,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.524001Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:11c65b8258946475f19e94badb09b4bde331df2b6dd2af2d3e13fed42f1f31b7","observation_id":"229c6e97-d91c-4bcd-a2ad-e567be55af63","resolution":{"observed_at":"2026-08-04T13:27:57.524001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15839","last_updated":"2025-03-15T12:22:18Z","snapshot_observed_at":"2026-07-06T19:56:08.504922Z","submitted_at":"2024-11-24T13:42:02Z","title":"VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15839","snapshot_observed_at":"2026-08-04T13:27:57.747048Z","title":"Valid: Mitigating the hallucination of large vision language models by visual layer fusion contrastive decoding.arXiv preprint arXiv:2411.15839,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.747048Z"},"links":{"cited_paper":"/paper/2411.15839","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:ca4843a0f9fb62996cea311f8633a881adf6c56552aaeead59d65ed317f44fb1","observation_id":"edc14937-629f-47b1-b776-1df37a0fe805","resolution":{"observed_at":"2026-08-04T13:27:57.747048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-04T13:27:57.880798Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image percep- tion in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.880798Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:6dc548bf930d469354367bb3c0836955640262c36aa6da9e01ef933d9e2c751e","observation_id":"83e97f27-3ede-4322-9404-30dabd8d60ff","resolution":{"observed_at":"2026-08-04T13:27:57.880798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10922","snapshot_observed_at":"2026-08-04T13:27:58.123306Z","title":"A survey on video temporal grounding with multimodal large language model.arXiv preprint arXiv:2508.10922, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.123306Z"},"links":{"cited_paper":"/paper/2508.10922","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:0a3f869162410d6f86b99b7189ccb522ab7a9d1a019344772fea2cccebf023a6","observation_id":"88ca922f-510e-4504-9f08-5e73b4c37d34","resolution":{"observed_at":"2026-08-04T13:27:58.123306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:27:58.267926Z","title":"Generate, but verify: Reducing hallucination in vision-language models with retrospective resam- pling.arXiv preprint arXiv:2504.13169, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.267926Z"},"links":{"citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:46c16d88ee8b8364af8d2e15e7a32f9e0d0ba8e6fa821c335f0c36a51ba7813b","observation_id":"c768bec0-c8c8-4a76-8389-60235b0a8898","resolution":{"observed_at":"2026-08-04T13:27:58.267926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-04T13:27:58.447481Z","title":"Mllms know where to look: Training-free perception of small visual details with multimodal llms.ICLR, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.447481Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:898cd495bdf6d90c950ffe6ff3c15771f8fbcbe16e4cb6e1460b6b74bc29399b","observation_id":"63e2b82f-acc5-4c00-8289-ba68f89b3760","resolution":{"observed_at":"2026-08-04T13:27:58.447481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-04T13:27:58.615053Z","title":"Deepeyes: Incentivizing” thinking with images” via reinforcement learning.arXiv preprint arXiv:2505.14362,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.615053Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:164a71a6c6bcdfbd903423b3e52040e2aa72c61acbeb0b7319ae53497000e318","observation_id":"4438ba32-5b43-4ea1-948c-2d2e64bf8975","resolution":{"observed_at":"2026-08-04T13:27:58.615053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18938","last_updated":"2024-12-03T03:56:52Z","snapshot_observed_at":"2026-07-06T19:23:33.343982Z","submitted_at":"2024-09-27T17:38:36Z","title":"From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18938","snapshot_observed_at":"2026-08-04T13:27:58.792970Z","title":"From seconds to hours: Reviewing mul- timodal large language models on comprehensive long video understanding.arXiv preprint arXiv:2409.18938,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.792970Z"},"links":{"cited_paper":"/paper/2409.18938","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:7fde323d478018a976a7f677ec496cddb6fa89cb7f671bbe933c3f5fb403e035","observation_id":"e29c6fd0-4f3e-4ee1-848f-d899feec41dc","resolution":{"observed_at":"2026-08-04T13:27:58.792970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:27:58.913595Z","title":"Entropy, a foundational concept from information theory (Shannon, 1948), provides a formal measure of the uncertainty inherent in a probability distribution","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.913595Z"},"links":{"citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:76e2e4ae8fc47f80935c13eef5974762194ce8f10cc75dce0275d4d19a1c1939","observation_id":"77e04a20-0b5d-49c9-a544-ab6deaa77d44","resolution":{"observed_at":"2026-08-04T13:27:58.913595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:27:59.081176Z","title":"Pretrained on massive text corpora, LLMs learn to generate reliable probability distributions over a predefined vocabulary","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:59.081176Z"},"links":{"citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:09c328f1933e75eb617b680c0fa2e5eed3e2d9a55d4e92debe7520cd814c228e","observation_id":"824337d7-b091-4191-89f2-fd29d73d9074","resolution":{"observed_at":"2026-08-04T13:27:59.081176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:27:59.308256Z","title":"A” and “B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:59.308256Z"},"links":{"citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:5ec1eca4eec4d4ffbc3138ed59c6d86f13b8e97f9bc1fadca90161f85b61f95e","observation_id":"787f4816-e869-4bc5-9ded-b5ff21e63174","resolution":{"observed_at":"2026-08-04T13:27:59.308256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T13:27:57.642563Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.642563Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:b9babdf83ffb5cdd17d92ea1d1cea4ea3b51ef6f492f43aa59749ab0dde0785f","observation_id":"e2eab76a-570b-4bac-a351-c243020a3693","resolution":{"observed_at":"2026-08-04T13:27:57.642563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:27:59.171856Z","title":"This finding aligns with principles from curriculum learning, where task difficulty can be measured by model uncertainty (Bengio et al., 2009; Kumar et al., 2010)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:59.171856Z"},"links":{"citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:2069980255d2c3c9844af5e78e34b941314cf8fc2361049fec8c741d2ef2f0c6","observation_id":"64e6e1a3-0bf5-4063-9b05-b25003ebc6f3","resolution":{"observed_at":"2026-08-04T13:27:59.171856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-04T13:27:55.678696Z","title":"The internal state of an llm knows when it’s lying.arXiv preprint arXiv:2304.13734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:55.678696Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:b6c93dfc24962f0ea6e7e4480055afa447d59e236fa639bbf17112c712ab2613","observation_id":"09861003-066e-4122-a817-4db240f692bc","resolution":{"observed_at":"2026-08-04T13:27:55.678696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-07-06T21:33:21.789849Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24158","snapshot_observed_at":"2026-08-04T13:27:56.359929Z","title":"Threading keyframe with narratives: Mllms as strong long video comprehenders.arXiv preprint arXiv:2505.24158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:56.359929Z"},"links":{"cited_paper":"/paper/2505.24158","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:97d4eb16a4ad387b28ea1e211001d788f473913743fc61b05de3cac1e4b04693","observation_id":"76dbb3a0-84e8-434c-9c6f-48b3029920af","resolution":{"observed_at":"2026-08-04T13:27:56.359929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-04T13:27:56.192678Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability.arXiv preprint arXiv:2411.18211, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:56.192678Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:22f6220da99302f290222ab9937cb6e7252ba6c61d3cdd406b765df2bedf5f28","observation_id":"1f2463c6-462a-448c-822a-86e27085b6c5","resolution":{"observed_at":"2026-08-04T13:27:56.192678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-05T00:52:07.112592Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-04T13:27:58.011777Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling.arXiv preprint arXiv:2501.12386, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.011777Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:e7e6ccfa68db368d556fcaa69079d8e27a1a1e6b778a399fe1ca85736aed5244","observation_id":"af50635d-a1d9-4977-9180-3439cbf037d9","resolution":{"observed_at":"2026-08-04T13:27:58.011777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T13:27:55.803283Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:55.803283Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:77aef85994492a028aec5fadff07ceaac0864fbc45f34c2a98ed9f40dd27c790","observation_id":"0e247db2-211e-49d4-8e58-e7bf5f68018e","resolution":{"observed_at":"2026-08-04T13:27:55.803283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17447","last_updated":"2025-04-24T11:19:18Z","snapshot_observed_at":"2026-07-06T21:14:10.460633Z","submitted_at":"2025-04-24T11:19:18Z","title":"FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17447","snapshot_observed_at":"2026-08-04T13:27:56.481199Z","title":"Frag: Frame selec- tion augmented generation for long video and long document understanding.arXiv preprint arXiv:2504.17447,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:56.481199Z"},"links":{"cited_paper":"/paper/2504.17447","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:d343879c243f3e9711c64e6fb16392edab914c9f682b8eaa3bf12ba48951cf52","observation_id":"b25ee4a3-3132-4bde-b546-d701ac7253df","resolution":{"observed_at":"2026-08-04T13:27:56.481199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T13:27:56.641925Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:56.641925Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:e08a7a1675c24a98a08635e51a996c4a998b137bd6d4daea6a0e29750c18c37f","observation_id":"a08925e4-ee69-435f-8e78-a70652459d75","resolution":{"observed_at":"2026-08-04T13:27:56.641925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T13:27:54.818274Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 4 inbound Pith citation observations for arXiv:2510.00705."}