{"as_of":"2026-08-09T01:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff0ce50e1336a16743f2c031e6991ca5725c17ce41b29f2d4fa0406d23dae51d","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:13:38.886950Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29181/citation-record","integrity":"/paper/2607.29181/integrity","json":"/paper/2607.29181/citation-record.json","paper":"/paper/2607.29181"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T12:13:37.467317Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:37.467317Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:0798ec171cc67fb90c397973e73b2e15afaf115b0afc548ca3ee8aba1c6a1804","observation_id":"441016ad-e0f2-4a73-a3a0-aad1412b2e7a","resolution":{"observed_at":"2026-08-03T12:13:37.467317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12080","last_updated":"2024-04-08T15:50:13Z","snapshot_observed_at":"2026-07-06T13:34:55.650599Z","submitted_at":"2022-07-25T11:57:01Z","title":"Intention-Conditioned Long-Term Human Egocentric Action Forecasting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12080","snapshot_observed_at":"2026-08-03T12:13:38.253096Z","title":"Nils Reimers and Iryna Gurevych","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.253096Z"},"links":{"cited_paper":"/paper/2207.12080","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:21cb330e9a4c0e47f5b53d4fa334ece4167bcd3be2edc7bb619779c95e180694","observation_id":"deb38952-b047-4994-b7cf-3187ee68f4b1","resolution":{"observed_at":"2026-08-03T12:13:38.253096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:13:38.311184Z","title":"Omar Shaikh, Shardul Sapkota, Shan Rizvi, Eric Horvitz, Joon Sung Park, Diyi Yang, and Michael S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.311184Z"},"links":{"citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:3e2f516c5187524bf7f6678c544ca40ef9d617f16a99eb27e0485e36a7a11f5d","observation_id":"7b7c0605-2cba-4aa3-9c6e-7966ca71ef51","resolution":{"observed_at":"2026-08-03T12:13:38.311184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:13:38.424939Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.424939Z"},"links":{"citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:48240f221015273767c6ae46b1e21499665c593fc82b6c7b7db29b4f1c098458","observation_id":"92410adf-2819-49df-b5ac-9cbecd12fc9d","resolution":{"observed_at":"2026-08-03T12:13:38.424939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17050","snapshot_observed_at":"2026-08-03T12:13:38.580739Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.580739Z"},"links":{"cited_paper":"/paper/2507.17050","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:59a344cee55c57b8ca519a2ef03a3982bb1a033d7005945e1ae60094926ea6cf","observation_id":"70d83a25-4c97-4471-8c44-fd8ede4213ab","resolution":{"observed_at":"2026-08-03T12:13:38.580739Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:13:38.721520Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.721520Z"},"links":{"citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:b2d0c882b296593e2c8934461f0bd64da629638a2702dcad95cc094296664253","observation_id":"bac0c751-cba5-450c-b095-4457598404d8","resolution":{"observed_at":"2026-08-03T12:13:38.721520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:13:38.886950Z","title":"Table 13: Schematic equilibrium across VLM scales: vocab size by pass","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.886950Z"},"links":{"citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:4abeef3d0daa767d073f73d4c187a937da1a855d54e47f48703c2e8adb36ab97","observation_id":"12ccf7e9-f0fc-4d4c-93c8-b7b3732c01b6","resolution":{"observed_at":"2026-08-03T12:13:38.886950Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T12:13:38.495584Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.495584Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:a228614fa1934b7df4821490fb073dfee2f5df146b6d28a244c0483ba97492ed","observation_id":"bb768c1c-e8ad-4208-b85f-31fc501e4502","resolution":{"observed_at":"2026-08-03T12:13:38.495584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:13:37.819229Z","title":"Fabrizio Gilardi, Meysam Alizadeh, and Maël Kubli","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:37.819229Z"},"links":{"citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:ed1d00b065327d2b51aab8b54301051bce5ba36373854b1805dfd3aa32cf6dc9","observation_id":"61e55d64-84f9-4ed8-8381-4de5fec111d8","resolution":{"observed_at":"2026-08-03T12:13:37.819229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:13:38.036689Z","title":"AnnoLLM: Making large language models to be better crowdsourced annotators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.036689Z"},"links":{"citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:913aeb053317e47becb7f0f0dbadf96d4f91d9939b2d9d7ef481543b9ad4974e","observation_id":"21144a53-24a8-419f-b19a-88227dd522d0","resolution":{"observed_at":"2026-08-03T12:13:38.036689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15056","last_updated":"2023-07-19T14:10:55Z","snapshot_observed_at":"2026-08-08T09:00:13.475745Z","submitted_at":"2023-03-27T09:59:48Z","title":"ChatGPT Outperforms Crowd-Workers for Text-Annotation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15056","snapshot_observed_at":"2026-08-03T12:13:37.936172Z","title":"arXiv:2303.15056","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:37.936172Z"},"links":{"cited_paper":"/paper/2303.15056","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:855e80e84e64d10c7d10050308f2c90d0b9b706a907f405170186a0939a4a704","observation_id":"1c8a3931-ef25-47f7-8f0d-3cb8305b55e4","resolution":{"observed_at":"2026-08-03T12:13:37.936172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16854","last_updated":"2024-04-05T15:19:19Z","snapshot_observed_at":"2026-08-08T23:14:03.294619Z","submitted_at":"2023-03-29T17:03:21Z","title":"AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16854","snapshot_observed_at":"2026-08-03T12:13:38.159275Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.159275Z"},"links":{"cited_paper":"/paper/2303.16854","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:eba0815f137c58bd97758beb6521278dd5fb977e18dabb39bb1d0f2d7853a6e3","observation_id":"f93f0560-1d80-4ee6-b5d9-59a6cea13de7","resolution":{"observed_at":"2026-08-03T12:13:38.159275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T12:13:37.617740Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:37.617740Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:15e5311950ede3a0ebd5bebce1d6cebfc3730c89fa2840bc6f6d6d495aab1d67","observation_id":"8a7cfdf8-ec4f-45c2-8020-5d02b2a7fc78","resolution":{"observed_at":"2026-08-03T12:13:37.617740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.29181."}