{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d0c2fd4839521d0132a1bdbc9fa4d103e531ae59ecee111a416d22a93d33429","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:49:34.139633Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24789/citation-record","integrity":"/paper/2607.24789/integrity","json":"/paper/2607.24789/citation-record.json","paper":"/paper/2607.24789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T09:49:31.088715Z","title":"Qwen3-VL Technical Report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.088715Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:6956ba7b66646387c595c4634242dc4eecd6554e2173aaa216ac4a56fb8a50c8","observation_id":"a7dd98c3-e76c-4fe5-8fa8-62002ebd3697","resolution":{"observed_at":"2026-08-02T09:49:31.088715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T09:49:31.218032Z","title":"Seed1.5-VL Technical Report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.218032Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:4a19891a2194f849f51dfcff4f846a97b3793c7e45ae04206d3a89fa7abe761f","observation_id":"d6cca10a-9c12-4574-8693-d3ef3d0b3c3e","resolution":{"observed_at":"2026-08-02T09:49:31.218032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:31.390492Z","title":"Self-Attentive Sequential Recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.390492Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:443c6de6cf6843db37f2eb2a881182c0e364a5b809f0f310ae78ffb03aeffc8c","observation_id":"24aa1f7a-51be-4f4c-8a22-5c7420693367","resolution":{"observed_at":"2026-08-02T09:49:31.390492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:31.563395Z","title":"Matrix Factorization Techniques for Recom- mender Systems.Computer, 42(8):30–37, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.563395Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:38867715ff8737d03a44817d4131ce8fa6bcc7ee7e21f3246b487827bc05df74","observation_id":"cd7df801-ed01-4638-a115-70e8c212cd47","resolution":{"observed_at":"2026-08-02T09:49:31.563395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:31.717547Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.717547Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:6e1bc3e40496078b15a48fc7eed4ee82d62a9b4677a3c013242143fc81b60442","observation_id":"5d3c5055-5a8f-4ef9-9f43-a448cf7a4ffa","resolution":{"observed_at":"2026-08-02T09:49:31.717547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:31.833173Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.833173Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:ed9ce31bdc763843243f953e2133ffa43a49f739f1272b14ddac68dfdee014d3","observation_id":"8648335a-1590-4e21-9752-5f40e2a06727","resolution":{"observed_at":"2026-08-02T09:49:31.833173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:31.951424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:31.951424Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:d54a91436b4269588c1343afc049a01ac424b19234fb6e353826ce6d960081fd","observation_id":"7c6c9b27-6ff1-420c-8eed-5cdc2a4e4511","resolution":{"observed_at":"2026-08-02T09:49:31.951424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:32.091241Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:32.091241Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:4be12ea976f515972f73eb15a9ee98ec1171e30a09f8c6670b6d5983b27f0588","observation_id":"50e3ca26-2823-4472-9b83-28a36c7325ad","resolution":{"observed_at":"2026-08-02T09:49:32.091241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00091","last_updated":"2019-05-31T21:51:16Z","snapshot_observed_at":"2026-08-02T13:53:54.252223Z","submitted_at":"2019-05-31T21:51:16Z","title":"Deep Learning Recommendation Model for Personalization and Recommendation Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00091","snapshot_observed_at":"2026-08-02T09:49:32.242660Z","title":"Deep Learning Recommendation Model for Personalization and Recom- mendation Systems.arXiv preprint arXiv:1906.00091, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:32.242660Z"},"links":{"cited_paper":"/paper/1906.00091","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:3f7e0f0171607760140395d12234a7c3cc0a42d2b1b4b2f2771d088a4e147367","observation_id":"93ad160a-09fd-4e62-876f-0e7a13e5c666","resolution":{"observed_at":"2026-08-02T09:49:32.242660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:32.384797Z","title":"GPT-4V(ision) System Card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:32.384797Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:6d28f4569fc9350e5b18aa5dd8a4b587538799ab4efe3017fc2d627aca66d253","observation_id":"5fc1cd67-73e7-4524-a720-ab96c82698c3","resolution":{"observed_at":"2026-08-02T09:49:32.384797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:32.519076Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:32.519076Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:647ed7d832c48cedd920c8c212e5e3cdbe0a9d7fbbc8205957e8bdfb562a92e2","observation_id":"74d803b6-74df-4a04-854c-8f02d4f222ee","resolution":{"observed_at":"2026-08-02T09:49:32.519076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:32.668931Z","title":"TIGER: Recommender Systems with Generative Retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:32.668931Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:1384f4005ef2b58e0f383d0b3697fa967c2bee18cea71c95267d0721f3634f13","observation_id":"6c40194a-3487-44d6-99d2-b22b7f010543","resolution":{"observed_at":"2026-08-02T09:49:32.668931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T09:49:32.844813Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:32.844813Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:b5ea84bf1df5eff2c51a44af90047d9276d0c13e9ff0bbd95463af49ea5d8611","observation_id":"4e6a4991-e5ab-466f-97d4-11fa79595c5c","resolution":{"observed_at":"2026-08-02T09:49:32.844813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:33.011548Z","title":"BERT4Rec: Sequential Recommendation with Bidirectional Encoder Representations from Transformer","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.011548Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:0b587fa062ea5e8107fa4ebccbf25834392e746b761673940fbee570e569f9f3","observation_id":"a71b1e2a-1370-420e-b47a-6d1c0d820614","resolution":{"observed_at":"2026-08-02T09:49:33.011548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:33.195160Z","title":"LLMs for User Interest Exploration in Large-scale Recommendation Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.195160Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:58877a391b7cbe6921bb15f1b7f9c63dfa5339e1130ddd992fe8c201f14e09e3","observation_id":"9bdcf607-279a-4c52-867e-3aea90ab351b","resolution":{"observed_at":"2026-08-02T09:49:33.195160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T09:49:33.337601Z","title":"Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.337601Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:f27958e65cd0c0add047ead6bb9e969c80fb74293ff36527b6dcc7dd158755d7","observation_id":"c4be3360-fe03-400c-a7ed-b309ac87defd","resolution":{"observed_at":"2026-08-02T09:49:33.337601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:33.451082Z","title":"Deconfounded Recommendation for Alleviating Bias Amplification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.451082Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:b393d2db70dbde5cf421cb06e1407d722dbde0a509a63991445f9f71586ee3e4","observation_id":"5a560d2c-3080-4e5a-bd26-887f0f6f5335","resolution":{"observed_at":"2026-08-02T09:49:33.451082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-02T09:49:33.571423Z","title":"MiMo-VL Technical Report.arXiv preprint arXiv:2506.03569, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.571423Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:a971cede2fd39e70419e3584b370ca33d289542dc12621974e71b25065b33102","observation_id":"72382549-ea31-40eb-a9bf-70cb567513b8","resolution":{"observed_at":"2026-08-02T09:49:33.571423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05525","last_updated":"2020-10-12T08:27:30Z","snapshot_observed_at":"2026-08-03T13:49:26.778300Z","submitted_at":"2020-10-12T08:27:30Z","title":"Large Scale Product Graph Construction for Recommendation in E-commerce","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05525","snapshot_observed_at":"2026-08-02T09:49:33.694781Z","title":"Large Scale Product Graph Construction for Recommendation in E-commerce.arXiv preprint arXiv:2010.05525, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.694781Z"},"links":{"cited_paper":"/paper/2010.05525","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:87b867e99f40fb552bc5eccd8a0935b2a8babfde48529b946426d79a9b482e17","observation_id":"34f78e4a-b690-41c8-bda2-8413e51518f1","resolution":{"observed_at":"2026-08-02T09:49:33.694781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:33.842466Z","title":"Sampling-Bias-Corrected Neural Modeling for Large Corpus Item Recommendations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.842466Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:9be20fe7fef4b506ebc25c1ea167091a3efb320afc02c5d1ae442ac467fbaec4","observation_id":"de16cd57-8ff8-4a18-bc7b-509de21ed53b","resolution":{"observed_at":"2026-08-02T09:49:33.842466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:33.950934Z","title":"Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.950934Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:68e7f820ae991f04fc4955626877a04cdcca5d4cdc76312452368dd6fd99820b","observation_id":"1122ad46-6981-48a0-9188-50487345fdbb","resolution":{"observed_at":"2026-08-02T09:49:33.950934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:49:34.139633Z","title":"Causal Intervention for Leveraging Popularity Bias in Recommendation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:34.139633Z"},"links":{"citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:7a5e4f5cddd92d0d22347afcbc32efc9217724ab1b2e9490603545836dae2163","observation_id":"52ac8380-0622-46b1-8f9f-41a80455073c","resolution":{"observed_at":"2026-08-02T09:49:34.139633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.24789."}