{"as_of":"2026-08-11T14:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce21d046789edf33eba7e7d43ba7841b735e0e8a44fdbd3659b1fa36719a0f71","coverage":[{"denominator":145,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:47:12.490079Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:29:27.161964Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T02:52:20.802634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":"2412.19326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment","venue":null,"work_id":"90adeb70-7a41-48c6-8e9e-e8346533501e","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:dcd7331cd16b5569001232199e72a1954ff347a2680c6144f0edd7513a15ea69","observation_id":"d9d4332a-5f1e-483f-a493-4b5634d2952e","resolution":{"observed_at":"2026-05-17T02:52:20.806469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":"2412.19326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment","venue":null,"work_id":"90adeb70-7a41-48c6-8e9e-e8346533501e","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:ab8c389731857c02585720eff4f404719ba7dc9b04922ee9a0e89e92dd2dbf03","observation_id":"38640935-a25c-466a-b623-b70ebbdb310d","resolution":{"observed_at":"2026-05-15T20:56:07.724355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-08-06T23:29:27.161964Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-08T12:15:56.187844Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:29:27.161964Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:7c65112b1ba5079a013a258251feda4b76f7d95ad8bd2a2436ff2698f2868a1d","observation_id":"14bcbbf9-5db4-4c97-b06d-1947d947e93e","resolution":{"observed_at":"2026-08-06T23:29:27.161964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-08-05T23:32:18.017165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.017165Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a1fe0b3c673c362eea0bb160f7dfb52e69b001195568a46d416ea0e26fedf786","observation_id":"a6be8cda-4407-4ef7-acbc-29899c8ec6c1","resolution":{"observed_at":"2026-08-05T23:32:18.017165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19326/citation-record","integrity":"/paper/2412.19326/integrity","json":"/paper/2412.19326/citation-record.json","paper":"/paper/2412.19326"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T00:47:12.038424Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.038424Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6c8560901573faa0e7a6201e2c6e10cd797143a9f610a846d1c066fbc3d43fd1","observation_id":"9dcb825f-4a07-478f-a8e6-852011335249","resolution":{"observed_at":"2026-08-11T00:47:12.038424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T00:47:12.043981Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.043981Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1e8bece296ed7fe35e09c4317ef3257f5eee3c81b100a6c191301f31c6bd3720","observation_id":"762f1c23-3290-47f3-8dc5-755aefd961c1","resolution":{"observed_at":"2026-08-11T00:47:12.043981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T00:47:12.049215Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.049215Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:53ad4201875489acf7ac2f5f2e22a4b6e915de3c807c8bd035fa55b2a7da73c7","observation_id":"efa4fd45-a338-41c0-b712-a49a9d2a9a93","resolution":{"observed_at":"2026-08-11T00:47:12.049215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19603","last_updated":"2024-09-29T07:47:15Z","snapshot_observed_at":"2026-08-10T23:14:35.987685Z","submitted_at":"2024-09-29T07:47:15Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19603","snapshot_observed_at":"2026-08-11T00:47:12.054302Z","title":"One token to seg them all: Language in- structed reasoning segmentation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.054302Z"},"links":{"cited_paper":"/paper/2409.19603","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:89bd7150b1c20b4e0781f2fd2ee58dde3d3ea94e287247385aa65631caa54c7e","observation_id":"67b764e6-ebbf-45d8-b686-1d2f6f81c332","resolution":{"observed_at":"2026-08-11T00:47:12.054302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.059072Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.059072Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1ba0bd31794abf1559a098388bc7fa24536a9d4b4921573f1e333282b0c68091","observation_id":"f21a84f0-3855-42c1-9209-28ef34555fb3","resolution":{"observed_at":"2026-08-11T00:47:12.059072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.063969Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.063969Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:d6f2ccea953d28dbf2149cd1646e140264a0f291ef974507aeda9d3837176d6b","observation_id":"4a7d8b0f-fdfc-451a-88c0-57cdf44b2830","resolution":{"observed_at":"2026-08-11T00:47:12.063969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.068513Z","title":"Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.068513Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fa732c0c6c58f2f6b3f4da3349160632d3393d673a67af8761f22fd209c77f3d","observation_id":"cb805870-40c4-4245-a772-0fb8138759ad","resolution":{"observed_at":"2026-08-11T00:47:12.068513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T00:47:12.073445Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.073445Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:543f529a2f3b8affbbd1cb20814817c3d0ee2d2de383097dc7eca0ac61620f63","observation_id":"bd164ced-73d1-4608-84b4-3ec7f999f3a2","resolution":{"observed_at":"2026-08-11T00:47:12.073445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T00:47:12.078413Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.078413Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b91287aee6acb538adb976b2d0de77576c48314d37601817cad4809049a3a983","observation_id":"b6c2acca-666b-4c43-a27b-fc5c8a996300","resolution":{"observed_at":"2026-08-11T00:47:12.078413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.083108Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.083108Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:9b2f667c0c587d670084859078063d4d2c71f55ebb1f259b94c28ab2b58eebb0","observation_id":"052ffdf0-131c-43b2-873f-1e6212d75485","resolution":{"observed_at":"2026-08-11T00:47:12.083108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T00:47:12.087492Z","title":"Sharegpt4video: Improving video under- standing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.087492Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e8479ecaac820ed46fb10e10508de9cc45459ef227d6fee2eb4615e1503b854c","observation_id":"6c4c4aab-e7c2-4666-a51d-e9e39f8c8b7a","resolution":{"observed_at":"2026-08-11T00:47:12.087492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.092084Z","title":"A simple framework for contrastive learn- ing of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.092084Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6cf2446762f06b253716842a77c14d9803016b6d6fe904b1a8eb07a4889d969a","observation_id":"2d1d871c-f622-416a-a8cb-99956a10c789","resolution":{"observed_at":"2026-08-11T00:47:12.092084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.096385Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.096385Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:afab0bd717bc483a812967f62c221ee09e942977174dfb56a15e4714913a5750","observation_id":"725111f0-c607-4934-aabc-5aae54cb1bef","resolution":{"observed_at":"2026-08-11T00:47:12.096385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08177","last_updated":"2024-02-23T02:22:36Z","snapshot_observed_at":"2026-08-10T20:39:17.107169Z","submitted_at":"2023-04-17T11:39:53Z","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08177","snapshot_observed_at":"2026-08-11T00:47:12.100651Z","title":"Efficient and ef- fective text encoding for chinese llama and alpaca","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.100651Z"},"links":{"cited_paper":"/paper/2304.08177","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e6738ae9ca9f340b64a13853279aefcefb1a4340e4d264f9a660c7701ed9fa2f","observation_id":"96e0e322-71e4-4521-9393-77405d9a80ae","resolution":{"observed_at":"2026-08-11T00:47:12.100651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.104936Z","title":"Atom: Accurate tracking by overlap maximization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.104936Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5ddac2e8d446cd4e3bf8f1cbdc12b497c675dd6c0817d314c97a4ec34d260ae1","observation_id":"87b74af6-5723-46e1-863c-b056a89acf75","resolution":{"observed_at":"2026-08-11T00:47:12.104936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.108967Z","title":"A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.108967Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:432f65de8b837f623d2d85d3c1f5ceb334a167dee3295cbf2ff9ec5360c76e7f","observation_id":"56b2fe7b-5ba8-42ed-a39b-18312df4226e","resolution":{"observed_at":"2026-08-11T00:47:12.108967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.113554Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.113554Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b5dae8d5f8c3522a4f766d484783fb38543c77057e793fc2514a8d73e383c986","observation_id":"00310f74-8531-48f9-9c63-14b0144895d4","resolution":{"observed_at":"2026-08-11T00:47:12.113554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-11T00:47:12.117807Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.117807Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4cb69617c86b239e88b1a2e934f89f8f932417b5068706ddc84a08544c84dc06","observation_id":"1840cf52-86e3-452e-8ca4-4fdc90c06e0f","resolution":{"observed_at":"2026-08-11T00:47:12.117807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.122233Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.122233Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:99e6670b003913b4e68ac8053d8681f9f26192e33797838b7fe08463b2413bec","observation_id":"da3f08b3-c0d2-4455-a27d-9daa61268863","resolution":{"observed_at":"2026-08-11T00:47:12.122233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.126482Z","title":"Lasot: A high-quality benchmark for large-scale sin- gle object tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.126482Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:cf81b295d70a983c001d633a29d05a41fa9fc80983c6637be3de081a974400a2","observation_id":"c1215d70-ce8b-46aa-b293-e19a678c0ff2","resolution":{"observed_at":"2026-08-11T00:47:12.126482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T00:47:12.130622Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.130622Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4bd6cfe87d71c74eab3e42cc4983255368d3e87cd1ee189ec601e415dfdb583a","observation_id":"527dba99-44c9-4d31-a891-4e245b4bf354","resolution":{"observed_at":"2026-08-11T00:47:12.130622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.134927Z","title":"An empirical study of end-to-end video-language transformers with masked vi- sual modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.134927Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b4fdd2e0304237431eaeb4025a1c28fa591d4aa1a3e900b0b74aea3ffaab3da9","observation_id":"e6eb339c-e42c-414f-af2a-c9450e2702c8","resolution":{"observed_at":"2026-08-11T00:47:12.134927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.139026Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.139026Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:3802ff70b94df2d072ed22817902027c81a71ef8628c64f9d20f18d20e959f2f","observation_id":"3374056e-b088-4018-b786-f7c624f794a8","resolution":{"observed_at":"2026-08-11T00:47:12.139026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.143090Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.143090Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e3d4110a04b45ffb6c07ee4d850a3d3d7334740c1aa0fc90d630355c5d7f953f","observation_id":"a8c44783-2dfe-4ecd-b387-d1d18ecdbc36","resolution":{"observed_at":"2026-08-11T00:47:12.143090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.147570Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.147570Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:abe7220b9cae9c11bb856c5feaff7b912d3bbcd69999154dcd5c98ddb3e41fb2","observation_id":"fa62e8f4-d0c9-4074-af60-e8cad2739f49","resolution":{"observed_at":"2026-08-11T00:47:12.147570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.151828Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.151828Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:94433f8c7e15fe22b403ac823b8fc1d54e833bb169c9806189bf8de8a8ed4d4a","observation_id":"b2db24cf-c442-4e89-aca1-d867c3a2d165","resolution":{"observed_at":"2026-08-11T00:47:12.151828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.155987Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.155987Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b497757cdddac51642efb0a29d2b77a1864c1fda342c1c34d1d3cb2ac917382e","observation_id":"4df2d7f4-754d-4078-a66e-3755084cec88","resolution":{"observed_at":"2026-08-11T00:47:12.155987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.160300Z","title":"Vtimellm: Empower llm to grasp video mo- ments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.160300Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:493308fc4e6202a84d9fdf180c85dd578522473eeb8c3039c46a783a3144666a","observation_id":"1d862bc8-9fcb-48d3-90be-7c045f2f791c","resolution":{"observed_at":"2026-08-11T00:47:12.160300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.164547Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.164547Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:724349f91b52dc17606c3f26c05d5fa9430eb747ca8c2ef89dcb778e3f5de0c4","observation_id":"174cdd31-72e7-49ff-ba71-2709e7ff8943","resolution":{"observed_at":"2026-08-11T00:47:12.164547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T00:47:12.168965Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.168965Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:49e837e083582b66f2a36b7b6184b2131d2c6279e23c1131ad437b3f45a6d826","observation_id":"91aadbb5-b327-43ee-9673-e360eb89370d","resolution":{"observed_at":"2026-08-11T00:47:12.168965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.173790Z","title":"Sparse sharing relation network for panoptic driving perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.173790Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e395b2801d3afc4d2b4858a0a15521eed1d57b88db3f42fb4c64de8f737a6eba","observation_id":"4588e631-24e4-463b-abcb-8cbbfa43e80f","resolution":{"observed_at":"2026-08-11T00:47:12.173790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.178188Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.178188Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:80556d7cc054adf9aab9f6463f891ce72f6c900523ce777214a2af9298b2d69e","observation_id":"ac1519dd-4912-4649-9aad-a73762a0f331","resolution":{"observed_at":"2026-08-11T00:47:12.178188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-10T16:52:41.065205Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-11T00:47:12.182626Z","title":"Language repository for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.182626Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5b7c414e76dc032b6f5329e3139de7467ce44673290aee44a7656326854bbab7","observation_id":"6a1416b0-dba8-4eb8-a22a-a93777d61210","resolution":{"observed_at":"2026-08-11T00:47:12.182626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.188728Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.188728Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6ea8c51f1558bdc118780ce9045ece56b8471e2dc9c6130cf836cdbb836d433e","observation_id":"d4a16e49-f30d-4f47-a61e-da87de2b95c4","resolution":{"observed_at":"2026-08-11T00:47:12.188728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.193172Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.193172Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:7e5194e0495ae25f4b27a7e1c8f6ddf54cd09cffbb1ef6f9159317c4293cf8f7","observation_id":"dc741ad8-f90d-4201-a667-e11909356d96","resolution":{"observed_at":"2026-08-11T00:47:12.193172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.197698Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.197698Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e29880afa1e3d0ba93dafd2b1d8cfd52dc6a7f6ccb184fbc1176f9446e7f3c23","observation_id":"4d1eee41-3aba-419b-84d6-b2f9c1ed9a02","resolution":{"observed_at":"2026-08-11T00:47:12.197698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.202060Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.202060Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:ecd053720bb6d104880a122b32f41ba06a358ded1404c0624b68605f47fe88f7","observation_id":"483cf381-cdaa-4c04-a336-644dc5bcace0","resolution":{"observed_at":"2026-08-11T00:47:12.202060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.206802Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.206802Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:404c8c1e8a71644cffcbeb21a6475f955927f136a050417bd773559684b058e1","observation_id":"9d4f8ff6-b2c6-4b46-b65d-83a55ae01d0b","resolution":{"observed_at":"2026-08-11T00:47:12.206802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.210658Z","title":"SiamRPN++: Evolution of siamese visual tracking with very deep networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.210658Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c722f60c25ee322a1084817490ebcc5be6b0df38e9ad35e3193d8e61cf3d8b8a","observation_id":"3e441280-5a69-4a81-9093-da47acfcb776","resolution":{"observed_at":"2026-08-11T00:47:12.210658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.214870Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.214870Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f9b94522b99c46ae701ae657c4bcb21db7767af238ff47051178766e3f766bf3","observation_id":"aa491ba9-b8ea-41c7-ab2e-59cbc3a38dcf","resolution":{"observed_at":"2026-08-11T00:47:12.214870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:47:12.224469Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.224469Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:eccde877b3d07f437ab0d40787f141a27bf2c8f990961a3c0a524c4f419bf62b","observation_id":"f8bebfc0-b866-4763-aef4-58a647a6b53c","resolution":{"observed_at":"2026-08-11T00:47:12.224469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T00:47:12.229444Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.229444Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fc1ec1fe56d061cfd5b64bfeb78afc7fb3ebf3c896d8cae78eeb6b5f3718a7a9","observation_id":"e0323e11-6fcc-49e0-be01-07331a41f31d","resolution":{"observed_at":"2026-08-11T00:47:12.229444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.234149Z","title":"Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.234149Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a8727fdf948765d6df6757ada44d3cfe86d21f5f9850d7580e829cc9f35d0c6f","observation_id":"b2b8dbfe-24e3-49e3-b60b-099c9887404e","resolution":{"observed_at":"2026-08-11T00:47:12.234149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.238446Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.238446Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:9e13c64b269ac0be344f55f702182aea9c70a54e71b82d1c067d9c6b047c4b2c","observation_id":"a1dfefc3-b266-4371-bdd5-809b4224b1cc","resolution":{"observed_at":"2026-08-11T00:47:12.238446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T00:47:12.242711Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.242711Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:667d41d01e3ac62de847769e92d9df9a6ed83b2567c3588541c9d584191d3626","observation_id":"bc44888b-8097-4936-ade0-db1a18d98b24","resolution":{"observed_at":"2026-08-11T00:47:12.242711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.247559Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.247559Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:484ee6eb85aeb9bbafef0c4957f1723d3f5ab9d52ba2f40b4e91bbf84baef728","observation_id":"fad59bd5-0922-4de9-a41e-8df0a5f489eb","resolution":{"observed_at":"2026-08-11T00:47:12.247559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.252019Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.252019Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:f6e52a0c8f8c2c15176c1f399518ad377ff0751ecfdaef8330f4402e8ea8a278","observation_id":"bdc73eca-2634-4f3e-aa64-e621c3e803e8","resolution":{"observed_at":"2026-08-11T00:47:12.252019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T00:47:12.256747Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.256747Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:efcda7177488f6fbf16ce370fc7a13661fef892d473ed4fca3d464211a0e0cfb","observation_id":"c13ec71b-bf5f-49dd-9338-dff9dac4361f","resolution":{"observed_at":"2026-08-11T00:47:12.256747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.262395Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.262395Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:3fdd22b4118d7beb72ad8e4624f12fe87d4501f7fc713fef6b9955d6a2d72b8f","observation_id":"9fcd10b2-ebe7-4196-aa91-09b95183cdb2","resolution":{"observed_at":"2026-08-11T00:47:12.262395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.266822Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.266822Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4b2e524be3a684987c347054365a8494183cb03ac6bfd2cbe04d11fdd94711f7","observation_id":"c7984272-a9f4-4441-b274-3554065941cf","resolution":{"observed_at":"2026-08-11T00:47:12.266822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.271112Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.271112Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:e32fa5f10e870f17d2500677d6908d6a35b5be9fb7090fcd27370e6a2a44a8e5","observation_id":"09c50c66-4d0c-4c60-b7f3-235b2c9d26a9","resolution":{"observed_at":"2026-08-11T00:47:12.271112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.275158Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.275158Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:31615c1024e5afa7a434c0fd3968de73447bbe9a77c4ff3103e8c0c9bf206b42","observation_id":"34c63680-e0c1-4889-8d82-48ce724812de","resolution":{"observed_at":"2026-08-11T00:47:12.275158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T00:47:12.278739Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.278739Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fd116c1be3e0a4447833e3c7e6e58bb11f44e38a2257f676d64362a555edc0dc","observation_id":"d809c351-6fd8-452c-a66d-568c620d301d","resolution":{"observed_at":"2026-08-11T00:47:12.278739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.283388Z","title":"Unified-io: A uni- fied model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.283388Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:345798a9f655777a628e45a4063b727076fa0c8ce017e238c7bd64ffe4690c59","observation_id":"3defb2b0-6e33-438f-9072-c5d2d5a88ec6","resolution":{"observed_at":"2026-08-11T00:47:12.283388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-09T01:53:18.568676Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-11T00:47:12.288900Z","title":"Videogpt+: Integrating image and video en- coders for enhanced video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.288900Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4f55b9bb749099fa8f631b6a2bd793809db6c1c0512509dc1429f5a0d3e38131","observation_id":"c1b178b1-1e35-4331-b275-62fea2903a2d","resolution":{"observed_at":"2026-08-11T00:47:12.288900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.293816Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.293816Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:228f9f5e4f596b3dc2b0dbc46345f5d5c522a2ed0d850feb955d84752d894036","observation_id":"8c743a22-0b1a-42a3-9780-6b6493ba03e4","resolution":{"observed_at":"2026-08-11T00:47:12.293816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.298300Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.298300Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:076f6cef7f7c2a6db282948e1a900636ba48fe0594c5d8455f14b1788cc2a0f3","observation_id":"4a7162bd-a6bb-495a-b577-6d8d03ffcced","resolution":{"observed_at":"2026-08-11T00:47:12.298300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-11T00:47:12.303561Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.303561Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5ab308a9e876abb7066f02362a4bfa3352649a73115bc6371017151888b017be","observation_id":"1a20f7b7-3880-4f7d-9299-d3d699dc12bf","resolution":{"observed_at":"2026-08-11T00:47:12.303561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-11T14:34:48.970158Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-11T00:47:12.308118Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.308118Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:bc1c33e5cc5721ad917013ff1be38a6155ac20e1546570e38c5fbd1ced0c434c","observation_id":"40e62f33-85da-4f3a-bd82-dc428f754b52","resolution":{"observed_at":"2026-08-11T00:47:12.308118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.312789Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.312789Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:9ea4cc5227a52c6d19b243a925da8f2e75d333b49bf83e744994e11c6331225d","observation_id":"5b331ab6-7166-4a09-9665-0190eca0c328","resolution":{"observed_at":"2026-08-11T00:47:12.312789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.317196Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.317196Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c6c0f19a528d81dae685187c818e9777155234df68eb213615b59141f42409fc","observation_id":"9968bae1-ca09-491b-952f-6d6f168c4089","resolution":{"observed_at":"2026-08-11T00:47:12.317196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.322288Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.322288Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:a4eaca0a758e1f5ca3f910f3583bc6061c3a6fa6d1ce085c327587f011333106","observation_id":"8d9cff8a-e079-4b2f-93f3-ed73883400ba","resolution":{"observed_at":"2026-08-11T00:47:12.322288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-07-06T18:19:42.946629Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-11T00:47:12.326508Z","title":"Streaming long video understanding with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.326508Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:86044b538b7ca14be5fc7ca7d5622fb9643d16c3d97dc0af3b1e7b181d156bce","observation_id":"39a8fa6e-9ea8-497c-b21c-8e2b8f6bf09d","resolution":{"observed_at":"2026-08-11T00:47:12.326508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.332811Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.332811Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:69d7de9473ee638d8cbb3427dbb99db038e1a23f4d56fc01fa4c34bf6b98bb3b","observation_id":"e2d36a86-b50a-4fac-938f-4371443238f7","resolution":{"observed_at":"2026-08-11T00:47:12.332811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.336988Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.336988Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4b06b59b8ef597a29b2a65930fb347927be1d9e23ff1ddacdcd275f8ecf3b7f8","observation_id":"c1701f76-a5c1-4331-9487-caf296513d44","resolution":{"observed_at":"2026-08-11T00:47:12.336988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.341269Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.341269Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:aecdfd6bb7417bffd3a26096734aaf59ae0c5c5fc08af26365d7dd32c7f721e5","observation_id":"59c7af4f-bccb-4e68-978c-8817061a0711","resolution":{"observed_at":"2026-08-11T00:47:12.341269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T00:47:12.345742Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.345742Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:1f69b000c611d76e233717babba91f46208b6e2ff7ed3714c9c630254feb51b9","observation_id":"6ac49e2a-8bd7-413c-bd64-1c43dcf8b128","resolution":{"observed_at":"2026-08-11T00:47:12.345742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.351149Z","title":"Ground- ing action descriptions in videos","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.351149Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:7065f27591669477bf36b4f738b9cbdcfee960536ac73a2690aa9cc53df43277","observation_id":"b08a3b39-9ca2-4c34-80ee-5658aa397b2a","resolution":{"observed_at":"2026-08-11T00:47:12.351149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-11T00:47:12.355668Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.355668Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:8a509fda1721f8d93c6d7654af08ed72932cabbb53672a0461febc99df8ebb4e","observation_id":"a3e98c36-3502-47d6-b542-48226d44bbbe","resolution":{"observed_at":"2026-08-11T00:47:12.355668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T00:47:12.360128Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.360128Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:08f713b4d561071c736b3d0beb65f551d663b4eb7607033721a4cd5d70ed5af5","observation_id":"17dbad4b-7936-4613-9729-c3849276a502","resolution":{"observed_at":"2026-08-11T00:47:12.360128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.364501Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.364501Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:49fc7a875dd97a5aa958ee96153c6ac179d2e10f0bad8116543ac0c0f8e6e4cb","observation_id":"51259c39-5220-4606-bc20-07784baa90fb","resolution":{"observed_at":"2026-08-11T00:47:12.364501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08687","last_updated":"2022-02-24T18:57:20Z","snapshot_observed_at":"2026-07-06T12:09:12.802530Z","submitted_at":"2021-11-16T18:42:50Z","title":"INTERN: A New Learning Paradigm Towards General Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08687","snapshot_observed_at":"2026-08-11T00:47:12.369157Z","title":"Intern: A new learning paradigm towards general vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.369157Z"},"links":{"cited_paper":"/paper/2111.08687","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b8452e03b7efb75ddf614e25fa0be5654330efaeb3ef4ed3c992b21f713d6b4e","observation_id":"f9bbda58-9867-4d77-ad12-18f39f3505bf","resolution":{"observed_at":"2026-08-11T00:47:12.369157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T00:47:12.373619Z","title":"Aligning large multi- modal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.373619Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:111c22375b9a34b652dd087ed2b3437bbcc32106977f102637258cc6654a4f70","observation_id":"1644b85d-d3fe-450f-84e7-f25adc439ad4","resolution":{"observed_at":"2026-08-11T00:47:12.373619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T00:47:12.378201Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.378201Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fbdc4dd4259a50df097f4d3546e777ade7d407cd4dc89d553987414b2c02f296","observation_id":"34da1976-ea7c-4349-b3f2-78c89cec254b","resolution":{"observed_at":"2026-08-11T00:47:12.378201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.382579Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.382579Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:43df1620e758d75e0baa2832e7d897746750085952b7a72cdd6ad2fabf081d85","observation_id":"2fbe6ac4-4c09-4a10-a61d-1f7bc63deb60","resolution":{"observed_at":"2026-08-11T00:47:12.382579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-11T14:34:53.675886Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-11T00:47:12.387207Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.387207Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:2090016a6c126757339894ce5972f0bbdc243cc81f366b20b0b646693f401274","observation_id":"d3958667-486e-4e66-b164-d7e9e50dd5bd","resolution":{"observed_at":"2026-08-11T00:47:12.387207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.391944Z","title":"Temporal segment networks: Towards good practices for deep action recogni- tion","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.391944Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:0d33dc912aded6510ea0f579fc3be509a9cda43814b43b205220e548fbce99ef","observation_id":"2112d1ed-6146-47f7-92ea-6bdcb1547a2c","resolution":{"observed_at":"2026-08-11T00:47:12.391944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.396143Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.396143Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:13a6e9d71e725b4168fd55d02edd2a69140aaad46be70de62fa051180fecd75c","observation_id":"ec9bd1bd-44ba-4c59-a207-49c8d7f51987","resolution":{"observed_at":"2026-08-11T00:47:12.396143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.400268Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.400268Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:ae8df3ba37810cd6302eb39e2bc5fe58440f445c23bc0c85936661df9da50763","observation_id":"950ebfcc-fe51-4d1e-b994-3a6ba25d58ec","resolution":{"observed_at":"2026-08-11T00:47:12.400268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.404321Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.404321Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:63168ba12b18238460ca9925c402fc4346a975d94a9801becefbe62c542520c7","observation_id":"74d4d335-58f0-4119-9d72-0528800240be","resolution":{"observed_at":"2026-08-11T00:47:12.404321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.408253Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.408253Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:023afbefa146f2122bd4d65a127025e85c076739b303f5de00f75befe0e66400","observation_id":"e144cf75-68db-4d8c-8b1f-f2b7b0840a06","resolution":{"observed_at":"2026-08-11T00:47:12.408253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19474","last_updated":"2024-08-23T07:20:57Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:59:17Z","title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19474","snapshot_observed_at":"2026-08-11T00:47:12.411857Z","title":"The all-seeing project v2: Towards general relation comprehension of the open world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.411857Z"},"links":{"cited_paper":"/paper/2402.19474","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6328efecbad459c43fb70a4fd404a861aa98f04a35a670db8b975257af405f92","observation_id":"5a475ba5-0bba-44a8-8f13-ad99d42f6da7","resolution":{"observed_at":"2026-08-11T00:47:12.411857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.415522Z","title":"Seggpt: Towards seg- menting everything in context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.415522Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:994e2d0e5f0c2479d2532d79c8c586d6d4da5abdd633f5dcb3737cb1064e4f48","observation_id":"7183b465-9ded-40cb-ac24-a0a124b62acc","resolution":{"observed_at":"2026-08-11T00:47:12.415522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.420144Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.420144Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:178cb470d8fca30527c3ab56543932ac23181ed81310ab4560c7695bb76e91b7","observation_id":"b9879015-eb3b-4f0e-92e7-a6d1a3500f8e","resolution":{"observed_at":"2026-08-11T00:47:12.420144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-11T14:34:48.261778Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-11T00:47:12.424055Z","title":"Hawkeye: Training video-text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.424055Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:be572acdfd37a30fd92bd8f230eb421cbeb5e8da544e8015003a80248aa29fac","observation_id":"d1d2b970-e28e-4342-86a8-428ab4a2ecd2","resolution":{"observed_at":"2026-08-11T00:47:12.424055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.428352Z","title":"Onlinerefer: A simple online baseline for referring video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.428352Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:b0aa6f5e250056c74e03fbf14d2331f643ec34f92b0f7f39b691cf12b99c77fe","observation_id":"f5828baf-26d0-4374-96a8-f28430e0b0e0","resolution":{"observed_at":"2026-08-11T00:47:12.428352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.432309Z","title":"Language as queries for referring video object seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.432309Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:5a5f6c9e6ec712a7cc85272bf8dd59b8886b6fc74ae792c640ab821c3a6db061","observation_id":"0fa3f08d-b539-4dd9-bfe4-2fd269787767","resolution":{"observed_at":"2026-08-11T00:47:12.432309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-06T17:31:18.801416Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T00:47:12.436431Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.436431Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:123ce6c3c8ff34b68ca4111f9d1f43b0943f7564477b50434473197321c4cbd8","observation_id":"88ea1575-cc00-4422-b235-a431703f2c99","resolution":{"observed_at":"2026-08-11T00:47:12.436431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.440788Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.440788Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fd024d22cbe908cfd383dbc921d8d50bdcc8b93c19267583c421da4b5c98fb23","observation_id":"4ad712a8-de74-4069-91b1-a9578a193cfe","resolution":{"observed_at":"2026-08-11T00:47:12.440788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.445447Z","title":"Videoclip: Contrastive pre- training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.445447Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:0de53cf18f2a1400afb8ea33166ce73959aaad3e34e24ad6209b8dea4794e060","observation_id":"3ddf5ce7-84dc-42d3-8609-cc57bdfe64fc","resolution":{"observed_at":"2026-08-11T00:47:12.445447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-11T00:47:12.450250Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.450250Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:219f4ca6ec15bf3ba088ed0e04edec9c38a9d3ed42ea7703f7e4bc783b74c5ca","observation_id":"b0326a83-5692-4b07-a186-e7fe06aba81e","resolution":{"observed_at":"2026-08-11T00:47:12.450250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.455596Z","title":"Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.455596Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:4533b8cff16c2a02615dee94b46d131adff0677e088846b679a60c4dd971efbc","observation_id":"642dc38d-2816-4dc2-b509-2e43aa7a8eca","resolution":{"observed_at":"2026-08-11T00:47:12.455596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-06T00:46:55.995575Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-11T00:47:12.459953Z","title":"Video-text mod- eling with zero-shot transfer from contrastive captioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.459953Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:ddeb23b79d3dcbdf0fa381706d78cc8dece1e2e6a73ca704e803cd3deeee5238","observation_id":"33e06ae5-572b-4d9c-9a21-50afbc3fc684","resolution":{"observed_at":"2026-08-11T00:47:12.459953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.464454Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.464454Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:fcf2c8639f99cc708e3b1192bd6cf516eefb226a865b5d80fb6ad1def4160e5b","observation_id":"52dcc8d0-e514-4265-abb9-3f22a5911a0d","resolution":{"observed_at":"2026-08-11T00:47:12.464454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.468728Z","title":"mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.468728Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:760c26cd08564fe0721add8a711d25b52d5cae3df8aed4fa25fe5a11cff52f89","observation_id":"bb85984f-c062-49d6-aaa2-f2dfe3d3d98d","resolution":{"observed_at":"2026-08-11T00:47:12.468728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.473590Z","title":"Merlin: Empowering multimodal llms with foresight minds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.473590Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:c6985762606f0ded40d0cbbe9ddb47799a99ae365a0ee135df1688b7650fed82","observation_id":"13197f99-7de3-49ea-8b23-66128b57d23b","resolution":{"observed_at":"2026-08-11T00:47:12.473590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.478410Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.478410Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:8c4dd7580b40a6e955363052922d1587437cddecf7942a47ba98fc38bee68e89","observation_id":"c9399eb5-9bae-4a8a-b799-c04f20dd3c4f","resolution":{"observed_at":"2026-08-11T00:47:12.478410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.482453Z","title":"Mattnet: Modular at- tention network for referring expression comprehension","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.482453Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:59cb90b0f92cc05558c3efaa213f44f2a168600ad6d9317bf7914dc564d563c4","observation_id":"8789c826-b9f5-461e-b2cf-73d5383661ee","resolution":{"observed_at":"2026-08-11T00:47:12.482453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:12.486338Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.486338Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:70566438cdf82de76aeabedf41450211d01c0ed68eca70d80ee6dafdbcd1dc81","observation_id":"bf830b6e-aec6-42a2-af31-67bb9de7d17f","resolution":{"observed_at":"2026-08-11T00:47:12.486338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:14.006602Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"a7a15065-5dbc-421b-96fb-f853d8dd45fb","year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.490079Z"},"links":{"citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:baa95cd174b357e26428b1354e65ac01a3921cc95ddaea558c41f7834dad3327","observation_id":"f6f89742-adc7-4844-b86d-f59213dfa980","resolution":{"observed_at":"2026-08-11T00:47:14.010847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:35:14.893410Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":145},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 4 inbound Pith citation observations for arXiv:2412.19326."}