{"as_of":"2026-08-08T15:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d427d3ca6513cb14b08d9109d99f782b202c0eaf883280e872f0a55fe5960829","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:51:44.389472Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17423/citation-record","integrity":"/paper/2505.17423/integrity","json":"/paper/2505.17423/citation-record.json","paper":"/paper/2505.17423"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:51.928539Z","title":"Guidelines for Human-AI Interaction","venue":null,"work_id":"dc5995b1-3577-47ba-a857-ff442fa90842","year":2019},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:39.511041Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:b7c20d5f48837e29d46ecad69f18c9aaa8f52c2faedbe9ed9562302bf0ff7153","observation_id":"49220b88-9493-4178-bf8b-d0f7a271e0ac","resolution":{"observed_at":"2026-08-07T14:51:52.030966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:51.663754Z","title":"Interactive machine learning for health informatics: when do we need the human-in-the-loop?","venue":null,"work_id":"5b38457e-19da-40e8-a906-d2a3c72ca0da","year":2016},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:39.600983Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:33b0dff7b2815ef3a04ed74718679f8c46b09cb8fe024322ca1c638dfac1e103","observation_id":"a9172750-c9af-4489-bae2-c78f5ea2f04a","resolution":{"observed_at":"2026-08-07T14:51:51.792252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:51.473362Z","title":"Accelerating Human-in-the-loop Machine Learning: Challenges and Opportunities","venue":null,"work_id":"fc18e852-372e-429f-a2fc-c9b7923ba174","year":2018},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:39.716868Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:ea0399b458d0f0cc05eb8698805cb223c08530dcb8f4b9c342efbb237a075d81","observation_id":"9fbd5389-dd34-42b1-bb09-026050f5adc2","resolution":{"observed_at":"2026-08-07T14:51:51.554860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:51.357315Z","title":"Is human oversight to AI systems still possible?","venue":null,"work_id":"e039feed-3e22-498b-b250-8fa49757e1b0","year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:39.830627Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:97ab6671820cdd73442a7e881bf96516464fb082f815bd1e16093ff43c79a3c9","observation_id":"90cebc33-f8af-4f92-8e31-b9f5e9c2ac14","resolution":{"observed_at":"2026-08-07T14:51:51.386036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:51.228199Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"70e14312-d03f-43ec-8091-1bd42b17e71c","year":2016},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:39.920292Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:a17b20a46271fff0424c251cc5ff7445a6924564a2bb31275cbe7d9f6bd37b97","observation_id":"e81406be-37a8-4b30-8a71-fb371207192e","resolution":{"observed_at":"2026-08-07T14:51:51.304695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:51.004980Z","title":"VaTeX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research","venue":null,"work_id":"84d3820c-75ba-40be-aac4-6577dd46c319","year":2019},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:39.999548Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:5fdf3107af53b5c7be7e0807d30575b9e4c4f00adec059fc8d620510c5689271","observation_id":"ae3e5244-84f4-48f0-a8f6-680217e8fdf5","resolution":{"observed_at":"2026-08-07T14:51:51.141413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:50.722276Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","venue":null,"work_id":"d9fb6d2b-ec86-4b8a-a106-829e2de73f7f","year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.085169Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:ce5cb51aee2abd4388d92c0db713e0a31a8d551a3d31594c9ac17ad3576e0969","observation_id":"719113d0-51aa-4297-b4f2-267cfe8784b7","resolution":{"observed_at":"2026-08-07T14:51:50.882596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:50.508680Z","title":"Spoken moments: Learning joint audio-visual representations from video descriptions","venue":null,"work_id":"1376a9c3-7daf-4a42-bca5-17a38cf64b52","year":2021},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.232182Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:f6d598738b3d73293b42015ed45f1d509ff8b79caa6b7f85c04ce98304c7bebe","observation_id":"5bd27a9e-2d9f-4c79-878b-ad8cead6cead","resolution":{"observed_at":"2026-08-07T14:51:50.606412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-07T10:46:08.274157Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-07T14:51:40.343560Z","title":"Tishby, F","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.343560Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:d35dd2e8d875de02cc86eb4490edd2ab00c513b2b865cf5854e20e775621c2de","observation_id":"8d251635-e99c-4bc4-a15e-e31ffdcd0149","resolution":{"observed_at":"2026-08-07T14:51:40.343560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:50.308935Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"4f74aac4-77a4-4e96-8de6-5d1b6c5dc620","year":2024},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.467881Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:a6eca9a0305845f9e8944d33d92eb9ceff62b4b8e3bc8ff56fee34c20daf7075","observation_id":"ec8a3853-1f31-4d01-aca9-1d8173b75dbf","resolution":{"observed_at":"2026-08-07T14:51:50.397693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:50.131703Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for video reasoning over traffic events","venue":null,"work_id":"4b125814-9d4e-40d9-90e0-ae2d86f286b0","year":2021},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.590922Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:6d2319acbe88afd8f64e3363588178b04b75117f3d35b3f02c3eee30e20dfe43","observation_id":"bbdcb7b3-e7c3-475c-a4b4-1961cdc9063c","resolution":{"observed_at":"2026-08-07T14:51:50.238310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:49.965139Z","title":null,"venue":null,"work_id":"0569beba-f5a6-406e-8f76-069e8068b537","year":1983},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.677382Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:2fe3d1401316a4df9546dc2aadce2e8533f24d1432bb1e03ad78ea18f494fc87","observation_id":"44416897-5462-4e49-8832-5d7784d9b0fa","resolution":{"observed_at":"2026-08-07T14:51:50.057142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:49.816047Z","title":"Video Question Answering via Gradually Refined Attention over Appearance and Motion","venue":null,"work_id":"6d56ba7e-d383-4b3a-bdf8-cd0aeff5ae38","year":2017},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.851746Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:563e2a65bf4d793eca0aeeaaee1d549579750d3b8db373a6f84e3fd4b670a504","observation_id":"9c6ec737-306a-4ba6-935b-25cd33f882c2","resolution":{"observed_at":"2026-08-07T14:51:49.881862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:49.631249Z","title":"Zhong, J","venue":null,"work_id":"1c1ef656-cc85-4410-8ce0-37bd472ab1de","year":null},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:40.994197Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:9cab83ef70a937da91f4a5e72fc828e652ef6fce19ed831236aac95e614603f0","observation_id":"688cffe1-9477-4b68-8ce2-f2750817840c","resolution":{"observed_at":"2026-08-07T14:51:49.687275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10513","last_updated":"2024-11-25T17:04:20Z","snapshot_observed_at":"2026-07-06T19:51:09.829522Z","submitted_at":"2024-11-15T17:44:27Z","title":"Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10513","snapshot_observed_at":"2026-08-07T14:51:41.239819Z","title":"Any2Any: Incomplete Multimodal Retrieval with Confor- mal Prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.239819Z"},"links":{"cited_paper":"/paper/2411.10513","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:574c1981be274b6fece8b0b742c2e5f4bb86eaba3c5b5507c12567bc727a1b03","observation_id":"fd53eb52-d8d4-49b4-a34a-98a4b99111d7","resolution":{"observed_at":"2026-08-07T14:51:41.239819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:49.455380Z","title":"Exploiting Distribution Constraints for Scalable and Efficient Image Retrieval","venue":null,"work_id":"0f7d62f9-062a-470a-92c0-8ae889c61099","year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.352489Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:40db5bfa6889d2e94d02794c3af17fb625fd6dd21f72bc66f3be653ae567db23","observation_id":"f43473e9-3224-440a-95ab-f8ed8b93e761","resolution":{"observed_at":"2026-08-07T14:51:49.544848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:49.260618Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"82899959-6cd8-4e48-912c-a80484b1a055","year":2004},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.515962Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:a08e9f043627e4606bf1ca4477df635638bdc400e2c0b6ac0b4c1c0b2575af0d","observation_id":"4fbc5f13-c389-422f-be2b-21b2b91b6de4","resolution":{"observed_at":"2026-08-07T14:51:49.340276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:49.094457Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"ed1242f4-57f4-488a-9a5c-7c77d9e4461e","year":2002},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.631047Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:e6d13ceab547b63a095c406913ab915b85a3ddbbf12917948412147f480ddde3","observation_id":"635206b1-81ba-4f35-9c00-0d8f011aea03","resolution":{"observed_at":"2026-08-07T14:51:49.163779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.935700Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"12e85a2e-5242-4728-979d-29009c6465e9","year":2015},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.740626Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:453861ee74c95da79321e3fcc2ee8abbdd34c65064bcf5d98c9adabdc9232381","observation_id":"a07e2bdc-1dae-4354-b442-8739e3c721b7","resolution":{"observed_at":"2026-08-07T14:51:49.009383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.818105Z","title":"Information-Theoretic Distillation for Reference-less Summa- rization","venue":null,"work_id":"040568ca-ff16-4e78-9af0-ff110e6e4b3d","year":2024},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.826266Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:0cc3bcff78e3eaa157b210f0c7371e267dea8f639054bc60924ac2e24cbf3565","observation_id":"6c0edb5d-f4dc-4c8b-9032-4984865cfcd4","resolution":{"observed_at":"2026-08-07T14:51:48.865981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.707690Z","title":"Human-agent cooperation in games under incomplete information through natural language communication","venue":null,"work_id":"b075a02f-2a68-4ad5-8db4-74d1be6daa73","year":2024},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.939869Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:0a1ee71af3ed3fcea6baa52df1c58c997655df1eb5e7f6db14ddcda19d1ad07f","observation_id":"4c48bba6-a395-4c41-b72b-e73fc1c4f414","resolution":{"observed_at":"2026-08-07T14:51:48.755572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.554690Z","title":"Comparing automatic and human evaluation of NLG systems","venue":null,"work_id":"9f10416d-9acf-41b8-b94a-a95d9299227d","year":2006},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.043294Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:e2a9407be444c285eebdb0f967349807d31d4cf895b79fc2b83c81b408359b08","observation_id":"bc2e319b-7f77-4d25-8ccc-def1e4b99808","resolution":{"observed_at":"2026-08-07T14:51:48.624370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.431608Z","title":"Can machine translation systems be evaluated by the crowd alone","venue":null,"work_id":"f12a9d3a-da19-48d5-9708-62e8ffe2e874","year":2017},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.137460Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:660bc9850c016208ff2b24f1432d3f37e70384dcfa48caa57ebdb9ed215a9f23","observation_id":"c0231c56-a143-45c3-8ddc-379b9aa2c2b4","resolution":{"observed_at":"2026-08-07T14:51:48.481949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.281494Z","title":"Automatic summarization","venue":null,"work_id":"600c7c9b-0dc1-4048-a67c-5c7de92600e1","year":2011},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.217373Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:16cb52b0ab098427f241afa47b12d443fabd912ef1de0186c7d4abeafeb5f55b","observation_id":"21a8f900-77f8-4510-b260-485b58be59be","resolution":{"observed_at":"2026-08-07T14:51:48.347022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15044","last_updated":"2023-05-24T11:34:39Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T11:34:39Z","title":"Is Summary Useful or Not? An Extrinsic Human Evaluation of Text Summaries on Downstream Tasks","version":1},"cited_work":{"arxiv_id":"2305.15044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15044","snapshot_observed_at":"2026-08-07T14:51:44.879118Z","title":"Is Summary Useful or Not? An Extrinsic Human Evaluation of Text Summaries on Downstream Tasks","venue":"cs.CL","work_id":"63b76c11-66b4-4f94-bd32-dbee1722aa8c","year":2023},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.332451Z"},"links":{"cited_paper":"/paper/2305.15044","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:feb47dbdb985590fd94c52f83996e6cd2989279819d2cae975c302127b2da4b0","observation_id":"a06ab028-05fa-4991-bfef-bce0ac788a22","resolution":{"observed_at":"2026-08-07T14:51:44.915230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:48.130109Z","title":"The speed-accuracy tradeoff: history, physiology, methodology, and behavior","venue":null,"work_id":"46ad5804-a3cc-4289-b090-dd8b80450b72","year":2014},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.450453Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:1389a289962cf0eaef7a824f3772c05d869ade8c4e119fa2f282ae4082214be9","observation_id":"8a2d31ab-69cb-4d45-bbb7-c9731bcdd86b","resolution":{"observed_at":"2026-08-07T14:51:48.198032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:47.954279Z","title":"A cortical information bottleneck during decision- making","venue":null,"work_id":"8613dd9d-0492-4925-aac7-fc23e8f67f47","year":2023},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.560533Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:00c4149e2c144d20e5f700220df6376e89cfeb57a90694e738b8d04e565492fb","observation_id":"e658a2f7-22dd-48dc-a1ea-55652148f237","resolution":{"observed_at":"2026-08-07T14:51:48.035567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.07405","last_updated":"2019-09-20T16:39:51Z","snapshot_observed_at":"2026-07-06T08:22:13.221343Z","submitted_at":"2019-09-16T18:00:24Z","title":"BottleSum: Unsupervised and Self-supervised Sentence Summarization using the Information Bottleneck Principle","version":2},"cited_work":{"arxiv_id":"1909.07405","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.07405","snapshot_observed_at":"2026-08-07T14:51:44.713918Z","title":"BottleSum: Unsupervised and Self-supervised Sentence Summarization using the Information Bottleneck Principle","venue":"cs.CL","work_id":"c2d1b5fe-cae3-4b10-ad6d-da984ed21d75","year":2019},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.676433Z"},"links":{"cited_paper":"/paper/1909.07405","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:812c27d0e4f6d3aad3f1792a1f0efa716c59486f3697a11b3871656123525d33","observation_id":"02eb5440-324f-439e-a76f-29796b020e4b","resolution":{"observed_at":"2026-08-07T14:51:44.767295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05511","last_updated":"2022-06-11T12:12:20Z","snapshot_observed_at":"2026-08-07T13:01:53.600360Z","submitted_at":"2022-06-11T12:12:20Z","title":"Improving the Adversarial Robustness of NLP Models by Information Bottleneck","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05511","snapshot_observed_at":"2026-08-07T14:51:42.792706Z","title":"Improving the adversarial robustness of NLP models by information bottleneck","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.792706Z"},"links":{"cited_paper":"/paper/2206.05511","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:53c61feb75fc1714a063b3e1b71717eccb63a1d0e0321e5d694701f884e91161","observation_id":"a572c567-f59f-4d07-ada3-de646ceaa9f6","resolution":{"observed_at":"2026-08-07T14:51:42.792706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:47.820937Z","title":"Applying the information bottleneck principle to unsu- pervised clustering of discrete and continuous image representations","venue":null,"work_id":"91212d8d-7e3a-4964-9055-13f7ebf2846f","year":2003},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.899810Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:b35acf375785288d93c4c05f793e7a76daa63f720dfd857e10bbed3164c3a805","observation_id":"5f596466-14aa-4343-b049-6c9c5572b1f6","resolution":{"observed_at":"2026-08-07T14:51:47.873003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:47.681704Z","title":"Deep learning and the information bottleneck principle","venue":null,"work_id":"1e2aa128-3837-47ef-9d0c-2772eb2358db","year":2015},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:42.980157Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:cba288f2bb8ae5c9a990f0fe4941ab60212cfc86e3c38b37de91e9d18b75f604","observation_id":"a2f0dbb8-e2d4-4ec2-9d08-c9bb25fc20a9","resolution":{"observed_at":"2026-08-07T14:51:47.742369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:47.485027Z","title":"How does information bottleneck help deep learning?","venue":null,"work_id":"5c0c0930-8ebe-46c9-9501-ec43533b8405","year":2023},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.074134Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:554486557ed3fc4278acb26c357569956f66c955005c848b9affa1a3aeefca8f","observation_id":"d085b73a-65a4-47e9-b1c9-67849d236ac4","resolution":{"observed_at":"2026-08-07T14:51:47.601357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:47.240894Z","title":"The information bottleneck problem and its applications in machine learning","venue":null,"work_id":"b242677a-a8b6-497c-ab39-f8184b85ee4f","year":2020},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.144699Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:1c409c3b9d0b7f34c381d04e9a41fb63b3ae358c8deb5578fe2bfb01b93b29ac","observation_id":"2722d7c5-b8b4-41dd-bca7-9d1a3c4afdea","resolution":{"observed_at":"2026-08-07T14:51:47.348736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:47.055188Z","title":"Multimodal Information Bottleneck: Learning Minimal Sufficient Unimodal and Multimodal Representations","venue":null,"work_id":"1610c9fe-bc6a-4d67-809c-b9f9017d40da","year":2023},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.260012Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:891dc857b0cf798d78f0fc4f7c28b5b446aa2aade80cce67262de7dbf1422dd4","observation_id":"8377f2c6-eb7a-47b5-a033-9870c034560a","resolution":{"observed_at":"2026-08-07T14:51:47.145279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:46.881894Z","title":"Representation Learning In Deep RL Via Discrete Information Bottleneck","venue":null,"work_id":"4c1d2738-c116-40d3-8e8b-c95d96747e92","year":2023},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.364681Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:da8fe5ac817e3ef4479e6dbe6c71fa5f4440a1ba79ed89d72ac469708ea37ca0","observation_id":"701f31b1-cca4-423c-a7bb-95142e37a07b","resolution":{"observed_at":"2026-08-07T14:51:46.971772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:46.732044Z","title":"Normalized (pointwise) mutual information in collocation extraction","venue":null,"work_id":"bfab0bdd-6bcc-4c52-b424-903faa2a0892","year":2009},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.424240Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:81cb598b61af58e672eddf88856201d405ca125d5899c6446013248464c8574c","observation_id":"d3017a8f-982c-4ad0-86cd-c280f85bdb02","resolution":{"observed_at":"2026-08-07T14:51:46.807982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:46.543914Z","title":"Term-weighting approaches in automatic text retrieval","venue":null,"work_id":"c6a7af03-52ba-4092-9c51-f32abba7c88f","year":1988},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.478606Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:d22175a3f437bdeb28b2f7fae85622e2514484345e17b215f204b4ceacb72fc0","observation_id":"0a5fb7f4-6494-4f28-837a-5dbd215f3588","resolution":{"observed_at":"2026-08-07T14:51:46.634865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:46.400748Z","title":null,"venue":null,"work_id":"95459089-8b8c-40a0-adbd-83a6da9f7f85","year":2004},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.569750Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:3418af7d7798b146d95987b2c77206d8d9c6bbfb45199bbba6d18ead6635fe75","observation_id":"fda0405d-34fc-41e7-9d8d-e241b3898cd6","resolution":{"observed_at":"2026-08-07T14:51:46.451367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:46.256524Z","title":"https : / / github","venue":null,"work_id":"0afbf394-887c-4726-b6fa-0be5effb4ed1","year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.658755Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:f3dc7a5ec66e242c8dfa89c7b2e8e0b76058ba553add304e4d1512058011b74b","observation_id":"99be6e40-865f-43e3-ac3b-8247af8f3bc0","resolution":{"observed_at":"2026-08-07T14:51:46.311668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:51:43.722400Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.722400Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:84430ae52830a331eb2b3127f4c76ff5b692f236985d67dee218e05c777340d1","observation_id":"f77a0f09-33ac-46a7-8c72-3ae712cc69b4","resolution":{"observed_at":"2026-08-07T14:51:43.722400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:46.113818Z","title":"https://github","venue":null,"work_id":"42586e27-b044-4766-956e-627e7ad284ac","year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.806364Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:4a5f01761a06beb125f8bdf927322e14eb862fa3201a09ea5493eb1606209ced","observation_id":"8891bb47-ca2b-4fbb-8724-1cb6697ffb79","resolution":{"observed_at":"2026-08-07T14:51:46.166650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:45.916589Z","title":"Prolific. ac—A subject pool for online experiments","venue":null,"work_id":"20025965-a3b4-40c1-b73d-25e0fb0ae6a1","year":2018},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.882000Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:e3c8db8d24b56b497f62b7d974f5609cf2689105e051248da661b26754ea1df8","observation_id":"b4a3af8c-9014-46e7-ad9d-b443c6608905","resolution":{"observed_at":"2026-08-07T14:51:46.028072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:45.667089Z","title":"The proof and measurement of association between two things","venue":null,"work_id":"5ae48667-95c1-45b5-9cae-97f1e6e9c64a","year":1961},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:43.952145Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:b694048efacdf6778388bbc532db3226d02120fab74a18cfe268e1971b74a7d6","observation_id":"27160cff-ad73-448b-a068-c9b1d1b73cd1","resolution":{"observed_at":"2026-08-07T14:51:45.787163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:45.356041Z","title":"RouteLLM: Learning to Route LLMs from Preference Data","venue":null,"work_id":"a99458e6-2d91-4f64-8594-52d36d4c3633","year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.049142Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:928cfcd4b0922327225a2aee93eff99aed48b9a52b10ec652bcb0ee8dd6f2cf1","observation_id":"b64ab7bc-8688-4793-82c0-d3f2ceca322b","resolution":{"observed_at":"2026-08-07T14:51:45.480937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:45.149766Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":"e9367968-df3f-4658-88cb-558c024d186e","year":2022},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.109370Z"},"links":{"citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:5b3cf7b79652226debf1a0c88eac1884fb37bba469cbb98b21875182a8e3bfe8","observation_id":"52266535-f053-42f1-90b2-cc140e37dad4","resolution":{"observed_at":"2026-08-07T14:51:45.226000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08570","last_updated":"2024-02-13T16:14:32Z","snapshot_observed_at":"2026-07-06T17:29:34.813390Z","submitted_at":"2024-02-13T16:14:32Z","title":"Online Foundation Model Selection in Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08570","snapshot_observed_at":"2026-08-07T14:51:44.173717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.173717Z"},"links":{"cited_paper":"/paper/2402.08570","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:c869aac3d970b8ac0faabc88620d538d4f007afe1616d94ff2cfbd6cce82a564","observation_id":"984a2508-16a6-48a2-8c3b-a86fa09c1829","resolution":{"observed_at":"2026-08-07T14:51:44.173717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:51:44.270249Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.270249Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:18c3e203c01989f30ca06175fd2c034c833df78432cd1d8afed8bf49a2387d3f","observation_id":"822023ef-72e4-4818-a6fb-0a8c6d76f737","resolution":{"observed_at":"2026-08-07T14:51:44.270249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:51:44.389472Z","title":"self-supervised learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.389472Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:f5d94f5038c06325c2de852a69373c28f22a31ff88038580038704158d839978","observation_id":"316e5b31-197b-41f0-a4a1-8706a1e0a564","resolution":{"observed_at":"2026-08-07T14:51:44.389472Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-07-30T11:11:52.165985Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-07T14:51:41.113713Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:41.113713Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:eac4427a7ee1d34728f8fe434c10190855a92aa2fbbaa09dacccef14e6192754","observation_id":"3f4b82f5-3fb3-4486-8689-5137f6397767","resolution":{"observed_at":"2026-08-07T14:51:41.113713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:35:07.026761Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2505.17423."}