{"as_of":"2026-08-08T07:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26e869452c414afd1cbdb5bdcbbedcebdedb6f3f4c399f729c8416f9e2b9e37f","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:54:26.160193Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T19:27:29.843866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T20:50:17.341265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"cited_work":{"arxiv_id":"2506.09445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09445","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toga: Tempo- rally grounded open-ended video qa with weak supervision","venue":null,"work_id":"85ab639a-924f-4916-a6a7-0a2e42dc9efb","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2506.09445","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:af04c8c0169985f62d32de8cb4dcaa3cd6603dc9b9e6126e542ea92e4c24ff92","observation_id":"6d894c32-3ecb-45dd-a86a-c6762ad69e19","resolution":{"observed_at":"2026-05-15T20:50:17.342680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09445","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":"https://doi.org/10.48550/arXiv.2506.094454","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2506.09445","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:674c918d8c2c7449c871fd1df9bc446f7ac8a3576b20f46c3e58f23302d8d2f0","observation_id":"23dcea82-4846-49e1-aa59-a48588907cf1","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09445/citation-record","integrity":"/paper/2506.09445/integrity","json":"/paper/2506.09445/citation-record.json","paper":"/paper/2506.09445"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:34.341698Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"f4f6c56a-f8af-4e69-89ab-82dfe74cf4cd","year":2015},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:19.680017Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:df6742d994795c5edf892f4c4e644d7f307615b448ce40cc9362125061dcea67","observation_id":"295dd0d9-aa54-4642-ade9-a0719bb25b76","resolution":{"observed_at":"2026-08-07T04:54:34.418059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:34.324460Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"e42f7dfa-e4e6-41ef-b737-f5fa4a28a508","year":2011},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:19.778807Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:ff1e3aab60edbefd6755e80c4c399e8cbef4a715d16e0acb6d5ea593bbe86f99","observation_id":"dbfd2f08-e292-4686-afd5-270197474f72","resolution":{"observed_at":"2026-08-07T04:54:34.333400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19392","last_updated":"2024-07-02T15:30:03Z","snapshot_observed_at":"2026-08-02T12:22:52.096368Z","submitted_at":"2024-06-27T17:59:45Z","title":"ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19392","snapshot_observed_at":"2026-08-07T04:54:19.896286Z","title":"Rextime: A benchmark suite for reasoning-across-time in videos.arXiv preprint arXiv:2406.19392, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:19.896286Z"},"links":{"cited_paper":"/paper/2406.19392","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:b716d161a519cf3d6bd473e509eb8618a8e5b31c817d605ca1cce43e060f282f","observation_id":"69255cb3-6be0-487e-900b-675897cbf0dc","resolution":{"observed_at":"2026-08-07T04:54:19.896286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:34.163647Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers, 2024","venue":null,"work_id":"3ff9edfd-b4e5-4a12-974c-2cc9e5b88410","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.016894Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:f9a207f388dd35afbf63d92cb6a2488bd00a25f72771f98618e2884bd0d5aaab","observation_id":"90400441-fc8e-40fe-9c8b-3998db443ccb","resolution":{"observed_at":"2026-08-07T04:54:34.237655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T04:54:20.167152Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.167152Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:652d7fea96f1244915a3070db14ac4d69a3e5a7b4216c34fd21fc521f35d4477","observation_id":"6185ed6d-c959-4901-950d-7ca6a72578a8","resolution":{"observed_at":"2026-08-07T04:54:20.167152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.997123Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"569ec65e-a37c-4db6-b457-63cf13ee3a60","year":2015},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.270167Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:0c1efc67da943534802485e99cb652c137855bfb957d7186840f9b8b90414373","observation_id":"d8b9c55e-899b-4743-a83d-9e8ca37bae95","resolution":{"observed_at":"2026-08-07T04:54:34.076786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05162","last_updated":"2023-01-07T20:25:05Z","snapshot_observed_at":"2026-07-06T09:03:52.921188Z","submitted_at":"2020-03-11T08:42:57Z","title":"Video2Commonsense: Generating Commonsense Descriptions to Enrich Video Captioning","version":4},"cited_work":{"arxiv_id":"2003.05162","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.05162","snapshot_observed_at":"2026-08-07T04:54:26.379436Z","title":"Video2Commonsense: Generating Commonsense Descriptions to Enrich Video Captioning","venue":"cs.CV","work_id":"0df3d060-55cb-469c-b598-020684d8319a","year":2020},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.381417Z"},"links":{"cited_paper":"/paper/2003.05162","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:95030a7506bb06a0e7405fbf7b161c29356073cc79eb6d3e5767e31e6fe0dd09","observation_id":"398bbdde-d18c-4de5-b979-78f40a9cd347","resolution":{"observed_at":"2026-08-07T04:54:26.479918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.879233Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"3430e5ca-2ac5-462d-85d0-df74f36b00ca","year":2019},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.482759Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:69e10206ffd2ae2a203d794ac143813a092067526e65dab7cbbd6d81d8a3fcb7","observation_id":"f88788a8-7de8-4a93-a3c9-6c1371b03331","resolution":{"observed_at":"2026-08-07T04:54:33.931610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.766813Z","title":"Knowit vqa: Answering knowledge-based ques- tions about videos","venue":null,"work_id":"a318e65a-e1ed-4f6c-b1ec-c5fd0814879a","year":2020},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.615316Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:2425f946b006622b7290721a2ced26ee186a485c8a3ede0be3c7d844eec73ee3","observation_id":"1df26929-12ed-4478-9ee8-ccdb9c334890","resolution":{"observed_at":"2026-08-07T04:54:33.818123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.649645Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering.Int","venue":null,"work_id":"ad9a1f41-53b8-494f-85a5-e9b26c25f618","year":2019},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.738505Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:4c20132e4308dd2c769ad621b92c76591c78cb486df787fee8bc1a32b756c5b7","observation_id":"8df026c7-8c35-489e-b126-318d61e725f8","resolution":{"observed_at":"2026-08-07T04:54:33.693793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.514345Z","title":"Question generation via overgenerating transformations and ranking.DTIC Doc- ument, 2009","venue":null,"work_id":"040166c1-f850-4d5c-b041-f25334551914","year":2009},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.848575Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:674b91d6b8f6c4544a31d638c265236d90492759db09d1ddb94460460a897541","observation_id":"842d6db9-0eb5-4b53-80ff-7aa67f8fdd71","resolution":{"observed_at":"2026-08-07T04:54:33.567100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.358935Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"f6719e11-1f87-4c7f-9f07-9ed4211e6e66","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:20.961326Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:4c0014d8b9d4b17960900c83f5dbef8a366e79a42da18199a5603d822a36d1da","observation_id":"13654fdb-269d-40ae-ba16-66444ae84746","resolution":{"observed_at":"2026-08-07T04:54:33.428533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.254885Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"739da963-8208-4a97-9c4d-04462c3ef634","year":2017},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.132050Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:dde9e7fe7e3c54f89e5e8ba3606f25f43a7217fb696bc4829cfa7dff47167adb","observation_id":"abf0ed84-e72e-40fa-9906-adf2804bde05","resolution":{"observed_at":"2026-08-07T04:54:33.312863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:33.107841Z","title":"Video question answering with spatio-temporal reasoning.IJCV, 2019","venue":null,"work_id":"db9fef5a-303e-4ade-9c9a-c61040760ad1","year":2019},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.220455Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:d18f6d436e6fe2d034fcb4e031b18a4a7d378f953bee7d7fe36b098152d5cb1e","observation_id":"6a85ecbe-79f8-4846-9e38-94921541bd3d","resolution":{"observed_at":"2026-08-07T04:54:33.164247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:32.989680Z","title":"Video question answering with spatio-temporal reasoning.Int","venue":null,"work_id":"60eba0b7-f0ad-48a3-b99b-73b4f6184881","year":2019},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.342540Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:36fb7723095d7519e4546da9450870ddeb2e5f96805736a5ad600821c2bb302c","observation_id":"17d00146-0b54-4bb2-a0c2-c15f28ee0375","resolution":{"observed_at":"2026-08-07T04:54:33.052950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:32.788080Z","title":null,"venue":null,"work_id":"d3c5c6dd-7244-44e0-b3f1-7eefe84b2383","year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.453425Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:54f21181fa5c4f21e7be0ef1f5e7a5827f45cd08d4119e5f5bab7f03c9c8b2f8","observation_id":"396bfc1d-bd7f-46a5-9bdc-f94a35de442d","resolution":{"observed_at":"2026-08-07T04:54:32.896787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-07-06T16:47:17.136168Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-08-07T04:54:21.541697Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing.arXiv preprint arXiv:2311.08046, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.541697Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:2625f7d027374ebb9f1daa7e02fb3151450adff9fe6e0bd2ebfedc286d81f173","observation_id":"989df242-7993-46d1-956d-025e065fe126","resolution":{"observed_at":"2026-08-07T04:54:21.541697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:32.599651Z","title":"Slow-fast auditory streams for audio recogni- tion","venue":null,"work_id":"5a78d642-1588-4f6d-8f8a-08489b6c0df0","year":2021},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.641461Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:d7ac849ece3caad0c780b051f688c4a0d05876eda009f172cdbc0b2be1c75fa4","observation_id":"a947470e-043f-4e9f-802f-60f82cec8818","resolution":{"observed_at":"2026-08-07T04:54:32.692985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:32.420112Z","title":"Open-vocabulary video question answering: A new benchmark for evaluating the generaliz- ability of video question answering models","venue":null,"work_id":"70ea7760-abdd-4cf2-9f90-3ff788ab33b0","year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.735840Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:222f0456790ab7d58c3ce5b24458346c86305776b298c6df6cb75ac37f04dfef","observation_id":"317d255f-cf6f-4107-98aa-938d7e1a3fd4","resolution":{"observed_at":"2026-08-07T04:54:32.496952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:21.887761Z","title":"Dense-captioning events in videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:21.887761Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:b6816401bc5a3b27bc3fb283086d188febba6c3410e8d36a546129c11353a6cc","observation_id":"27941dcf-fb06-4b19-9303-447e49a28a46","resolution":{"observed_at":"2026-08-07T04:54:21.887761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:32.217647Z","title":"Meteor: an automatic met- ric for mt evaluation with high levels of correlation with hu- man judgments","venue":null,"work_id":"d94a3dfa-1b6b-401e-b5e2-02a10031a271","year":2007},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.009516Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:752bc8057476d7c0f244af6e77c7b4c2b52145b8cd1d581fac85047b9cab8038","observation_id":"6c7564c8-9381-41f9-a311-96fe165a6d9b","resolution":{"observed_at":"2026-08-07T04:54:32.293998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:31.976335Z","title":null,"venue":null,"work_id":"8008150c-80c0-4f70-be4b-461e4b571ec7","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.113233Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:e263a9c11ce41fc8891925bd5d92a61412c5f6a1bccf23e9eaab0177f6f0028c","observation_id":"0a497587-db97-46b0-9033-2e8a78d6e4ea","resolution":{"observed_at":"2026-08-07T04:54:32.079746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:31.804298Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":"9ff4110e-9b9b-4bd5-970b-1bcd2663faa7","year":2020},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.180864Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:18e54bdf6887f378dd0bc476752e95844ea2351ddf815713c6661654ac7ed545","observation_id":"7a3d4347-22c3-45f6-b5e3-5d413ca918bc","resolution":{"observed_at":"2026-08-07T04:54:31.878707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T04:54:22.296324Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.296324Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:22dc4ef7112a80420de950569cb4511b533a258ebc5f1e3ff77df31c5aef6bf2","observation_id":"dafab7fb-eddf-4b09-a8f5-610c60bdfd5c","resolution":{"observed_at":"2026-08-07T04:54:22.296324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:31.648287Z","title":"Equivariant and invariant grounding for video question an- swering","venue":null,"work_id":"3374ae06-fe40-40d9-a086-53a51db1989c","year":2022},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.418442Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:83b243ae8d121130ab22f4471165b91242d96b5ab0b896373afc8930ecee5462","observation_id":"4e198a4e-1809-45a8-b7bf-6613d7c96de8","resolution":{"observed_at":"2026-08-07T04:54:31.721168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T04:54:22.532998Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.532998Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:6257200ca413b66bc01995b41bbc73e053406159bb603038a70e313fe065a927","observation_id":"75daa1ab-0f59-4c5e-956e-4b331188f5b0","resolution":{"observed_at":"2026-08-07T04:54:22.532998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:31.516580Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"6f26d4e8-c361-4fc2-9e0d-06836ea9ac98","year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.641056Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:b953c7ce1616f120cdad2997ef91499d4d8689585f88182ee63c67593f161b7b","observation_id":"9ebd6a51-b375-459c-9fd8-2d3e7399286d","resolution":{"observed_at":"2026-08-07T04:54:31.584089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:54:22.723878Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.723878Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:4a3365cd5f4e91b2c83f21514775f20d7695df5f748e4e4c8cc884dd1f55226a","observation_id":"d6b62272-aa05-49f2-ab5c-7b48a399a281","resolution":{"observed_at":"2026-08-07T04:54:22.723878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:31.310207Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":"1ca7503a-807e-4480-9df0-d0502e3b71d0","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.833731Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:7288690b91fdf0b52464ee8649e7010a301f1b83744a1e8beae1c4c150fa53dc","observation_id":"19ff832e-c4df-4b85-97a6-f8774ebcc7b1","resolution":{"observed_at":"2026-08-07T04:54:31.384271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:31.105702Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval, 2024","venue":null,"work_id":"8890b9fa-cf64-42a5-a535-39b987cf06fa","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:22.955323Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:693e1244eb399496f72be42eb7e33dcc9a758d622d5eb70e6935ed89a94c11f1","observation_id":"4f627028-808f-422f-810c-eca3d299bd70","resolution":{"observed_at":"2026-08-07T04:54:31.189409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:30.887640Z","title":"Exploration of masked and causal language mod- elling for text generation, 2024","venue":null,"work_id":"2b4fac67-c02b-4402-8508-5b57587c0180","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.062143Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:9c92a93da69e868a0fb832395d0891d4923f0836cba1ee8719e3cfe5de6e918c","observation_id":"64856e89-4e94-41d9-8ee4-9d815b6b4fc7","resolution":{"observed_at":"2026-08-07T04:54:31.013217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:30.745043Z","title":null,"venue":null,"work_id":"e8617559-f0c7-4122-9649-be911a9930f3","year":1995},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.139081Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:b24299059169b091481e2b7f50b0d4ca007294ab7853f672ed2b13c3c1fc325b","observation_id":"309208f7-276d-4872-aad0-e50276115ceb","resolution":{"observed_at":"2026-08-07T04:54:30.811022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:30.561064Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"17950909-0805-4878-8410-64280f05bc0d","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.238338Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:2ce0c4fbc97c434d5de5a80e8198fdc085e2db0bbea9af10cf094fba98ab678e","observation_id":"2b130726-f460-4ba1-a023-f63a332b68aa","resolution":{"observed_at":"2026-08-07T04:54:30.641711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:23.322717Z","title":"Streaming long video understanding with large language models.Advances in Neu- ral Information Processing Systems, 37:119336–119360,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.322717Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:2568b86b39c2c4eedcc6ac457ed51ff0524d5e60295d73040e734ca28268df0c","observation_id":"dcc712b2-7a5c-4c81-b8c9-28be9b8543f1","resolution":{"observed_at":"2026-08-07T04:54:23.322717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:30.350355Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":"d33d0903-cfd1-486d-a207-d3db9261d6cb","year":2021},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.450152Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:bce2ba1a7fa4d83a098e3309100b9fb934effdc1075df52cd760dc7e766eb3a1","observation_id":"e2332bd5-d03b-4bf1-8ac9-518fed5ec492","resolution":{"observed_at":"2026-08-07T04:54:30.447637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:30.153108Z","title":"Designing network design spaces","venue":null,"work_id":"7b21b82c-f465-4527-87e6-60749cb57ad9","year":2020},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.530831Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:0f45ac430e7babeb5e0900cf71cddb94c710bc838f24017a0b44a549f3ebe76c","observation_id":"269d11b5-0262-487a-a750-ea1ff097651f","resolution":{"observed_at":"2026-08-07T04:54:30.264765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:29.988020Z","title":"Concept- net 5.5: an open multilingual graph of general knowledge","venue":null,"work_id":"c827753a-b6b8-4b95-a24e-196225984074","year":2017},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.630808Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:4a960d648acd9d9657e57e97ca98203506bc37848a3462093ba15d0647899117","observation_id":"bd97e098-8a9c-4d4d-b5ed-441402fe2cb8","resolution":{"observed_at":"2026-08-07T04:54:30.068310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:29.816252Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"8de4cf9a-2cb4-4ac2-9d38-3ed4f0179d09","year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.765043Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:2b5f8a91204922bd2ed0f36f5a1f1278c838b4ea25dc19bda41277673cd82daf","observation_id":"2283dc94-5ee1-4a52-abc1-d9a008a36dbf","resolution":{"observed_at":"2026-08-07T04:54:29.892922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:29.626337Z","title":"Movieqa: Understanding stories in movies through question- answering","venue":null,"work_id":"578495bd-2049-4c2c-9d88-7daab48e9d58","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:23.869719Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:6545a897fab42f54f38acd32c911c52b5209545c9aaa5fa30c4873435485dd30","observation_id":"3e38dfc3-968c-4ec3-a0e9-8650d27c77b9","resolution":{"observed_at":"2026-08-07T04:54:29.731567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:29.453386Z","title":"Gemini: A family of highly capable multi- modal models, 2024","venue":null,"work_id":"b80537ac-b750-473a-87d1-e5bc0fed97c7","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.039039Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:f108ce14011d3acc18b9adb9a1e0386108bca7897acd6989314919f12d989f94","observation_id":"63986425-5191-4e5d-9ebc-9770e7241a2a","resolution":{"observed_at":"2026-08-07T04:54:29.536874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:29.316479Z","title":"Llama: Open and efficient foundation lan- guage models, 2023","venue":null,"work_id":"9f6c2ee2-b01a-4dca-963b-7b4d474ae997","year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.198578Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:98726cc754b6a338d4d555952b41f7fc20561fc4c026d8e867dda8cddc652304","observation_id":"65feca4f-fa28-4416-864c-9f761a81bdd5","resolution":{"observed_at":"2026-08-07T04:54:29.394008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:29.155394Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models, 2024","venue":null,"work_id":"3cd33f1d-e798-4f14-b38c-6b6ed8196a67","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.345618Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:8742ffcc3f0bb6131ea05208e5186ecb8cfa20b1376bcd6af6015c9ead55a151","observation_id":"dedf4efa-c102-4797-b018-9d9b7f70afe7","resolution":{"observed_at":"2026-08-07T04:54:29.231800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-06T12:50:13.936842Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-07T04:54:24.446133Z","title":"Videoagent: Long-form video understand- ing with large language model as agent.arXiv preprint arXiv:2403.10517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.446133Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:498d70086cd3b111f8a5e2554c5faf3fe6b83ae4e3d4a2bfd1a173301a327f9b","observation_id":"6441a79e-3fa6-448a-ac90-99b4a81b0d0b","resolution":{"observed_at":"2026-08-07T04:54:24.446133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T04:54:24.495885Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos.arXiv preprint arXiv:2405.19209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.495885Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:b7342fbc391177002d92edd850d002132877e8e8b39b91b4ee1d4f433c0a3204","observation_id":"392bf377-9646-4ff1-87ec-15f8401b57b1","resolution":{"observed_at":"2026-08-07T04:54:24.495885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-03T10:25:11.936842Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:54:24.595020Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.595020Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:acef53eb2ce70f144dd82f24d0ef371009c1836c6c83ea330719165809c18dc3","observation_id":"b0beb357-0bc5-4803-9b93-2e37a27c3837","resolution":{"observed_at":"2026-08-07T04:54:24.595020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:28.963391Z","title":"Number it: Temporal grounding videos like flipping manga,","venue":null,"work_id":"59c97935-4715-40fa-9054-8941f5937fd9","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.666423Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:53dcc53e3f358d7b4af93fd2b2c8fba763eb3659e2c1a536b7c5aa90ba259288","observation_id":"1e07e1e8-ef33-45b4-90a0-73e24488a849","resolution":{"observed_at":"2026-08-07T04:54:29.062288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-07-06T08:52:26.716343Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-07T04:54:24.733808Z","title":"Audiovisual slowfast networks for video recognition.arXiv preprint arXiv:2001.08740,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.733808Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:3f9d729467dc14a308edc9e765516beb119c8e698df54f5f100d09b0ffc2f84e","observation_id":"1e498db1-61bb-4662-9211-c4c727c6e716","resolution":{"observed_at":"2026-08-07T04:54:24.733808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:28.812859Z","title":"Next-qa:next phase of question-answering to explaining tem- poral actions, 2021","venue":null,"work_id":"d5705f07-8cca-4093-af1d-39f1dc4118e7","year":2021},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.816412Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:cc5de1319f19bef1cca264bc1d98c5f03d6f38533647dc65f8cecf2d8538e899","observation_id":"94bc6eb1-5e3c-4cc2-9075-a3ab29bb0e25","resolution":{"observed_at":"2026-08-07T04:54:28.877640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:28.617384Z","title":"Videoqa in the era of llms: An empirical study, 2024","venue":null,"work_id":"4fd2e527-1185-490c-847e-a7a79b5b9ad0","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.908233Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:848c9ab9f424b40a1709afdb5671331c45d50e7f847af8d03882f96574d6092c","observation_id":"07a5d2d2-f1e6-42d7-9258-5a7156cc420c","resolution":{"observed_at":"2026-08-07T04:54:28.708921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:28.445883Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"ca77fa8b-3de7-42d3-b56b-d75dba318bee","year":2024},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.981743Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:54b8eb30452b67a0cbaf4b9011b62cf5d4c950bb0ab40a81593a2df0586a6947","observation_id":"7da56493-0950-461d-b803-f649a5524bdd","resolution":{"observed_at":"2026-08-07T04:54:28.527173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:28.278765Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":"326b9652-74fe-4a9a-afc0-9181010a13ce","year":2017},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.054818Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:4684ecdc9a89e282df08d6daef7a29363bbafe36f958edb3813d8f396b397272","observation_id":"ac06e2f6-e250-43bf-89dd-d33edce741c7","resolution":{"observed_at":"2026-08-07T04:54:28.342463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:28.106170Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":"1be3431d-07d7-42af-8f0f-b3d4784a6713","year":2017},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.106092Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:27ba7b2186ca916ad54ca771d11a29273c4e70f555dfbbc3bd8f0c1db0aeb429","observation_id":"1cc3b771-f2bf-4bc6-8df1-6f1759cfc0c1","resolution":{"observed_at":"2026-08-07T04:54:28.181719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:27.919979Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":"e5b93fd4-7641-4814-a8b4-8c4895253693","year":2022},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.206524Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:aa093794459a6dd677511886ed3b9327f61b0fe6ce3300fbbcd4b26fd1353bba","observation_id":"3d3537fb-8c5e-40a6-aa05-71d250a2ec1c","resolution":{"observed_at":"2026-08-07T04:54:28.007775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:27.669440Z","title":"Tubedetr: Spatio-temporal video ground- ing with transformers","venue":null,"work_id":"8fae732f-5b15-4afe-b15a-ba4208f8c5ce","year":2022},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.311819Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:459de7c8f6ecca5bfd6c0c1ed60f97b4872af25463b71d0c2a7f5d18ab13bb1c","observation_id":"67ab510d-630e-44c0-b607-603febc1636d","resolution":{"observed_at":"2026-08-07T04:54:27.746855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:27.512742Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"243a3b45-c728-44f2-876c-b7ae1e80ba11","year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.399743Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:f2ef3329aff43d572090a01e8bea5485509b3f192dadc0c8f3b300b10afb4734","observation_id":"87a72b27-beb8-4b75-98a7-8558e7049f72","resolution":{"observed_at":"2026-08-07T04:54:27.568804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:25.466900Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.466900Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:6d2787e574522b23f773cc220440b5259c39a8b77b7f75b301d448c474be3a2f","observation_id":"0e2d1948-2c99-4c33-8452-57918793584d","resolution":{"observed_at":"2026-08-07T04:54:25.466900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:25.560743Z","title":"A sim- ple llm framework for long-range video question-answering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.560743Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:2c9d8beda12bcef16d32e02823b4f732797097416ef8d114d228b6191c2db7f5","observation_id":"04154e34-90dd-4a1d-91ae-9313f0881b31","resolution":{"observed_at":"2026-08-07T04:54:25.560743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T04:54:25.661857Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.661857Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:ef28d2171472d595d72a0818045698a995942750371f39c5feb772dde4f88b89","observation_id":"4328a720-fb21-4fd0-8d8e-c73098de5137","resolution":{"observed_at":"2026-08-07T04:54:25.661857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T04:54:25.743338Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.743338Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:364d8551c1ad8f35cc671b657fd93124156469c0c06d333de0ea5f443283fe78","observation_id":"3cd26946-7f05-47c6-aecf-50432a7d58eb","resolution":{"observed_at":"2026-08-07T04:54:25.743338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:27.308320Z","title":"Video question answering: Datasets, algorithms and challenges, 2022","venue":null,"work_id":"9f7ac6f9-d3b5-4143-8d7d-39e4aa58e84a","year":2022},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.846782Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:eddd520062449b4d02cd1515e5cfcbf90d36a02c56d3ab0ca1a6e23233c2d90e","observation_id":"45455f66-1722-427d-af2a-559d5503c96e","resolution":{"observed_at":"2026-08-07T04:54:27.383451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:27.095440Z","title":"Training Details The additional settings we use, including hyperparameters and implementation details, are shown in Tab","venue":null,"work_id":"5095c008-48ac-4b65-8c5c-65737f21c6f8","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.914216Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:84f9b3ed67d7a2c988ae4c35ef0854a1b4ee651cb38c653f25f3542ba22fe8ca","observation_id":"82184906-7451-42ee-8420-da441870c981","resolution":{"observed_at":"2026-08-07T04:54:27.194726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:26.921832Z","title":"Multi-scale vision-language connector In this section, we conduct ablations on the MS-VLC and analyze the performance under various conditions","venue":null,"work_id":"cb1ce12f-dab9-45d0-9079-3482b9633b68","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:25.979743Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:19084732035966b41e30f076974bc9e9c806aa4e6c2b51a55cd3777957b4ee7f","observation_id":"d0128375-3087-4256-98ce-522db323b035","resolution":{"observed_at":"2026-08-07T04:54:27.002436Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:26.789237Z","title":"We achieve a METEOR score of 0.498 on the ActivityNet-QA dataset","venue":null,"work_id":"3c4c69ef-4f97-4b34-be47-41e20c25062b","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:26.059057Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:e712540710b0563a785c5735189f861198a66a020080b92778c104b1e81fe7af","observation_id":"9deab42f-f34e-431b-bc13-70d52a8a980a","resolution":{"observed_at":"2026-08-07T04:54:26.838113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:26.603266Z","title":"1 and the ActivityNet dataset in Fig","venue":null,"work_id":"abd2d999-513b-4063-be24-86fe376d78ff","year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:26.160193Z"},"links":{"citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:ddbb9b0dc5949db2c1dc7d1adee20536a0e420ba0026ca54534dc612d2703c62","observation_id":"7b8ccd30-91db-4a43-8fd3-0ba1f9bf4de2","resolution":{"observed_at":"2026-08-07T04:54:26.675471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 2 inbound Pith citation observations for arXiv:2506.09445."}