{"as_of":"2026-08-07T22:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e8304107bf8ff92029a1295bf207fff4e3d6a29224e392ede03e30514f05c5c","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:43:50.327893Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:34:31.365887Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:41:04.755362Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"cited_work":{"arxiv_id":"2507.04815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04815","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From vision to language through graph of events in space and time: An explainable self-supervised approach","venue":null,"work_id":"d971d6dd-5159-44a1-a696-ff442f57d4ec","year":2025},"citing_paper":{"arxiv_id":"2604.10383","last_updated":"2026-07-29T23:04:35Z","snapshot_observed_at":"2026-08-02T23:16:52.425747Z","submitted_at":"2026-04-11T23:51:13Z","title":"Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:22:45.975771Z"},"links":{"cited_paper":"/paper/2507.04815","citing_paper":"/paper/2604.10383"},"observation_digest":"sha256:ccb567d70903bbea4d812111f1835bca7b77393bc2d7ae0032fd4c0ec618502b","observation_id":"b5430fa6-5b4d-4d42-b6d0-9958aeec0546","resolution":{"observed_at":"2026-05-11T10:41:04.758870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04815","snapshot_observed_at":"2026-07-15T11:37:24.415703Z","title":"From vision to language through graph of events in space and time: An explainable self-supervised approach.arXiv preprint arXiv:2507.04815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10383","last_updated":"2026-07-29T23:04:35Z","snapshot_observed_at":"2026-08-02T23:16:52.425747Z","submitted_at":"2026-04-11T23:51:13Z","title":"Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T11:37:24.415703Z"},"links":{"cited_paper":"/paper/2507.04815","citing_paper":"/paper/2604.10383"},"observation_digest":"sha256:10c5928f092432649f938a58597aafcc450bb977f66e54042d97bee582f17eb1","observation_id":"766e827c-eb50-4422-a0f6-06048c9576a7","resolution":{"observed_at":"2026-07-15T11:37:24.415703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04815","snapshot_observed_at":"2026-08-02T16:34:31.365887Z","title":"From vision to language through graph of events in space and time: An explainable self-supervised approach.arXiv preprint arXiv:2507.04815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10383","last_updated":"2026-07-29T23:04:35Z","snapshot_observed_at":"2026-08-02T23:16:52.425747Z","submitted_at":"2026-04-11T23:51:13Z","title":"Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T16:34:31.365887Z"},"links":{"cited_paper":"/paper/2507.04815","citing_paper":"/paper/2604.10383"},"observation_digest":"sha256:e7202dac66a25144bf726c0c2b94a56dfbfd1f960f92a7b474e720eb783c983c","observation_id":"d7ae7c42-b211-49bb-9966-a861f7052d92","resolution":{"observed_at":"2026-08-02T16:34:31.365887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04815/citation-record","integrity":"/paper/2507.04815/integrity","json":"/paper/2507.04815/citation-record.json","paper":"/paper/2507.04815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.161814Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"c71134dc-23aa-4da7-bf0f-90ebfa15c8b4","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.627049Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:60013eb656ebb8cd22def16f634cb8f2e127bc17aa0da09007e6183c658040a3","observation_id":"1fa9a75a-99e6-4fb1-89ca-f6e67a28bce8","resolution":{"observed_at":"2026-08-06T19:44:04.263890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.885015Z","title":"In: Proceedings of the 26th ACM International Conference on Multimedia, pp","venue":null,"work_id":"89b61ad5-8f9c-4ae0-8242-6063f4ebaf95","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.701404Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:61c88da75462750ae8f39195a63199acecf9a117d11b70fcdd8c296479e1bec8","observation_id":"8539a0fb-eb46-4179-a388-390e3c395d95","resolution":{"observed_at":"2026-08-06T19:44:04.044736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.749784Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"5f824aab-a69a-4a9f-a91d-2a2bad376ce7","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.790967Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ba006ff7b396bce2df52ef86be90f7ed971485dc9fcdefc9fa705cebf6787d7b","observation_id":"b23457b4-9d9f-4577-8006-b5b97c9e2758","resolution":{"observed_at":"2026-08-06T19:44:03.840793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04632","last_updated":"2021-08-18T21:55:27Z","snapshot_observed_at":"2026-08-01T20:01:49.108442Z","submitted_at":"2021-06-08T18:34:21Z","title":"VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04632","snapshot_observed_at":"2026-08-06T19:43:42.892853Z","title":"arXiv preprint 22 Fig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.892853Z"},"links":{"cited_paper":"/paper/2106.04632","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ce99bd4af1f7fe74b0db7de3ba048c087ef9a84bc90bb36c93b14515273c743c","observation_id":"b7cd5ae3-72ce-4467-8188-336581dd4010","resolution":{"observed_at":"2026-08-06T19:43:42.892853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.453747Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"2cabd733-55e4-45aa-b7b2-706eaecc0635","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.984997Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:4efd854a87e54a40e512cc3e52728e8fa487fbe73012d661d59d47e54a6eb15a","observation_id":"e74ebffd-a7d6-4bb9-bcaa-a1805ab60085","resolution":{"observed_at":"2026-08-06T19:44:03.616138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-06T19:43:43.140301Z","title":"arXiv preprint arXiv:2304.08345 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.140301Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:23b336f4380d58a030b88701e9ff78e58f7b2509cc2ade9c3d013289e2275272","observation_id":"df335657-6a11-42a5-8171-dcba49c06131","resolution":{"observed_at":"2026-08-06T19:43:43.140301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.208165Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion, pp","venue":null,"work_id":"15ef4b87-ff19-4404-8f22-ae5ab307e52e","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.223699Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:f2f0a95deb2ee3169d0f6894de38ddd4608d63aa95e07ddd170491eddc0b3c31","observation_id":"493b607d-e524-4d06-bf7a-67919f8f7577","resolution":{"observed_at":"2026-08-06T19:44:03.328701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06718","last_updated":"2023-07-11T18:13:14Z","snapshot_observed_at":"2026-08-05T05:31:21.900215Z","submitted_at":"2023-04-13T17:59:40Z","title":"Segment Everything Everywhere All at Once","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06718","snapshot_observed_at":"2026-08-06T19:43:43.308601Z","title":"arXiv preprint arXiv:2304.06718 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.308601Z"},"links":{"cited_paper":"/paper/2304.06718","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:6bbe5de57d6984838f66c287815e0a035e068a72fd6faf6269b91133081b42db","observation_id":"2c663d35-f275-4fdf-89a6-cb6c53056acc","resolution":{"observed_at":"2026-08-06T19:43:43.308601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.936103Z","title":null,"venue":null,"work_id":"573ac345-28e9-48a2-a602-0f943030759b","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.415020Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:1b6f281f35895736234b78c6fc30dc40ec0a9baeba4f471e95f2fff0f59e44f5","observation_id":"ef4de4d1-c6d0-4a90-bffe-e5e71a98e5cd","resolution":{"observed_at":"2026-08-06T19:44:03.046763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.577042Z","title":"Advances in neural information processing systems 35, 10078–10093 (2022)","venue":null,"work_id":"f777c149-11c9-4447-9112-89dd6c4f697b","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.539742Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a9fe6314384b3410bb4c47aa6b1e90786b669493f368749cae1d3fb7fd5833cc","observation_id":"574f771d-55f9-4995-a47f-2836a7ca541c","resolution":{"observed_at":"2026-08-06T19:44:02.750499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.294539Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"91e759e1-77e7-4357-a6f8-7377dc4acdc4","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.654720Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a895a25b54b0c8bb2832a700d5422f38e8827f4bfd88e42c643d51705db268df","observation_id":"b0c30342-5a7e-4f0d-a193-009229a85309","resolution":{"observed_at":"2026-08-06T19:44:02.441353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.041690Z","title":"Advances in neural information processing systems 33, 1877–1901 (2020)","venue":null,"work_id":"6c711711-7272-4516-af76-7bbfa50fbc0c","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.781771Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:f0d6b3237e834939952645f721ef64e0935f5f86c381748b811cc7bf0352eee0","observation_id":"08782b0a-2ec1-44b0-b100-ad058d72a77e","resolution":{"observed_at":"2026-08-06T19:44:02.115109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.791319Z","title":": Learn- ing transferable visual models from natural language supervision","venue":null,"work_id":"ce4159bd-c6f4-4bf7-8652-7b5a586a2a5d","year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.886348Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ad4242d12db6f1e64afcae8c552128bd2623417ee27990a4d30f5809f2030d15","observation_id":"d226b2fe-2e4f-482e-8cf0-10b83c622053","resolution":{"observed_at":"2026-08-06T19:44:01.871538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.574232Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":"7de55c84-d219-45e7-a628-6b5d96da1044","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.991707Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b1b51ce83481a4ce2b0994e8f184a5e7c09b3d65d598787c977aa8a0b2fcf3a5","observation_id":"f238a35d-d400-42a5-bd41-6ded51bfa965","resolution":{"observed_at":"2026-08-06T19:44:01.685561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.243587Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"803cb3c5-d3a0-4c4e-b22e-16fa0f800df8","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.118903Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:fcaa33131da0a3cc69480963fcca3fa7f815db3274feaedcd5dc58069d030b7d","observation_id":"005f5ca8-ddea-43ad-8883-f2e102977320","resolution":{"observed_at":"2026-08-06T19:44:01.398110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.893284Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"0a237a88-6237-4d98-9a65-20d14b783066","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.219721Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:c9489ee2483da85770216214275be029bf9301fbafd7db7b27951ef1902b109c","observation_id":"952851fa-6487-44db-80cf-b65712cc81f7","resolution":{"observed_at":"2026-08-06T19:44:01.027770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.603833Z","title":"In: Pro- ceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"65cd4ca2-b515-4af8-9ed6-dee092ffd91d","year":2015},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.308470Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:db3e10771b9c268542b0000a94184efc872ae650fbf69914432551707c654d55","observation_id":"c748b63e-bff3-4dd2-a5cd-56b52d5151aa","resolution":{"observed_at":"2026-08-06T19:44:00.719692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:44.376396Z","title":"In: Proceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.376396Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:17d8f0e835ec7d8372598a91fcefb9bf1375bf21de74e1268240322001bb5af6","observation_id":"164779cc-e234-4f09-9550-337908abaf66","resolution":{"observed_at":"2026-08-06T19:43:44.376396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.287815Z","title":"6546–6555 (2018)","venue":null,"work_id":"8c1960f9-2324-4d27-af4e-050c80de1749","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.491943Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:24baba9f01af0674bf6959e66fe5fdf5c26449ffcae871a5dc3e92feceb6852e","observation_id":"053cb222-c0de-4d56-9cd8-9417ced78883","resolution":{"observed_at":"2026-08-06T19:44:00.407694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.019670Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"ceb26752-59ee-46de-9f78-797689846a7f","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.591735Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:691581a05c97d340b3ac6f131a7ae3ee439de55621f67ef8c5aa3f1694f613b1","observation_id":"0c867289-ccf4-4ee2-a2c4-8d486c2c5d8f","resolution":{"observed_at":"2026-08-06T19:44:00.105912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T19:43:44.660951Z","title":"arXiv preprint arXiv:2303.15389 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.660951Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:47c536cf4eb0d3ac34b216a454b2aa8192ab43fd351782c1dec4dcf116fdbe51","observation_id":"f7ed1e8e-5e92-42c4-b6e7-10cbdaaa4533","resolution":{"observed_at":"2026-08-06T19:43:44.660951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:43:44.740246Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.740246Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8ec129d92c6f9d29662f612e7361901b04bee0c585cf709ff0300cff7d2181a5","observation_id":"f64877b2-09dc-4b53-9bec-ebb8c02fdbec","resolution":{"observed_at":"2026-08-06T19:43:44.740246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.812085Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"f8091bc3-5b50-470b-b5e5-81787dc15b5c","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.844929Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:3601385b2b389f081b228727bf84e12d2f4f957e922d34fe36892222fc7ca2c3","observation_id":"b0e312d6-e3a9-4a65-8f6a-fda4861fe027","resolution":{"observed_at":"2026-08-06T19:43:59.930135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.597611Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d00e3bac-afd3-4c5b-a66a-00fd07ecbdcc","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.964614Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a9b74b81b5375050a465ab89eb7b5eb615dd86a4f3bc30d3fee9349c0e5988eb","observation_id":"69b51ce8-0fba-48c1-b7e2-392403a6cc75","resolution":{"observed_at":"2026-08-06T19:43:59.665358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09085","last_updated":"2023-06-15T12:29:42Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:29:42Z","title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","version":1},"cited_work":{"arxiv_id":"2306.09085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09085","snapshot_observed_at":"2026-08-06T19:43:51.422269Z","title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","venue":"cs.CV","work_id":"cbc9a29e-b7de-4170-b9dd-1304ca1434de","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.039106Z"},"links":{"cited_paper":"/paper/2306.09085","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:bdde08072057f337842340c223b3b6c9ca945e43cf06482ecccb7dacccbb9091","observation_id":"91c3c52e-0afb-462d-b91c-37c160df3cce","resolution":{"observed_at":"2026-08-06T19:43:51.566919Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.325244Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"14403ea5-2391-4293-b4ea-6528bdc47950","year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.134139Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:18cf635b2d9c7195243bd9066dceea178a2d4e48f718b153b51b247d5e1dc0e7","observation_id":"cd1561ca-9ce1-4676-a48d-f4b8b57e7fec","resolution":{"observed_at":"2026-08-06T19:43:59.503727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.059577Z","title":"Advances in Neural Information Processing Systems 35, 23716–23736 (2022)","venue":null,"work_id":"e6f6077c-bf7e-4c20-9e91-2faf8b094eeb","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.230070Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b7348d95ecbdbaca65c9050ee5126b51d635f38f0e4a20e7c98022405faa34b5","observation_id":"09e175c9-88f6-4d3e-9a56-dbed310dda35","resolution":{"observed_at":"2026-08-06T19:43:59.133441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T19:43:45.349914Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.349914Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:534d474c11729b8057fd3af0d8a1f283564d272651f6cc6fc5eaafa06ba79c5f","observation_id":"8c065b3a-771b-4689-aae5-c083f0391f89","resolution":{"observed_at":"2026-08-06T19:43:45.349914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T19:43:45.479599Z","title":"arXiv preprint arXiv:2205.01917 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.479599Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:71cb50e1ed4fe0e200f22272177196bf7afba181a4184ec499ecc42e763fef15","observation_id":"326f65b8-3d4c-4206-8655-5f52984e7b99","resolution":{"observed_at":"2026-08-06T19:43:45.479599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.840350Z","title":"Advances in Neural Information Processing Systems 36, 72842– 72866 (2023)","venue":null,"work_id":"ed1b4791-4852-4a70-8df5-016a2247edff","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.591082Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8cc579513f0d15d4ee92870e814257c9351533553e7fcee83bbd97b839f7c14a","observation_id":"39b66d8a-2c88-4719-91e9-b93c82b74da2","resolution":{"observed_at":"2026-08-06T19:43:58.965686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.634818Z","title":null,"venue":null,"work_id":"8d74cf24-a0d0-4ddd-8ad3-eb049f6551c6","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.694879Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:71579bd3d259b7c75aedd4021bda65c39c4d4c62fd04cbcebe74c06a02315db1","observation_id":"79e90ac1-c58c-4383-b0a6-d7f39d536a1a","resolution":{"observed_at":"2026-08-06T19:43:58.736133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-06T19:43:45.831936Z","title":"arXiv preprint arXiv:2205.14100 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.831936Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:f22a4c66289d1991048042b1bbf9ba4de9428052e4f420b911b00a4af5126356","observation_id":"79df5818-bf96-48a1-85c8-a80f3d5bff61","resolution":{"observed_at":"2026-08-06T19:43:45.831936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00402","last_updated":"2023-02-01T12:40:03Z","snapshot_observed_at":"2026-07-06T14:47:00.945435Z","submitted_at":"2023-02-01T12:40:03Z","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00402","snapshot_observed_at":"2026-08-06T19:43:45.905581Z","title":"ArXiv abs/2302.00402 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.905581Z"},"links":{"cited_paper":"/paper/2302.00402","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:5a3e3011a9b38dfa71607664708a21160435e3d74452e1ab62f7182502149384","observation_id":"6bcc3a59-7798-482f-bb50-55d9122a0480","resolution":{"observed_at":"2026-08-06T19:43:45.905581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.436190Z","title":": Language models with image descriptors are strong few-shot video- language learners","venue":null,"work_id":"2f4f4803-fe83-4fc7-86c9-95454a2c3200","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.005251Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:568fd76ed0b7fe406b52bca3f62e0472029111892267af4a8db81d6aa8d32dac","observation_id":"7fbf2189-8f93-429f-b8c3-87d30b617c87","resolution":{"observed_at":"2026-08-06T19:43:58.519486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.196751Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"a9886332-3a44-433f-a8a1-56983a553a21","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.139693Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:6bf5e700defaae06a8185f8dd0aff383b8babf6642cb569b2971890f8f2e3c0f","observation_id":"cdff4814-320a-4128-a79e-bf808c85e6c9","resolution":{"observed_at":"2026-08-06T19:43:58.297557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.910708Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion, pp","venue":null,"work_id":"fbbfd18b-2ded-488a-9513-a9e771bcb8a8","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.216585Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:eec6c56a6a6cdaee22dfeff0d568f01471b834085f03a8901744774b7f6e4896","observation_id":"326ceda1-04fa-44f1-b724-1db351891881","resolution":{"observed_at":"2026-08-06T19:43:58.008523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.638035Z","title":"Journal of Visual Communication and Image Representation 58, 477–485 (2019)","venue":null,"work_id":"ed22c612-5ced-4ddc-a935-037377fac643","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.344634Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:176ec51b8fa1f36c1b68d4d472309d131aa3c7e7f863d2c4b15704cbdcf436d4","observation_id":"973ddbdf-480c-4777-b3f6-7aeeb9445d8e","resolution":{"observed_at":"2026-08-06T19:43:57.768655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.320578Z","title":"In: Proceed- ings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"00f56dc9-64ba-4d9b-a5e4-b80538fd8e07","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.457612Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8cbb79720de504a5d5331bad04d84c414cae531d370b0635482ea42fda2b4b33","observation_id":"63f28794-3516-4510-82c5-7364a9b62adf","resolution":{"observed_at":"2026-08-06T19:43:57.456857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.123810Z","title":"Advances in Neural Information Processing Systems 32 (2019)","venue":null,"work_id":"bc44b917-e2bb-4f75-b7fd-4bde774e4c65","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.552856Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:7b5ae7b70cd51a6738627e28d167c4f29684456407be0f0a0493ec557b899e60","observation_id":"10cc3374-4b02-41e4-bcd1-86042729c6b4","resolution":{"observed_at":"2026-08-06T19:43:57.175403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.993136Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d0e494a9-5959-4aaf-a64c-ac2440618658","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.641843Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:f99d60ae8c01bc12196341ae33635e5efb9a7485dcc8a8a8fcc17b855d1d8184","observation_id":"b2dc91a8-777a-4f95-82ea-055c0ccbad2d","resolution":{"observed_at":"2026-08-06T19:43:57.063970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05715","last_updated":"2019-02-15T07:59:11Z","snapshot_observed_at":"2026-07-06T07:33:17.307254Z","submitted_at":"2019-02-15T07:59:11Z","title":"Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention","version":1},"cited_work":{"arxiv_id":"1902.05715","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.05715","snapshot_observed_at":"2026-08-06T19:43:51.161218Z","title":"Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention","venue":"cs.CL","work_id":"732ea047-1dc3-49c1-8e00-cc6c41f8ef90","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.764914Z"},"links":{"cited_paper":"/paper/1902.05715","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:f0ddd6945f99e98eb75d33701812ad680d0e69263db39a4d1c2b4e4e64df8cc7","observation_id":"77343e28-a934-4e8d-a322-bdc540c39a91","resolution":{"observed_at":"2026-08-06T19:43:51.259049Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12133","last_updated":"2019-07-28T19:59:20Z","snapshot_observed_at":"2026-08-07T03:02:36.099330Z","submitted_at":"2019-07-28T19:59:20Z","title":"An Empirical Study on Leveraging Scene Graphs for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12133","snapshot_observed_at":"2026-08-06T19:43:46.904929Z","title":"arXiv preprint arXiv:1907.12133 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.904929Z"},"links":{"cited_paper":"/paper/1907.12133","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ee2f28a1979300b17c2b3545d1e11a966ca9968fe9200e7bcd3d1027cc980939","observation_id":"cbe080c1-0b84-49d5-af1e-991ec154c613","resolution":{"observed_at":"2026-08-06T19:43:46.904929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.863177Z","title":"In: ACM International Conference on Multi- media, Mountain View, CA USA (2017)","venue":null,"work_id":"1fd21afb-7289-4d0b-a6e1-e60c8d9dd39b","year":2017},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.022684Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:cd7f10cdd265e57cbb9227c872750f8a6c2b5ff944949e1dee0a6325bcb737f9","observation_id":"9b014c3f-bf96-42c4-ba79-a12503dea213","resolution":{"observed_at":"2026-08-06T19:43:56.925916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.718048Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"96b75ee2-cc48-44cf-850a-96c998850c1d","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.095390Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:9fafff3ce749e8cdd6e5e57cc7952e76b97e51ddf1399a448c498b2307fcbb93","observation_id":"a8f57952-6d30-462e-92c3-bbf70250bf8c","resolution":{"observed_at":"2026-08-06T19:43:56.774882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.602502Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"8cad1762-9c34-4b96-8f55-02d902df1756","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.182477Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:464879d3b126136ab7c781f3a1234e607b3e53f9417f3d933d86ab63e8791fd2","observation_id":"fcd33370-82c6-4173-96e4-9490959efb86","resolution":{"observed_at":"2026-08-06T19:43:56.646010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.460024Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"07fdb973-8a1b-4fbd-9aae-a7e06dd969a9","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.302546Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:057d1a97bf813e553b3abf7266ef05636057559f7d5b58e97140d60291c01c47","observation_id":"7aadcdc8-382d-4ae5-9efd-19371f9c2707","resolution":{"observed_at":"2026-08-06T19:43:56.520054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.325091Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"a414945c-8359-47b2-b1b7-afb61e3542bb","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.388617Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:79507a4d471945c37ccd7cdc925689b075db6508adf806972c82a9a16e2533b3","observation_id":"2653a6ce-14a7-4f99-a271-a41d68f33d10","resolution":{"observed_at":"2026-08-06T19:43:56.393082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.166817Z","title":"In: 2016 IEEE Inter- national Conference on Image Processing (ICIP), pp","venue":null,"work_id":"76265a90-b698-4e0b-b86c-5f5da0b30e95","year":2016},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.463777Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:18324a77cdac8877f855253f7be78b33de58cd7b3721386cde221523b09efc2c","observation_id":"40261c1b-1a26-45fc-845c-c705bc6d84b9","resolution":{"observed_at":"2026-08-06T19:43:56.251625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.033817Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"d2f65f51-0be5-4a15-a446-23eb59634f9b","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.566942Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:313f8db690d187ebfef0e0a649653ed6c4cdf398186fd8e39d27d20d7e5f9c7b","observation_id":"89767e79-28c5-4874-b3f5-b18492f7640a","resolution":{"observed_at":"2026-08-06T19:43:56.085260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.880704Z","title":"In: Computer Vision–ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XXI 16, pp","venue":null,"work_id":"73ab1110-b788-403b-a37c-e2dffb1d8e3c","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.630114Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b3fae3d4ac58c659530b06214cd1c9e96ab376ba9caf436ad53c77306f78b0fd","observation_id":"6f232d7b-050a-44c1-a654-af8d5b6da088","resolution":{"observed_at":"2026-08-06T19:43:55.956237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.713309Z","title":"Machine Vision and Applica- tions 35(4), 64 (2024)","venue":null,"work_id":"a4cc66d8-8989-4880-9cf1-7fa33a4b5338","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.674346Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:98861621ec2f7bd84c9481365574dcd6e24bcb77ecd8e3d72f1b5d68d1032b25","observation_id":"8ec1a218-0515-42fd-bc3b-0b6bb46f8634","resolution":{"observed_at":"2026-08-06T19:43:55.772715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-06T19:43:47.754159Z","title":"arXiv preprint arXiv:1804.02767 (2018) 26","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.754159Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:3888bf57975a2b08d902819424ddca6576c00f9f1a8aef297e3482f08a1b0be5","observation_id":"c93a3f9b-633e-4e70-b546-fbf55a762acc","resolution":{"observed_at":"2026-08-06T19:43:47.754159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.540554Z","title":"In: Proceed- ings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"193b13af-716d-4ab1-a7af-561b884be5de","year":2017},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.837739Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:01b7a31f2ae7677667c1acdf2d1734d631274ce39d91643156ac7e3a9481b9c3","observation_id":"6f446b92-430a-4764-8275-8a82122d5d8d","resolution":{"observed_at":"2026-08-06T19:43:55.628813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.425346Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"52bca1f3-2ccb-475c-89cf-eb2f6cec1d6d","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.887903Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ce0010e56f210692a51b97fa173475b9466a36e7559a465b9024f981072cac5d","observation_id":"453f8aee-53c6-4605-82bf-2f9de8baf4c0","resolution":{"observed_at":"2026-08-06T19:43:55.481004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06499","last_updated":"2025-02-15T10:01:13Z","snapshot_observed_at":"2026-07-06T18:28:20.634381Z","submitted_at":"2024-06-10T17:34:24Z","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","version":3},"cited_work":{"arxiv_id":"2406.06499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06499","snapshot_observed_at":"2026-08-06T19:43:50.882851Z","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","venue":"cs.CV","work_id":"9d26397a-9c6b-4994-b01a-82b14f866961","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.969927Z"},"links":{"cited_paper":"/paper/2406.06499","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:0ffbb4a72c6cd8ab3e10ed43102b42c976ad0b88344e5003cc6edd8d563d5607","observation_id":"5691f0ba-0c7e-4345-9377-3d6c585d1c3f","resolution":{"observed_at":"2026-08-06T19:43:50.977208Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.211405Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"63a8d501-ddf8-46b1-9aeb-8eae0b09fea0","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.014249Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b174e4c8eb917fb2335eb0a0c85256d0937934a375f2e76edd8eab5eda398621","observation_id":"80bdef0a-3f68-492e-b010-d0e1fa522e7d","resolution":{"observed_at":"2026-08-06T19:43:55.339932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.963772Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"1d65bdb0-509f-46d1-8379-c0a478d06853","year":2017},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.097221Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:04a83d393c9340dc0cf30c04cc4951e6459a5da2df2614e93c0613e39c903a85","observation_id":"038a0c90-875c-47cb-bc97-83dd52da5949","resolution":{"observed_at":"2026-08-06T19:43:55.104767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00214","last_updated":"2020-05-20T17:40:28Z","snapshot_observed_at":"2026-07-06T09:16:45.827004Z","submitted_at":"2020-05-01T04:17:14Z","title":"The AVA-Kinetics Localized Human Actions Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00214","snapshot_observed_at":"2026-08-06T19:43:48.160980Z","title":"arXiv preprint arXiv:2005.00214 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.160980Z"},"links":{"cited_paper":"/paper/2005.00214","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:3ff36b8854e6fc863ffeda934c5c1a2e529d4b5c5b4ec2d47f62dd3400ba1c34","observation_id":"db8411f1-fb83-4b46-b0ce-257ad16ea095","resolution":{"observed_at":"2026-08-06T19:43:48.160980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:48.244244Z","title":"https://github.com/ultralytics/ ultralytics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.244244Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:f058620dc80e3769ac82441e7958e37865be259cea4914b22dc2d30a462cb009","observation_id":"b7e1f305-047e-4c62-8f46-5f061b49b2a7","resolution":{"observed_at":"2026-08-06T19:43:48.244244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.698300Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","venue":null,"work_id":"99d9e7ec-6c83-4c59-9621-fa45bff9678b","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.301829Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:91758c6bae828ef56e2e689b8085126c3a5a1e31811f613c9c436997025130b3","observation_id":"19dd9691-502e-49f5-8405-3cbfe6edea71","resolution":{"observed_at":"2026-08-06T19:43:54.850124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.491891Z","title":"In: Proceedings of the 28th International Conference on Com- putational Linguistics, pp","venue":null,"work_id":"35769896-648f-435b-829c-810195398628","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.382890Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:d63c245d94a6925a6f72a720d2be34dd85337320c910e3889d75eff96e8649e8","observation_id":"4693b514-d069-406a-803d-3bc1ec387a5f","resolution":{"observed_at":"2026-08-06T19:43:54.578188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.269830Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"07cf9c91-78be-47e8-8d2e-35b40a074b8c","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.466250Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:597a91a9133ee4dbeafd22d3c847847cff6c1f7e69af4d8b530a9b39746ec0cc","observation_id":"54edf606-9d47-4b76-8b0c-66353a2b287d","resolution":{"observed_at":"2026-08-06T19:43:54.363739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.044580Z","title":"In: Proceed- ings of the IEEE/CVF International Con- ference on Computer Vision, pp","venue":null,"work_id":"268d3ed6-bb63-45aa-ba3b-7d4d51256eb1","year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.551932Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:0c0490ec43d788e5d96208428d8f68acd69d90f72957b8816d4d25ed9c1526d0","observation_id":"2a728679-d587-4325-b0b1-502465c4a7b3","resolution":{"observed_at":"2026-08-06T19:43:54.142534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.801906Z","title":"In: Proceed- ings of the 2019 on International Conference on Multimedia Retrieval, pp","venue":null,"work_id":"ce8a29db-7682-4ba0-b9e7-7a693ad23c19","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.712989Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:50aee8ea8bb15fb1fe2a1f3709379b7baa08d4e5c13912cc9ee8cbd8a8dc89a5","observation_id":"42806005-c685-48b9-8898-3ff795bfff7e","resolution":{"observed_at":"2026-08-06T19:43:53.926419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.532798Z","title":"In: Proceedings of the 40th Annual Meeting of the Associa- tion for Computational Linguistics, pp","venue":null,"work_id":"c51d0064-6fda-434e-b54f-1f85a192668b","year":null},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.822838Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:dbdfbf5302d79d71ba601425af01f5f34dcb9138b5c2afe09303303324fe6eee","observation_id":"fe06685c-de07-45a3-a386-f516f439cc3b","resolution":{"observed_at":"2026-08-06T19:43:53.634674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.247799Z","title":"In: Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation And/or Summa- rization, pp","venue":null,"work_id":"e0969741-011a-4f6e-a17b-05b82781bc76","year":2005},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.976303Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:d70ef4f6fef8f480dd71ee3a73489e895193cc1c3ab18ec8c38b3001db60fe4e","observation_id":"78a43c8e-a2c3-4cf0-9691-2a47199b4c22","resolution":{"observed_at":"2026-08-06T19:43:53.375874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.016868Z","title":"In: Text Summarization Branches Out, pp","venue":null,"work_id":"1c680ca1-5b0e-4be6-ade9-7d25c6c3f692","year":2004},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.082972Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:9eda990c5d8b5624cbf8acc015be2834cb5b579df3e495a916b5cb3f3b0f66d9","observation_id":"b3a1dbf5-bc27-4f14-83bc-e935ad8978dd","resolution":{"observed_at":"2026-08-06T19:43:53.102668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.746425Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"7dcd1614-d76c-4501-9903-654e0b75b86b","year":2015},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.226727Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:e0cee8a2a167bc0a905e31ebae2b50c9d23e7856273db3b5b53a71cfc574d339","observation_id":"9059824c-4b4d-410f-9790-0760d4b8f8f0","resolution":{"observed_at":"2026-08-06T19:43:52.876223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.516112Z","title":"In: Computer Vision–ECCV 2016: 14th European Confer- ence, Amsterdam, The Netherlands, October 11-14, 2016, Proceedings, Part V 14, pp","venue":null,"work_id":"3794b191-3038-417c-bd16-7c88195410bf","year":2016},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.365407Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:cf448e252e647b54d9770984bf242bd8e1c7cd8ab04797b290dfc1d67a494ec5","observation_id":"d7e0c47f-786d-484e-849f-7ab5e77c2da2","resolution":{"observed_at":"2026-08-06T19:43:52.636631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T19:43:49.463035Z","title":"arXiv preprint arXiv:1904.09675 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.463035Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:70c95611c8fbdbb9e57bc14d5609d909779a499b5c3d1b180cb963bbb9ef07ea","observation_id":"5c994fc8-5390-4d14-88e8-a05c17eb4176","resolution":{"observed_at":"2026-08-06T19:43:49.463035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:49.598751Z","title":"In: Proceedings of the 58th Annual Meeting of the Association for Computational Lin- guistics, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.598751Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:7df9b5065ee76572da5f51f85b2832b0db3cb3b734e95fe4e69d4dfd9c8f19f7","observation_id":"5d9ff554-ed79-4775-a727-f157a1ee5c15","resolution":{"observed_at":"2026-08-06T19:43:49.598751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-06T19:43:49.721329Z","title":"arXiv preprint arXiv:2404.18796 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.721329Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:47af59a3da7639e273c5bbdabfa67be790f086008baee24b0e6d87a8905e527b","observation_id":"3af6cbeb-d4fb-4ed4-816f-05b4b1143bfa","resolution":{"observed_at":"2026-08-06T19:43:49.721329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:43:49.808196Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.808196Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:36b0b3ac977da78852d8f5fc6c737c323d7726a86cc5f9b1f0e127fcb87adc3d","observation_id":"2df423b3-7005-4902-8d8e-43da4aa1b0dc","resolution":{"observed_at":"2026-08-06T19:43:49.808196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:43:49.953878Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.953878Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ba4e326a23f1f2c9902ac6752cc6b3396245a220b0938cf3bd33c41066412519","observation_id":"31fbf53a-80ec-4e9d-a145-85ca1ae462de","resolution":{"observed_at":"2026-08-06T19:43:49.953878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.303877Z","title":"Computational Linguistics 44(3), 393–401 (2018)","venue":null,"work_id":"249e029e-4cbd-4d31-a6cf-c429c9fcabb2","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.082730Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a78fc63d7c1a6e234943a80471258bde3332458b2f1141fde5b242a13b95bfbc","observation_id":"96daa34f-2e40-4509-8edb-9fbd0eb0cab9","resolution":{"observed_at":"2026-08-06T19:43:52.404183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.041428Z","title":"Computational Linguistics 35(4), 529–558 (2009)","venue":null,"work_id":"c8aebb2b-23e2-4aa2-acff-45eb9b4f89bc","year":2009},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.185014Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:bd2155e78d7cd6e8da6df30178a688d5a3961bfa41b301f87b88adf88b78324d","observation_id":"57dad3fb-4027-42dd-b334-9bce34d581b6","resolution":{"observed_at":"2026-08-06T19:43:52.172079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09169","last_updated":"2024-08-17T11:13:10Z","snapshot_observed_at":"2026-07-06T19:01:54.329469Z","submitted_at":"2024-08-17T11:13:10Z","title":"Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices","version":1},"cited_work":{"arxiv_id":"2408.09169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09169","snapshot_observed_at":"2026-08-06T19:43:50.466829Z","title":"Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices","venue":"cs.CL","work_id":"b41f04f2-d09f-4a2c-9f32-2aab594d4bf4","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.245368Z"},"links":{"cited_paper":"/paper/2408.09169","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:7aa8124c5e1ed37564e7299726815968404380d469e581c8db77e7ca7ba62de4","observation_id":"fa70dbcd-3eda-407b-83ac-58507ba8a6e0","resolution":{"observed_at":"2026-08-06T19:43:50.545471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:51.798457Z","title":"Advances in Neural Information Processing Systems 36, 53728– 53741 (2023) 28","venue":null,"work_id":"e4102e60-db69-4e76-aa89-988cee9c971a","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.327893Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:2a8475ad86c519d0ef02a525e144a710a2f5ece184ae0b9ecfeedcda880bb76b","observation_id":"0b6d68af-39da-4dda-92b6-42caa403fd8f","resolution":{"observed_at":"2026-08-06T19:43:51.894487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:48.886456Z","title":"https://doi.org/10.3115/1073083.1073135","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":318,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.886456Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:d27158c00f153f885b1a189dd614247cc729073af074cfb83b22f88cd13059ad","observation_id":"dacfa109-71fb-4b43-98f7-618bade59b84","resolution":{"observed_at":"2026-08-06T19:43:48.886456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:36:27.881000Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 3 inbound Pith citation observations for arXiv:2507.04815."}