{"as_of":"2026-08-07T15:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c2fe217a575ddab5d8d60aa80615dba368ba5a0ebd1268c3de5728cd0f9cf9a","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:02:47.086421Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:02:44.662433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T17:02:47.349677Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"cited_work":{"arxiv_id":"2507.11967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11967","snapshot_observed_at":"2026-08-06T17:02:47.349677Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","venue":"cs.CV","work_id":"5201c818-a667-4c67-b617-1ee4bb4f12f7","year":2025},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.662433Z"},"links":{"cited_paper":"/paper/2507.11967","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:836964688faef96d3cc8f03a6a3113740d171430dff153e015223fab8d18ef06","observation_id":"3b82f3c9-ed53-401e-b29b-d85ffdd59aa9","resolution":{"observed_at":"2026-08-06T17:02:47.407214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11967/citation-record","integrity":"/paper/2507.11967/integrity","json":"/paper/2507.11967/citation-record.json","paper":"/paper/2507.11967"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"cited_work":{"arxiv_id":"2507.11967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11967","snapshot_observed_at":"2026-08-06T17:02:47.349677Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","venue":"cs.CV","work_id":"5201c818-a667-4c67-b617-1ee4bb4f12f7","year":2025},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.662433Z"},"links":{"cited_paper":"/paper/2507.11967","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:836964688faef96d3cc8f03a6a3113740d171430dff153e015223fab8d18ef06","observation_id":"3b82f3c9-ed53-401e-b29b-d85ffdd59aa9","resolution":{"observed_at":"2026-08-06T17:02:47.407214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.725496Z","title":"We also propose to automatically gener- ate audio-visual-text triplets from unlabeled videos, which are subsequently used for training LG-CA V-MAE","venue":null,"work_id":"dca97a3d-5ee9-4224-b8dc-302038c694b7","year":null},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.810201Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:e9b976fc270c6634a6afbc40e4ffcfdf2788b4b80d82b3f4363eb0daea600ec4","observation_id":"e914d1db-ca25-4909-abb0-28cfae130dff","resolution":{"observed_at":"2026-08-06T17:02:49.780523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.576640Z","title":null,"venue":null,"work_id":"20f37126-af83-432b-b040-2beff694bd76","year":null},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.891841Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:3cbb648ea4395392b947842e2fda9fbe16f7a65de9ab14f8a79d40f5db47d40c","observation_id":"48449906-1dcf-4cea-a384-8751903f7c49","resolution":{"observed_at":"2026-08-06T17:02:49.645247Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.423332Z","title":null,"venue":null,"work_id":"b56e5a43-8be8-493e-b4ad-d3c1e6ec6757","year":null},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.961943Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:60ae072224478607fcc977cb3418619f877f790e135be7ae17568737a74e7311","observation_id":"90ee5293-c267-4109-910d-530c82239868","resolution":{"observed_at":"2026-08-06T17:02:49.526984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-07-06T14:05:23.547010Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T17:02:45.037290Z","title":"Contrastive audio-visual masked au- toencoder,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.037290Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:79c427183e81ef470f748e844c6b9dee664a9d234a65a5411e4b095d49218a61","observation_id":"90dd38b2-8ab7-4064-bc64-7caa43145675","resolution":{"observed_at":"2026-08-06T17:02:45.037290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.255903Z","title":"Mavil: Masked audio-video learners,","venue":null,"work_id":"9f0e61d7-09fa-4b2b-baab-59acaa599eb2","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.118282Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:f39720065582263055091a12e2d0cfeb8de1edbbb2fec5316ad6c918db69b1f2","observation_id":"92d8bf79-fc66-4056-a9b1-5e2c4ae02a20","resolution":{"observed_at":"2026-08-06T17:02:49.361832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.092225Z","title":"Audiovisual masked autoencoders,","venue":null,"work_id":"945e821f-9fa2-4ab5-b196-a87f84341101","year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.248428Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:58d7dde92649e603f2032ed81af303a0fbcea994cf894a136633b6ea71c09c14","observation_id":"0509ec62-d6a4-442b-8677-a82e7db0a7fd","resolution":{"observed_at":"2026-08-06T17:02:49.178565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:45.369591Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.369591Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:c45d154b275689aecf80942d771aee3bcf05d0e2e38e18c346f61a6c29fbd0a9","observation_id":"fa779b7d-4f7c-489a-a940-a87fd09879ca","resolution":{"observed_at":"2026-08-06T17:02:45.369591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T17:02:45.445056Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.445056Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:30fa75e37a0732bb88735d3ad9dbd6045997f3ec9db3936dd8878106957fb2e2","observation_id":"4d1168e6-07ab-4819-86bd-c915906aaf85","resolution":{"observed_at":"2026-08-06T17:02:45.445056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.938463Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"9dbc438b-bd35-4a1f-b6a9-3dc0191325db","year":2020},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.534477Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:8f99112953045ae9d52207900f697049b4ec184b427a4de650d38e0bfa1a8f3c","observation_id":"437a2c0e-0f7f-474a-b31a-b038349e3fd5","resolution":{"observed_at":"2026-08-06T17:02:49.032112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.744844Z","title":"Acav100m: Automatic curation of large-scale datasets for audio-visual video representation learning,","venue":null,"work_id":"42cb8569-fda3-46cb-ab08-4e94d23e541e","year":2021},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.622514Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:408d8a5f5ca9748bf4d4f4ec5bf2c98d433c2796c0cdf388d427d2e0d267ab4c","observation_id":"a805f781-fdf6-4ca9-833e-05d4e3e771e1","resolution":{"observed_at":"2026-08-06T17:02:48.834728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11729","last_updated":"2024-09-18T06:38:48Z","snapshot_observed_at":"2026-07-06T19:17:23.847280Z","submitted_at":"2024-09-18T06:38:48Z","title":"DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information","version":1},"cited_work":{"arxiv_id":"2409.11729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.11729","snapshot_observed_at":"2026-08-06T17:02:47.225233Z","title":"DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information","venue":"cs.MM","work_id":"019133ec-468a-4248-9d98-e905c0cc458a","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.719897Z"},"links":{"cited_paper":"/paper/2409.11729","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:00ce0642b60331b063fc23a0780dba93ec0136d46d9fba746fd52521ca94e80f","observation_id":"80c6ccf8-756a-4288-a4d3-17eed4ed3939","resolution":{"observed_at":"2026-08-06T17:02:47.273577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:45.866977Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.866977Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:d48a467f76da3a3c878e498531925948b36f748c50026a395ed8484b30b85ca1","observation_id":"f32d6421-83f9-4433-a70f-2b1f887c27f3","resolution":{"observed_at":"2026-08-06T17:02:45.866977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.530944Z","title":"Dense-captioning events in videos,","venue":null,"work_id":"33292fe9-ce97-40ea-ad30-e4fa8e2fb561","year":2017},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.967626Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:8388e901aaa00d1a4033b4b93d4a9ae567bfc82d4c8d0775d1dcd2427923040d","observation_id":"308d9055-154c-49cf-98d4-6832043d1a37","resolution":{"observed_at":"2026-08-06T17:02:48.623107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.390009Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips,","venue":null,"work_id":"0c22f382-a3af-4f0c-a516-0fe8705a1d2e","year":2019},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.050837Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:4545cd2de08b8d8cfbbeb0b3b273bbaaf8008cee27f4990ff6be3fd3214501e8","observation_id":"67eb9617-c53e-48fe-8b5f-e4b75ad074fa","resolution":{"observed_at":"2026-08-06T17:02:48.467621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.233053Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video- and-language research,","venue":null,"work_id":"741b1e7a-494d-431b-9b89-6b39c0380173","year":2019},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.141712Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:e653a98b393f09e00a03d9874519f6a192dc0a0391ca734082173ced213d5608","observation_id":"51708959-5173-4272-b622-144a7580e5dd","resolution":{"observed_at":"2026-08-06T17:02:48.312845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.131728Z","title":"Avset-10m: An open large-scale audio-visual dataset with high correspondence,","venue":null,"work_id":"015ca15a-4af9-4861-9a23-9cf1c234d77a","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.219041Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:2b67365e93a77154fba81f1449c930585a84d7b799fdd2ebfba3ca64a547c33a","observation_id":"1ad27a96-7e47-4f48-a2ac-5410af91390a","resolution":{"observed_at":"2026-08-06T17:02:48.184192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.001742Z","title":"Sound event envelope estimation in polyphonic mixtures,","venue":null,"work_id":"1392f2e5-b028-4fcb-ac7b-92778db86d30","year":2019},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.290229Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:2f2c144c65b8bcd5ad4517ce92342dfa4b97deae1dc6fa61b5c1ed42ffdac18e","observation_id":"b7a7a21c-6951-4462-ad65-f7a9b733d473","resolution":{"observed_at":"2026-08-06T17:02:48.052660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.859979Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"9a7bc7c1-e336-453b-ad53-c6b5cb4fd604","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.366677Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:1c6f0d842db5cdf702335f9bb643eba35223f6ce42377e51bca1ee94c17709fa","observation_id":"6e7b2256-3a88-40ee-a052-4f261cc9ebde","resolution":{"observed_at":"2026-08-06T17:02:47.918457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-06T17:02:46.431246Z","title":"Lp-musiccaps: Llm-based pseudo music captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.431246Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:3e591b386834f9d64006bd2d029866a811a831e2aa85673b62aac3cc7c5e4a67","observation_id":"a5be9aea-0026-43be-80c2-0534256b5b45","resolution":{"observed_at":"2026-08-06T17:02:46.431246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04416","last_updated":"2025-01-01T13:46:37Z","snapshot_observed_at":"2026-07-06T18:41:53.152987Z","submitted_at":"2024-07-05T11:07:13Z","title":"Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04416","snapshot_observed_at":"2026-08-06T17:02:46.490467Z","title":"Sound-vecaps: Improving audio generation with visual enhanced captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.490467Z"},"links":{"cited_paper":"/paper/2407.04416","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:ebc06b8dbf8f42ed5c54b9a122783773e016f61d7d3e85b64d18ff992cc605c2","observation_id":"400238fd-6039-465d-a1a4-3597ab50cd9d","resolution":{"observed_at":"2026-08-06T17:02:46.490467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T17:02:46.554864Z","title":"A short note on the kinetics-700 human action dataset,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.554864Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:28d0872220bc4bac828686f976ad1378d3ad55fd556a04a294388299012dc307","observation_id":"1a5b6cb5-3de1-4f72-bfa6-25d959fd7fb7","resolution":{"observed_at":"2026-08-06T17:02:46.554864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:46.631137Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.631137Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:93160f6b7495e479bf68e10314b592f225a5ff49535e2ce3ca6dee1796944a2d","observation_id":"5bb31ecb-e7fc-4aca-95e5-5150ce7a52c4","resolution":{"observed_at":"2026-08-06T17:02:46.631137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T17:02:46.721538Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.721538Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:dc925462e5e895e9c6e46af40cd39bd2991fc551cce1d35401a61a135e2fb860","observation_id":"b0fef977-f530-4dcc-aef9-3cbe601b25c4","resolution":{"observed_at":"2026-08-06T17:02:46.721538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.744313Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"a9d81513-70db-47e1-a701-2c84ccc07575","year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.808652Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:a170a85c6985caa150d02a8bfe65223bca2fa6b13bbb931e014ad0c89101ff12","observation_id":"c2c7a069-6bc6-4f75-95bd-94993b383002","resolution":{"observed_at":"2026-08-06T17:02:47.788088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.588455Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"000636a6-61db-49c7-9441-cd3631eb2ae2","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.889581Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:626a346afc8368d7df6867d2fe78079d3a4a5e07d4c3449d0a577c779480009a","observation_id":"66b550c5-b6d1-4fed-8b0f-f17f9697ef9c","resolution":{"observed_at":"2026-08-06T17:02:47.651647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-07-06T08:52:26.716343Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-06T17:02:46.945121Z","title":"Audiovisual slowfast networks for video recognition,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.945121Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:b7743d0db164948e71edae4e41a025c1d29d5fb6a7a8f3bfd7a6aaee144c321f","observation_id":"56600a93-ee73-4a74-9978-01870ce512b2","resolution":{"observed_at":"2026-08-06T17:02:46.945121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.451533Z","title":"Masked autoencoders that lis- ten,","venue":null,"work_id":"1f50673a-2969-436e-958c-19b90b8553b3","year":2022},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.993705Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:1d00eb2b1c04232ac2b37948771abefae1a8f3c97b3ba875562a371421b55806","observation_id":"099ed48e-97e1-4aa7-ad83-aa66bface629","resolution":{"observed_at":"2026-08-06T17:02:47.513305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T17:02:47.086421Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:47.086421Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:4ebf5e9a263b7b489172eb95ecbe1313b93f363f55245e3e87fab2e06b3e2be9","observation_id":"24cb7e99-41c5-435f-9db0-83539c10c1bc","resolution":{"observed_at":"2026-08-06T17:02:47.086421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:27:05.135017Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2507.11967."}