{"as_of":"2026-08-07T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:942cf1b8e65c04693e20e5b677b58939dfa4eb2d29af7895d6a2abcd5c475690","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:25:09.031246Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10963/citation-record","integrity":"/paper/2507.10963/integrity","json":"/paper/2507.10963/citation-record.json","paper":"/paper/2507.10963"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.145765Z","title":null,"venue":null,"work_id":"937c1956-339c-44c1-acaf-483d9fb08865","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.234694Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8e280815a30c64a13349e3ea0c9cb1b1aef4050e9a04b628f5aa1d39e38ee8c9","observation_id":"a6b0050e-9fd3-4062-9854-7c5975913c66","resolution":{"observed_at":"2026-08-06T17:25:17.150413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.438288Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.438288Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:20253451acc61774db8a8316ca9a9db12b82ced4a7f84fc14d1e7d12870cf733","observation_id":"de70491a-86b1-4aa4-95e5-44e4645c97c3","resolution":{"observed_at":"2026-08-06T17:25:01.438288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.692791Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.692791Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:db6ba7d46d5b08dd011b4dd8f0d6f88e408649d4466f55a15650546c15cc99ba","observation_id":"77ab3a9b-c324-4e71-9f5c-92b3ec3e8b21","resolution":{"observed_at":"2026-08-06T17:25:01.692791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.785844Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.785844Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f4ef20e90a81f1ec842181a627fe9cd2323b6ca46fa3d6be18acd03bd8a369b1","observation_id":"7b7bfa68-3a44-49d4-80ff-37e4e993fc31","resolution":{"observed_at":"2026-08-06T17:25:01.785844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.866822Z","title":"Cai, Jonas Jongejan, and Jess Holbrook","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.866822Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:543ed4cce54d30570aa5c681610dbb091e49314d690309d7c6e54d0f605c3045","observation_id":"db8bf02f-96e6-443e-98ce-60a321e659e9","resolution":{"observed_at":"2026-08-06T17:25:01.866822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.926484Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.926484Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d23a0c46fa858c2bfb13b7ff9c18bacc2d595bfc9e619eeb0f30bf3fb832904f","observation_id":"433c053b-819b-4013-8c67-cb5491bffa54","resolution":{"observed_at":"2026-08-06T17:25:01.926484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.063720Z","title":null,"venue":null,"work_id":"e92d771b-ac63-4ce3-9b31-929abbb83e53","year":2020},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.986252Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d700cbc46810479a02ba3caf6457788f7482454bc9e3cb22238feb20228923b1","observation_id":"72930a05-4636-4a30-9ff0-d4c07340f92e","resolution":{"observed_at":"2026-08-06T17:25:17.069225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.071816Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.071816Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:558c865e47787557cd6472fcbae6aaf534c1e5554ca3cda60cf8aa254982f1de","observation_id":"411ba6c3-e696-40cc-b7bd-e46f7958601b","resolution":{"observed_at":"2026-08-06T17:25:02.071816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.172870Z","title":"Guillain, Hyeungshik Jung, Vivian M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.172870Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:9cc6535fdce32200fb1832aa0b5d4277deb6f5a4dc81bba6ce09c790c4bc9589","observation_id":"96060456-9ba9-4aaf-973b-f04abb3307fc","resolution":{"observed_at":"2026-08-06T17:25:02.172870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.273487Z","title":"Corbin and Anselm Strauss","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.273487Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:44e2eda5d26b7a685f29c7f2b3abcc5cf03d1e4f7c8b19e41e9f2500f06f4de8","observation_id":"d9adcf12-8835-43ae-be36-d599ea0ce08e","resolution":{"observed_at":"2026-08-06T17:25:02.273487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07968","last_updated":"2024-05-29T21:06:18Z","snapshot_observed_at":"2026-07-06T16:31:37.625496Z","submitted_at":"2023-10-12T01:17:56Z","title":"Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation","version":4},"cited_work":{"arxiv_id":"2310.07968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07968","snapshot_observed_at":"2026-08-06T17:25:15.083817Z","title":"Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation","venue":"cs.RO","work_id":"622a3974-576a-40c2-b23c-ba4cfeb5d1c8","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.392546Z"},"links":{"cited_paper":"/paper/2310.07968","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1585b217c140ec36b33a5843cd8d1419cbfd00256e654ac885e29a1e69e0d6aa","observation_id":"f265e18b-bf87-4648-a967-c406052fc838","resolution":{"observed_at":"2026-08-06T17:25:15.125294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.474114Z","title":"2001.Where the Action Is: The Foundations of Embodied Interaction","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.474114Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:6d4fd77483c0b8a2aad43f25d96b6d6d126911371a9253a0e72b354d895ae363","observation_id":"adf4666e-e628-42ff-9ac2-2194fff09faa","resolution":{"observed_at":"2026-08-06T17:25:02.474114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3107.2025","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:14.941780Z","title":"Hudson, Mahya Beheshti, Mau- rizio Porfiri, and John-Ross Rizzo","venue":null,"work_id":"02be1095-9363-4922-985a-dc80468e6f89","year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.553998Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1bf96d69fd231b14ee42c3c4690878ea5ace46129bcbd4e3569b40b3f53b7732","observation_id":"d7a9e337-62ca-421b-8d34-1466bc03bba6","resolution":{"observed_at":"2026-08-06T17:25:14.995385Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4324/9781315707228","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:10.571424Z","title":"2016.An Introduction to Audio Description: A practical guide","venue":null,"work_id":"a213aef0-d0f8-4f09-98c2-8802952dfce1","year":2016},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.643034Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:6e504a67c690298e4f97082b1824c8ffe7b3de0b580a3dbbe463545272c62966","observation_id":"16bbb278-e162-429e-9a84-0933326a65b5","resolution":{"observed_at":"2026-08-06T17:25:10.623645Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-07-06T20:02:53.153763Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05185","snapshot_observed_at":"2026-08-06T17:25:02.720820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.720820Z"},"links":{"cited_paper":"/paper/2412.05185","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:fd58abbfd0d639867aa47626bbd30226d943f493c468dfe01b291ca367776646","observation_id":"e555be81-c022-47df-b305-a1faed9b8205","resolution":{"observed_at":"2026-08-06T17:25:02.720820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.047254Z","title":null,"venue":null,"work_id":"2be7689c-498f-4ae9-a1e1-257f1567bdb1","year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.825936Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1f540999bd71b123ab2c1b95a41a9ad47a30531ab88beeae4cb83c1ec140c88d","observation_id":"e7015431-5506-4cb4-b0ee-5348ec2a0fd8","resolution":{"observed_at":"2026-08-06T17:25:17.052473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.028186Z","title":null,"venue":null,"work_id":"aa28f7fc-5f61-4089-be78-c0b82a2652de","year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.928330Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:b1417bbba5e2175b62a3975ea5bd24da0075386f17077070e7098c62f88080ed","observation_id":"982b91ef-a6f0-422c-a7ee-360511134124","resolution":{"observed_at":"2026-08-06T17:25:17.032942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.009667Z","title":"Xu, and Jeffrey P","venue":null,"work_id":"5cac8e42-a1a3-4cba-a8d4-2116dc25e765","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.984922Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d94044b2d638936c5e0a6d3f6eaa5adcdaa19166ed81cd34512f4e17b599865c","observation_id":"e5196d14-f9cf-440e-9838-f85bc5d01032","resolution":{"observed_at":"2026-08-06T17:25:17.015053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.102194Z","title":"Haggard and Kenneth S","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.102194Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:650390c1150a310be41007eb378766d9ad300d5b62f708e3a1375de27c14d979","observation_id":"23947244-08a6-440b-a12e-edf658344f4d","resolution":{"observed_at":"2026-08-06T17:25:03.102194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.165907Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.165907Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:63bc1243656369388d2c6f4101265e3c42860373d733760e77f41974071d0011","observation_id":"feca1b01-2bc4-49a1-929f-a91e08a8e73c","resolution":{"observed_at":"2026-08-06T17:25:03.165907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.302810Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.302810Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:9772dba4b4c0f64a95c6731dfc97c37a97b5b9f6f1e3552cc92ad2152e4ab5e0","observation_id":"3b5a63ad-864c-4b81-8b8c-39a07aea3c32","resolution":{"observed_at":"2026-08-06T17:25:03.302810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.364311Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.364311Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f9aadad2ae7283dff6e73ab70c3a572d675e53eddd30c6394a7e3a3818f83d7d","observation_id":"927f06b0-77f2-4c90-92f6-409d2d0df68b","resolution":{"observed_at":"2026-08-06T17:25:03.364311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.227147Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.227147Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:6ef02db4e58302e8214e74969573035336b5788fcfe89d70b8c99dd26f46860e","observation_id":"ffe24d73-7390-4a0b-a6b7-4caa7816d88f","resolution":{"observed_at":"2026-08-06T17:25:03.227147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.977907Z","title":null,"venue":null,"work_id":"8a7019a3-f8d1-415b-9833-59ce088b12d7","year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.540147Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f26ffd2d606d0c406dd2995c3ca080b7c310b40d576944431e2739123808db2d","observation_id":"e8373e8b-e056-492f-80bb-90ce06ed378c","resolution":{"observed_at":"2026-08-06T17:25:16.983529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.588931Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.588931Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:64efa935c161ffb2a31e44c57bdb582691ba6fe06bff2e2cd1922d8322f164f5","observation_id":"ff2871f6-7f00-4fec-b15e-1122070beb8f","resolution":{"observed_at":"2026-08-06T17:25:03.588931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.427471Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.427471Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8a9089b0201bc50b9e53ff4c7db3ca514d998b3503f656f14e44d22a0ca68af5","observation_id":"f9a4101e-8e74-4986-9ee7-c2f07e1872c1","resolution":{"observed_at":"2026-08-06T17:25:03.427471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.698551Z","title":"Tjahjadi, Jiho Kim, Junpu Yu, Minji Park, Jiawen Zhang, Jon E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.698551Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:999accfd5e9d2eafa85bc7d95566deefddf9196678d150e64c8854903dae017d","observation_id":"ed465ae8-478b-4b34-ae02-f8ca1c8cfc61","resolution":{"observed_at":"2026-08-06T17:25:03.698551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.943920Z","title":"Berg, Mohit Bansal, and Jingjing Liu","venue":null,"work_id":"d38f5fed-ac6d-4ee8-9866-8d0b59709692","year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.795379Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d0c32ae2e948ae3191df3fed5232757cb2dff3cf62bd4319d3bf768da83a4016","observation_id":"027e5776-0c0d-430d-b898-9377c948aaf5","resolution":{"observed_at":"2026-08-06T17:25:16.949022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.926514Z","title":null,"venue":null,"work_id":"8cd562e3-6dfb-4387-9103-73a81debbb3d","year":2020},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.846500Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2a1d2cd5379a86f95ca927d89ebbd58382be1164f69275e5636d0fcf9de3867b","observation_id":"729aedb8-f521-455d-ac0e-8001b19d9add","resolution":{"observed_at":"2026-08-06T17:25:16.932242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.960702Z","title":null,"venue":null,"work_id":"df25f0f2-82e0-474e-85f5-e4f0053a893f","year":1995},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.642406Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:561c73953e4cee32178ea14be7af4dbf9a2babf017b5ce754a4430db65ea12e3","observation_id":"e740b209-f309-4bbe-b8db-ccbc810355a3","resolution":{"observed_at":"2026-08-06T17:25:16.965071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.949629Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.949629Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e1c2105a2a279508bf10b4ca695036d9fc549e00e9fb37b0b64666a948c72af5","observation_id":"5347e02a-2d4e-470a-89ec-5416681c5183","resolution":{"observed_at":"2026-08-06T17:25:03.949629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.885146Z","title":"Kane, and Patrick Carrington","venue":null,"work_id":"abb16457-4c8c-4f81-90ad-239c3562c1ff","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.007218Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:3625326974ac2069d58e19b5ff1bd8ae727db869e490a0bd47b0e043908ed783","observation_id":"dfc18a3c-2e65-4f33-be76-4b3e22b92499","resolution":{"observed_at":"2026-08-06T17:25:16.891361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.907800Z","title":"i choose assistive devices that save my face","venue":null,"work_id":"94310b9c-22aa-4ced-9e09-70aed863479f","year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.896409Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:5172de60b23e1d9ead159b37307bd51c9f64836dd16e976c355f3f48d8b3a4fa","observation_id":"cbeb94d8-e756-4c71-8320-b883c1353ae6","resolution":{"observed_at":"2026-08-06T17:25:16.915015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.294694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.294694Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:9b5d074b150fb6ccdd9104b1c78cd1d726b29b16c27c9833d086ec1c959279e7","observation_id":"3a4a6e69-02dd-4251-977c-3ff36d67af62","resolution":{"observed_at":"2026-08-06T17:25:04.294694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03942","last_updated":"2025-07-05T08:00:38Z","snapshot_observed_at":"2026-08-06T19:56:45.070743Z","submitted_at":"2025-07-05T08:00:38Z","title":"More than One Step at a Time: Designing Procedural Feedback for Non-visual Makeup Routines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03942","snapshot_observed_at":"2026-08-06T17:25:04.349340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.349340Z"},"links":{"cited_paper":"/paper/2507.03942","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a294d1cf962c1957db89492a88ad9f1318520d8df0bb152220e2afb00f7f0b73","observation_id":"598fa32d-cd47-4b84-aeb2-9971d954c14e","resolution":{"observed_at":"2026-08-06T17:25:04.349340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.057213Z","title":"In Proceedings of the CHI Conference on Human Factors in Computing Systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.057213Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:7b03e7cb083baf04391c3008f653f1f69954a2c42b6b622809bb601cf205ac85","observation_id":"8f8a1601-840c-45b6-bc5e-8d61dda551cc","resolution":{"observed_at":"2026-08-06T17:25:04.057213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.865633Z","title":"It feels like taking a gamble","venue":null,"work_id":"f975a1ab-d22a-4dde-b3ff-5df315e403d3","year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.451376Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a32665a5f5ae6f09ac8db9ed49d5ad9ab7392e63ff11694fab06109fefb729ff","observation_id":"f98a9c36-ebcf-486a-a481-17677a35cffd","resolution":{"observed_at":"2026-08-06T17:25:16.871687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03330","last_updated":"2025-07-04T06:30:50Z","snapshot_observed_at":"2026-08-06T20:10:47.330075Z","submitted_at":"2025-07-04T06:30:50Z","title":"Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking","version":1},"cited_work":{"arxiv_id":"2507.03330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.03330","snapshot_observed_at":"2026-08-06T17:25:13.613561Z","title":"Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking","venue":"cs.AI","work_id":"bf181e8b-a305-4fc4-9989-e18a389211ca","year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.213855Z"},"links":{"cited_paper":"/paper/2507.03330","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:86b48e9bd38dfc1b5cfe0da607a809ee331d9e880c40f760dac072c56f3ef22f","observation_id":"ba4b7e09-eda2-43a9-b692-2d0037201558","resolution":{"observed_at":"2026-08-06T17:25:13.737568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.845205Z","title":null,"venue":null,"work_id":"89cfc3d6-c4f7-4d8f-a95a-a18cf14fb8b8","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.561922Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:bff3985a6092e1dcf0ee4fc48ca738bb993d30f0f50cacb62119d55abddc4ca8","observation_id":"85ac2032-6fb8-415a-ae4f-78448f653171","resolution":{"observed_at":"2026-08-06T17:25:16.851823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.806182Z","title":null,"venue":null,"work_id":"4ddb1666-618a-4507-b770-4310daf84342","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.655239Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:7658fe9e615740f1a0abd01f16f1232e1dca8798137e1cbec0abdf00240213ca","observation_id":"0eaa74a7-3e5e-4509-b126-3199f7d39acf","resolution":{"observed_at":"2026-08-06T17:25:16.829987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.403757Z","title":"It Feels Like Taking a Gamble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.403757Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:46d2ef810032e1a887a8e0995624d6e21454937a2c6a1489b34060df5eb70e6c","observation_id":"1567feda-4e0b-4e52-8991-1aee61fc0775","resolution":{"observed_at":"2026-08-06T17:25:04.403757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.936392Z","title":"Inescapable","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.936392Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e3d420649cee9762c9fbcc1193e0016ea546cf921dd4c8ba645a5d5440f9682e","observation_id":"888dcb43-aa18-49f2-b380-8895c7b1548e","resolution":{"observed_at":"2026-08-06T17:25:04.936392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.500141Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.500141Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a8de4149edc456bd745e43e2db4bd66c1425ac3c681929a45864cad418a2eaaa","observation_id":"2d81fd1a-64bf-40a2-9d03-012c837b3c18","resolution":{"observed_at":"2026-08-06T17:25:04.500141Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.512456Z","title":null,"venue":null,"work_id":"b784a5e7-6a06-4591-a8ca-b2381b86e3b0","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.105358Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2d899cb8a487e45f6c72f5e59966012144564b0bebd0f0c6e7be18ae05a127cc","observation_id":"d7f6cf18-5138-454d-8331-b54ededb9acc","resolution":{"observed_at":"2026-08-06T17:25:16.562269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.347724Z","title":null,"venue":null,"work_id":"eba73741-7f60-471a-980f-2e94fcc03e8c","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.255123Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d8c8725e14eb4b1947a42ec51b97230aed918fc17204c227b25dad8be5239e58","observation_id":"8914fe52-d31c-41b5-92ba-28ca6ad9d010","resolution":{"observed_at":"2026-08-06T17:25:16.406536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.491797Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.491797Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:69797583fabb2347fbd39bad7f20f8350ffd80f50e4a2ebfc02a088ba26c53b8","observation_id":"681c653d-166b-4c8d-b51c-eb9a05d93b0c","resolution":{"observed_at":"2026-08-06T17:25:05.491797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.633664Z","title":null,"venue":null,"work_id":"4bc09904-07dc-42a5-851c-142c5dd248b7","year":2017},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.859371Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:ef0f68885240eb247dcba00bfbe2d436125035bec472044c627042f791b7b7e4","observation_id":"263517d7-c38e-46bf-8843-80ce33e2fd86","resolution":{"observed_at":"2026-08-06T17:25:16.693759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.728789Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.728789Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0f0933be30c61a98699d9ec6e83af4fbf0220c20dc66a2547aa1546c3b352435","observation_id":"cc652760-b79c-4997-bcfc-a2a6640c4006","resolution":{"observed_at":"2026-08-06T17:25:05.728789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.018995Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.018995Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:29ff02ef50ae49ae5503bb2a0e6989f93f129edf6f40c79fade46ac276a31803","observation_id":"5ddc7403-8271-4a08-b0e5-bc6d197e666a","resolution":{"observed_at":"2026-08-06T17:25:05.018995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-023-37678-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:10.320214Z","title":null,"venue":null,"work_id":"d92dda64-13bb-495a-90be-7b762b6e2509","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.952157Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a470f22d8e14a11636942e7fcb36485a1523f97e749ea63eba2868b11f6b2706","observation_id":"aa3c0595-bcab-41b8-9269-548e87814749","resolution":{"observed_at":"2026-08-06T17:25:10.376951Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12181","last_updated":"2024-09-23T14:39:07Z","snapshot_observed_at":"2026-08-05T14:35:40.369441Z","submitted_at":"2024-09-18T17:53:17Z","title":"A Controlled Study on Long Context Extension and Generalization in LLMs","version":2},"cited_work":{"arxiv_id":"2409.12181","doi":"10.48550/arxiv.2409.12181","metadata_source":"pith","pith_arxiv_id":"2409.12181","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"A Controlled Study on Long Context Extension and Generalization in LLMs","venue":"cs.CL","work_id":"165e8595-e314-4e2a-9e00-a7171742bd92","year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.037118Z"},"links":{"cited_paper":"/paper/2409.12181","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:c1105937027399a409afa457b82f92afd4aa5608fdd9e2eff5f12a83ca73dbb4","observation_id":"1fa3f1f0-81d7-48a9-8575-3ba5755f627a","resolution":{"observed_at":"2026-08-06T17:25:10.228596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.91006","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:11.848063Z","title":"Lucas, Zack Arambula, Alexandra M","venue":null,"work_id":"64f048fd-4b06-447a-ae46-2f128b58b4c2","year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.147092Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f0b7bb63563582e6d2ddc15374c7201d76733daf9b3132bbcc37cece8cd8d3ec","observation_id":"0599d479-366d-4d85-899b-b64d5bf02d14","resolution":{"observed_at":"2026-08-06T17:25:11.958521Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.learninstruc.2011.03.004","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:10.012373Z","title":null,"venue":null,"work_id":"16101118-f124-43d2-ba43-714dc0bab44c","year":2011},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.235275Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f2768b09976c68b95eca35af5465e2eb040ae42c7fbf7d9cfc9c9f73b9ab5142","observation_id":"6ec9ed3c-aabf-49c1-b102-b8b0b4e2babb","resolution":{"observed_at":"2026-08-06T17:25:10.082133Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3329168","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:09.855286Z","title":null,"venue":null,"work_id":"abd1adfe-ca3b-4200-a469-cb4294bd204f","year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.398489Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:71ef6d250a3bfa8c2b296a0ca637200ccb9b969a02d1733d35cda0eca3e5f2c7","observation_id":"fde5cb8a-fa55-474a-afc4-8561a9da08d8","resolution":{"observed_at":"2026-08-06T17:25:09.928864Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.596393Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.596393Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0af2eee9bd39a442269668dbe5590b122ce0ec009fe329cd72522f4e89449d85","observation_id":"82ca866f-3c14-439b-9d2d-ea8485db7478","resolution":{"observed_at":"2026-08-06T17:25:05.596393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.29734","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:11.418522Z","title":null,"venue":null,"work_id":"f7f9e4c4-f406-45c3-a1e1-bf763d96ffb5","year":2020},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.694553Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1657392cf62dca2bf06df2621cf2a72cfbb308d0a62c9c938e13d4861c4f78e6","observation_id":"33c7c8e5-c392-4bf2-8186-e2ec04d4009f","resolution":{"observed_at":"2026-08-06T17:25:11.486194Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.850000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.850000Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:b0d45ba5de7b683e309a45720f46534785c2ae1424766b88960385dc1e0a50af","observation_id":"c75cc50a-faef-4694-bb83-7b5b3fb4ac47","resolution":{"observed_at":"2026-08-06T17:25:05.850000Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.174683Z","title":null,"venue":null,"work_id":"de8a5e1c-d369-464d-a6b9-c49a826cfe2a","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.879122Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:547314f849ccae8282d138efffe81ff54029f24d7c19c7e0fc7253bec5708b74","observation_id":"cee7d160-a5a7-48b1-9331-6b163cbecd53","resolution":{"observed_at":"2026-08-06T17:25:16.259802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2979.30316","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:11.067029Z","title":null,"venue":null,"work_id":"0ee89f6c-db0d-42b5-84e3-01ae1d304a20","year":1999},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.983300Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:00199795d40edbcd711178a45ffe201b7be403f2a2836d6ace1e3e1ee53a942a","observation_id":"d4bf26e6-5df6-4768-a365-160026443a35","resolution":{"observed_at":"2026-08-06T17:25:11.123905Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:07.151350Z","title":"Patil, Don Kurian Dennis, Chirag Pabbaraju, Nadeem Shaheer, Har- sha Vardhan Simhadri, Vivek Seshadri, Manik Varma, and Prateek Jain","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.151350Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:dd0792a62ba6e6c9d6eea77987510a4dab33aca81581a4abe201a0e51f532002","observation_id":"35f4b78a-1fde-4634-82cc-4c578a378644","resolution":{"observed_at":"2026-08-06T17:25:07.151350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:07.325418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.325418Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:c35f5efe9251b1f713d3077b564e65148cc1da5a0eb3f57867c13685a96ba5ba","observation_id":"29fa071b-5e49-429a-ba19-c8054de455ff","resolution":{"observed_at":"2026-08-06T17:25:07.325418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:07.466492Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.466492Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2e972810c95993806887287306f97bede594cadc8d1ddfd070794500cbf61326","observation_id":"68331d32-ae4b-4ebd-ba9d-9d1dc7399eaf","resolution":{"observed_at":"2026-08-06T17:25:07.466492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ics.2005.05.215","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:09.407880Z","title":null,"venue":null,"work_id":"bd21b5e8-bf47-47c8-a200-bed4d5d1b5a7","year":2005},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.677508Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:9e684dfd16e5d07a3f64d0bfc4ce02c14b24d4cee8aeecaff63130b328b20af3","observation_id":"eade4315-725b-43ca-ae1d-85479ec5fd14","resolution":{"observed_at":"2026-08-06T17:25:09.496909Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:06.806117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.806117Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:291f2d235ae884a81e22eee5cf674fd5bb800f5e509705f92f4c79c6162df52d","observation_id":"724ab721-c160-4367-b3ff-05f98248caa8","resolution":{"observed_at":"2026-08-06T17:25:06.806117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.068972Z","title":"Turkstra, Tanya Bhatia, Alexa Van Os, and Michael Beyeler","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.068972Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:956e13cb38fddf0982a1bbd3eecf1840fc871208b1ab722c6d3b1791bdf371a7","observation_id":"4af177f4-8916-4058-97a8-4523f6854279","resolution":{"observed_at":"2026-08-06T17:25:08.068972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.224488Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.224488Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8cf545b9d7635320938902af2080744e796dea326dd9bd25931b8e6e2ef88c99","observation_id":"c71e65ef-35ee-4f99-8aa3-6fe1c5c0c1b2","resolution":{"observed_at":"2026-08-06T17:25:08.224488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.313878Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.313878Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:ec3a55a7b0031b0b430a325eefdbe8d0eff583267ee7a1e45c14c55315f8a1f6","observation_id":"7caabff4-9c67-4175-ac42-4b2ea542a64d","resolution":{"observed_at":"2026-08-06T17:25:08.313878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.417926Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.417926Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:55b0218bc1ccc1de90b9ca2791e69bf72cd98d22afbf01b92aa910d5593ff7b2","observation_id":"7384a1fc-b7a4-40b6-a422-ab0e195801fe","resolution":{"observed_at":"2026-08-06T17:25:08.417926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/h0074898","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:09.149923Z","title":null,"venue":null,"work_id":"6c199512-26b6-4efa-b283-590b7695c1ec","year":1901},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.560765Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0c9427109cbdf1eb61b4490b9783cfd3bd13784d6e0811ede02b933a58bf5856","observation_id":"d8cb5eba-eae3-45ff-af30-b74b3f055e5b","resolution":{"observed_at":"2026-08-06T17:25:09.244133Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7763/ijmlc.2012.v2.137","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:09.633344Z","title":null,"venue":null,"work_id":"ae56fb6d-64e6-40de-9bc6-4187fadb1a30","year":2012},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.580017Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8f81c415d87ca09520146808e73ea66dcb738549360b5ea29077373f4dad90e5","observation_id":"b6763879-42d7-4f0f-8013-d09fd98bdb45","resolution":{"observed_at":"2026-08-06T17:25:09.715157Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:15.742133Z","title":null,"venue":null,"work_id":"64af5196-6ba8-4e49-9e46-e7d23c62cb65","year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.918757Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d6e2c0257264c6781827ab6b6c7c00792fbde5b30469c949d5d65a43b1db92d8","observation_id":"03b7b14a-672a-4ea4-bc80-64691c558ca0","resolution":{"observed_at":"2026-08-06T17:25:15.799885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.046010Z","title":null,"venue":null,"work_id":"b496524c-350d-4473-80b0-fa018634c103","year":2016},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.940720Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:3a019c98cafe9abd82104bfe61580c62075660f7247bf52248509f400002e210","observation_id":"3e76c7e0-dd61-4cb9-bed8-095493400775","resolution":{"observed_at":"2026-08-06T17:25:16.088091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.654557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.654557Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:466bb6c08d061b1c82c60e36bd68f3bfc0d9e53e1c824613dbd6dc9752eb338a","observation_id":"2db8a4ff-90ee-4a45-ab0b-18dd6f25f62b","resolution":{"observed_at":"2026-08-06T17:25:08.654557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:09.031246Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:09.031246Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:be5afcd7934738df69cfd106d2bf9417f1455e9f787faf017f63c2f38122a1aa","observation_id":"f3820112-fe35-4f82-a377-fd428b87aa7f","resolution":{"observed_at":"2026-08-06T17:25:09.031246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.086371Z","title":"In Proceedings of the 33rd Annual ACM Conference on Human Factors in Computing Systems","venue":null,"work_id":"592dbf5f-236c-435a-92f3-a70417b1f896","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.540262Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:c274ad3db91092d85375cebfce2912345b01642a6dcf4c1272a0f07d9f029dba","observation_id":"569105e0-0e86-457b-a4d4-0f71fa3c9f07","resolution":{"observed_at":"2026-08-06T17:25:17.092332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.128115Z","title":"ACM Computing Surveys (CSUR)52, 6 (2019), 1–37","venue":null,"work_id":"34858ad7-c61b-4716-8299-ff7e5e8ed2fa","year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.321914Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:711efa94bf1a18671de53f0cc6ab81ad955c34035f23c3ad6ecdfa5bbeabe405","observation_id":"793f6b96-a73f-49f3-b398-ef4b2943cbcd","resolution":{"observed_at":"2026-08-06T17:25:17.133290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1300.33833","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:12.435401Z","title":"In Proceedings of the 17th International Web for All Conference","venue":null,"work_id":"8e91c189-e0fc-4a81-97fb-910da84965e6","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.402104Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:cb940d016fc6f5e12e775da200c0af8d8601a4523737badaf7e50f17a782c572","observation_id":"a4d18bba-9da3-46b0-9102-ee19a871a9fd","resolution":{"observed_at":"2026-08-06T17:25:12.595782Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:15.877362Z","title":"1686–1697","venue":null,"work_id":"8da6e539-b9c2-4379-be15-96a9932dc2bf","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.803114Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e368abbb13439119dba8dac571d27079ba704d24c2c21aa2a9de51ca8f17ec35","observation_id":"c93cb481-2d0f-479b-a331-4e59dc690beb","resolution":{"observed_at":"2026-08-06T17:25:15.923745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.749570Z","title":"In 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.749570Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0405f187447f43796934c4f0bcd24fe51bdc8a831e498ae0d89377bde0b25b49","observation_id":"66427e06-7ab7-41b5-afaf-499cf8363d8c","resolution":{"observed_at":"2026-08-06T17:25:04.749570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.193500Z","title":"InProceedings of the 2023 CHI Conference on Human Factors in Computing Systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.193500Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:10e6e505c1fdb910cd0906171b17f2ca45b25578fac33da7fb19819fc2c42d8c","observation_id":"b366b69d-1c64-45ee-adf0-bc8a8c15bb02","resolution":{"observed_at":"2026-08-06T17:25:05.193500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","latest_version":1,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-06T17:17:47.417758Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":2,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":55,"verified_exact":10,"verified_fuzzy":8},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2507.10963."}