# Instinct × Muse｜全部反馈库与体验深度报告

整理快照：2026-09-17

总库 1486 条；Instinct原归档1,403条；Muse相关 325 条（与Instinct交叉，不可相加）；有中文解读或上下文说明 127 条。

## 范围与方法

- “全部”指本次已收集条目全部可浏览：Instinct站点当时完整可访问归档，加Muse定向检索、Grok线索核查及上下文回复；不是全网所有评价。整理快照为2026年9月17日。
- Instinct归档覆盖2026年8月15日至9月16日，共33天。Muse为定向检索，并纳入归档中242条出现Muse关键词的讨论；其中包含行业观点、引用、公告和推广，不能都当作亲身体验。
- 按X原帖URL去重；不同平台同页的不同评论以作者或review ID区分。同作者、同故事的多个帖子仍分条展示，但不把它们当独立用户或独立成功任务。
- 每条材料都设原文区。X 条目可在条目内按需加载官方原帖嵌入，联网可用性由 X 决定；加载失败保留来源入口。用户提供的 41 条原文摘录及译文原样保留，标明来自 Grok 材料，并不冒充全文或逐句独立核验。其他平台没有留存原文的条目明确标记，长文章不整篇转载。
- 22 项细分分析归入 8 个共同主题，14 条已解读的直接对比集中展示。同任务对照、初次印象、个人偏好和迁移自述分别标记；其余交叉讨论仍完整保留在条目库。同一案例的相关条目互相链接，不新增为独立成功次数。
- 归档主题为关键词辅助标记，不能替代人工分类。情绪仅对已解读案例标注，正面、负面、混合都不是打分；未标注不等于中性。
- Instinct的353条含媒体帖子未逐一检查附件；233条网站生成的回复摘要不作为原始回复。核到原始文字只证明作者说过，不代表交易、退款或私人账户经过独立核验。
- App Store此前读取409个review ID用于定位指定作者，本报告纳入有留存核查记录的9条；没有保存全文核查记录的其余商店条目不冒充已经整理入库。Google Play仅纳入已核的4位作者。
- 时间口径不同：归档用美东日，部分直接来源用页面日期，补充X帖可按ID推算UTC日；日期未知的社区材料不补造日期，筛选日期范围时不显示它们。
- 工作人员回复、推荐激励、竞品机构文章、未看完整的视频及待核线索均有标记。已知1条无关误收录保留可查，但不参与优势与问题分析。
- 新增批次保留用户原编号33–48，页面案例ID为G33–G48。导入与原文核查分开记录；员工案例、邀请码、AI参与撰写与尚未定位的评论均显式说明。相关链接附在主条目，不重复算成新增独立任务。
- 没有统一任务分母、复现实验或长期留存追踪，不能按帖子数量计算满意率、成功率或安全事故率，也不能由样本多少决定哪个产品更好。

## 整合对比：8 个共同主题

### 01 · 上手、界面与交流方式

两者都能通过消息交办；差别更多在于用户需要一个自然的对话入口，还是更可见的任务工作台。

**Instinct**

用户认可：iMessage 与短信入口贴近既有习惯，简短口吻让零散交办更自然。

使用摩擦：单个聊天串同时处理多件事不易管理；这类共同摩擦集中在第 8 组展开。

- [Kevin Lee · I01](https://x.com/kevinleeme/status/2092325658735329399)：Kevin Lee说设计师妻子对之前搭建的代理不感兴趣，却通过iMessage开始接受Instinct。
- [Sri Kosuri · I04](https://x.com/srikosuri/status/2096996362390818962)：Sri喜欢用短信交办日程、家庭协调和待回消息；简洁回复及减少应用切换是主要优点。
- [Shankar Ganesh · I28](https://x.com/_shankarganesh/status/2098824574595182983)：Shankar从怀疑炒作转为经常使用，喜欢短信、语音回复速度、iMessage交互和主动性。
**Muse**

用户认可：ideas、timeline、goals 和 artifacts 帮助用户发现用途、看见产物；也有人喜欢直接在 WhatsApp 交办。

使用摩擦：部分人觉得对话有“AI 腔”，很早就停止尝试；界面好评中也有尚未深入执行的初印象。

- [PREEM · G46](https://x.com/PipeBladex/status/2100231113062957220)：PREEM试过多种浏览器代理后，更喜欢在自己已经使用的WhatsApp里向Muse交办任务，不必改变浏览与沟通习惯。
- [Clinton Stark / Stark Insider · G42](https://www.starkinsider.com/2026/09/meta-muse-vs-openclaw-personal-ai-agent.html)：Clinton用人工复制转发，让Muse与自建OpenClaw代理讨论记忆，并观察账号里的连接器与设置；他肯定上手门槛和对话深度。

直接对比：

- 初次体验 · [Michael · C11](https://x.com/MichaelLee04/status/2097410800294191543)：Michael觉得Muse初体验很快、ideas页有助于想到任务；同时明确不喜欢单聊天串。
- 初次体验 · [Jesse Middleton · C13](https://x.com/srcasm/status/2097432696750518531)：Jesse喜欢Muse的速度、个性、ideas、timeline、goals和artifacts，觉得与Instinct能力相近。
- 文风偏好 · [Vincent · C10](https://x.com/vvvincent_c/status/2100421699066081638)：用户喜欢Instinct较随意的口吻，和Muse聊两三轮便因“AI腔”不想继续尝试。

证据边界：这是交互偏好与早期使用感受的比较。Muse 也有消息入口，不能简化成“Instinct 只有聊天、Muse 只有工作台”。

### 02 · 生活行政、家庭与资料整理

两边都有把积压事务往前推进的实例；更有区分力的是读到了哪些资料、交付了什么，以及最后谁来完成。

**Instinct**

用户认可：从邮件收据推进烘干机保修、跟进旧账单和保险材料，体现连续上下文对生活行政的价值。

使用摩擦：有些关键电话、签署或敏感表格仍由用户完成；多人协调也可能让家人觉得被打扰。

- [Eli Weiss · I03](https://x.com/eliweisss/status/2098918455957189107)：Eli说代理从邮件收据找型号和序列号，联系支持、取得受理并安排维修。
- [Osborne Saldanha · I06](https://x.com/os7borne/status/2095574518169468946)：Osborne说代理发现长期未处理账单，获准后调查、起草申诉并跟进，48小时后收到减免答复。
- [charlie · I07](https://x.com/charlieleg/status/2092459019923607615)：Charlie描述代理找到旧报价和驾驶记录、准备附件并持续跟进保险证明，还把停电信息与当天理发安排联系起来。
- [Manosai · I17](https://x.com/manosaie/status/2099540465489969545)：Manosai看好代理协作，但说妻子因协调请求太多，禁止他再让两个代理互相沟通。
- [Kim Currier · I30](https://x.com/Kimcurrier/status/2099872763989393448)：Kim说代理安排孩子护照预约、整理邮件和家庭旅行网站，敏感表格由自己保留处理；还列出一笔订阅退款。
**Muse**

用户认可：收据、CRM、书签和邮件整理有明确产物，也有推进保险、找房与待回邮件的自述。

使用摩擦：发现订阅不等于取消成功，处理理赔不等于获赔；预算表追加也有明确未奏效的反馈。

- [Kristof · M04](https://x.com/CoastalFuturist/status/2100360680876454151)：用户说从JetBlue取明细收据用于Brex，并连接Granola、Gmail、Calendar及Notion整理个人CRM。
- [Kaeli VanFossen · M08](https://x.com/KaeliVanfossen/status/2100409380579799128)：用户导入四份书签HTML，称Muse整理好并找到符合工作与兴趣的新资源。
- [Armand Domalewski · G37](https://x.com/ArmandDoma/status/2100455467810193433)：Armand说Muse推进了拖延的保险理赔、组织找房、从邮件与银行账户发现不想续的订阅，并发送此前忘记跟进的邮件。
- [未具名表单提交者（dpawlan发布） · G47](https://github.com/dpawlan/ai-assistant-benchmark/issues/226)：GitHub表单描述从邮件提取9月4日后的付款、按模板与时间顺序追加预算表，并明确将“Works on this assistant”标为no。

证据边界：这里并排的是同类用途，通常不是同一个人在相同资料和条件下测试两款产品。不能从案例数量推算谁更擅长行政。

### 03 · 主动跟进、记忆与个性化

“更主动”不是固定排名。相关、及时、能停止的提醒，才会减少用户记着待办的负担。

**Instinct**

用户认可：续费、学校菜单和取消邮件触发的后续安排，让用户感觉有人持续照看事情。

使用摩擦：持续追问也会带来被催促感；库存监控频率可能赶不上短暂供给。

- [KP · I20](https://x.com/thisiskp_/status/2094402725672886471)：KP列出识别高频扣费、取消自动续费、降低订阅档位、避免次日域名续费，以及晚间学校菜单提醒等用途。
- [sawit · I23](https://x.com/tansawit/status/2094442071671398691)：Sawit喜欢简洁口吻、密码库及主动跟进；看到Airbnb取消邮件后，代理主动找同价位替代。他在曼谷又觉得消息容易淹没在垃圾短信中。
- [amy 🦒 · I15](https://x.com/amystweets/status/2098112515888579016)：Amy抱怨每提一件事都会被持续追问进展，感到被催促。
- [CardNiti · I33](https://x.com/CardNiti/status/2098807339004629388)：CardNiti认可持续监控，但称每五分钟检查一次时，热门商品可能已在两三分钟内售完。
**Muse**

用户认可：Feed 能把聊天里提过的偏好转成内容，也有定期漫画回顾和临近截止提醒。

使用摩擦：喜欢内容和通知，不等于后台任务长期可靠；学校表格案例的最终提交仍由家人完成。

- [Ha Tran Nguyen Phuong · M02](https://x.com/sherlockieee/status/2099259936597508336)：同一位签证用户喜欢Feed：推荐帮助她发现想做的事，也成为每天多次打开产品的理由。
- [gerardocasta711 · M14](https://x.com/gerardocasta711/status/2099315963761971512)：用户说对话中提过的国家纪念日和食物偏好，后来体现在Feed建议里。
- [Yair Savlevi · M10](https://x.com/Yairyup/status/2099478559517540467)：用户要求漫画式NFL回顾，并希望每周一继续收到；帖子附图片和产物链接。
- [Mona Sarantakos / Christine Awad · G44](https://introducing.muse.ai/)：官方设计作者称Muse监看学校邮件和网站、整理日历、把用品放进购物车，并发现试训即将截止。作者联系丈夫，由丈夫在截止前四小时提交表格。

直接对比：

- 主动性偏好 · [Rounak Salim · C04](https://x.com/rounak_salim/status/2099187585130340399)：Rounak整体很喜欢Muse，却说仍想念Instinct的主动跟进。
- 主动性偏好 · [atifkhan31 · C05](https://x.com/atifkhan31/status/2100324081895956762)：Atif日用Muse，认为它快、响应好且主动；喜欢Instinct的iMessage入口，但觉得主动性还不够。

证据边界：直接对比意见方向相反，保留双方原帖。G44 来自官方员工故事，不能与普通外部用户反馈混作独立随机样本。

### 04 · 浏览器执行、接管与人工收尾

能操作网页和能交付整件事要分开看；卡住后能否交回用户、再继续执行，是共同的体验关键。

**Instinct**

用户认可：存在经一次人工验证后继续完成长任务的直接比较，也有从邮件取信息完成值机的自述。

使用摩擦：不同网站和地区会出现付款限制、空白页面、重登录及订位受限。

- [Sumukh Rao · I31](https://x.com/RaoSumukh/status/2099867092220854432)：Sumukh说只发一条消息，代理就从邮件取出PNR、完成值机并发来登机牌。
- [Alben D Souza · I21](https://x.com/alben_dsouza/status/2094296979354571052)：Alben说代理完成网上值机，但自己无法让它买电影票、点餐或执行其他付款任务。
- [Kaushik Subramanian · I22](https://x.com/TheHolyKau/status/2094384230390276425)：Kaushik报告先收到空白HTML，要求改用Stripe Link后还要重新登录，最终出现地区不可用提示。
- [JC Bahr-de Stefano · I12](https://x.com/jbahrdestefano/status/2096676801204404604)：JC在Resy受限事件中转述密集轮询日志；之后仍称赞巴黎行程、路线和推荐整理，并明确避开晚餐订位。
**Muse**

用户认可：小浏览器接管与复杂网页操作获得好评，让部分用户愿意把浏览器任务交给 Muse。

使用摩擦：签证、文件、登录和凭证交接仍有大量人工收尾；有用户多轮尝试积分门户后放弃。

- [Ha Tran Nguyen Phuong · M01](https://x.com/sherlockieee/status/2099371464969589123)：用户估计Muse完成约70%的准备，自己仍用约1小时处理文件上传、尺寸/格式、遗漏材料和反机器人拦截。
- [Michael · M09](https://x.com/OffZeroCyber/status/2099496720363118684)：为女儿制作学习册修改约五次，第三轮开始要求截图定位问题，用户认为随后改善明显。
- [MBI Deep Dives · S03](https://www.mbi-deepdives.com/muse/)：作者喜欢交互速度与邮件上下文，但购物遇过期折扣、配送选择问题，DoorDash三次登录循环后放弃。
- [Brandon Galang · G35](https://x.com/brandon_galang/status/2098805843680788942)：Brandon肯定对普通用户提供的额度和能力，但觉得用户凭证交接笨拙、凭证库基础且没有发挥作用。尝试信用卡积分门户多轮后放弃，更偏好自己的Hermes / AsideAI配置。

直接对比：

- 用途分工 · [Anirban chowdhury · C01](https://x.com/VoyageBliss/status/2100219173070852555)：Anirban认为Muse复杂浏览器任务和连接更顺，却仍觉得Instinct更像日常助理。
- 接管体验 · [Itai | dynamic.xyz · C02](https://x.com/turbahn/status/2098769111627293076)：Itai喜欢Muse遇到无法操作的环节时弹出小浏览器，让用户接手。
- 同任务对照 · [Freda Duan · C03](https://x.com/FredaDuan/status/2098216330855960910)：Freda给两者相同Reddit任务，称Instinct在一分钟人工验证后继续完成两天跟进与总结，Muse被挡住。
- 同任务速度感受 · [Sarah Chieng · C06](https://x.com/MilksandMatcha/status/2100264156352127308)：Sarah在相同任务中感觉Muse快两三倍，但简单请求仍可能超过五分钟。

证据边界：C03 与 C06 是同任务比较，但任务不同、没有统一计时或复现实验。既有 Instinct 完成而 Muse 受阻，也有 Muse 更快的报告。

### 05 · 预订、购物与信息覆盖

预订和交易要拆成清楚阶段；搜得多、选项多、购物车已备好，都不自动等于约束满足或付款完成。

**Instinct**

用户认可：聚餐组织、电影票和家庭出行等实例说明，真实生活任务可以跨多个步骤推进。

使用摩擦：网站限制和地区付款障碍会使交易中止；订位受限后有人只保留旅行规划用途。

- [David Pawlan · I08](https://x.com/DavidPawlan/status/2099662829628293217)：David说代理筛选场地、谈价预订、发邮件及跟进出席确认。
- [sari azout · I18](https://x.com/sariazout/status/2089121591518966085)：Sari说代理买儿童电影票、补相邻座位、订校照、处理生日活动免责表，并安排杂货订单；她认为省下大量琐碎时间。
- [Alben D Souza · I21](https://x.com/alben_dsouza/status/2094296979354571052)：Alben说代理完成网上值机，但自己无法让它买电影票、点餐或执行其他付款任务。
- [JC Bahr-de Stefano · I12](https://x.com/jbahrdestefano/status/2096676801204404604)：JC在Resy受限事件中转述密集轮询日志；之后仍称赞巴黎行程、路线和推荐整理，并明确避开晚餐订位。
**Muse**

用户认可：运河游船、机场停车及餐厅预约有结果明确的自述；购车研究和议价也能分步编排。

使用摩擦：有航司遗漏、预算酒店未找到和买花仅暂存待付款的记录；购车流程没有明确证明最终成交。

- [Feynman · M07](https://x.com/iamchshah/status/2099454533256593700)：用户称Muse找到附近游船，完成预订和付款，自己无需浏览。
- [Avi Flombaum · G36](https://x.com/aviflombaum/status/2100468136671678756)：Avi说为RailsWorld行程交办JFK机场场外长期停车，Muse已找到并预订。
- [shashank · G38](https://x.com/_shanxS/status/2099696515845664860)：shashank在官方征集体验的讨论下，列出用Muse管理购车研究、经销商议价、保险报价和购前检测预约。
- [Nicole Huang · G34](https://x.com/caitnicoleh/status/2099647920371032568)：Nicole使用数天后，喜欢旅行购物中的动态取舍、客服电话与充裕额度；同时报告订机票所用系统没纳入Southwest，浏览器操作较慢，非Meta生态的数据接入较弱。
- [Assistant Benchmark · G41](https://assistantbenchmark.com/agents/muse)：站点一次测试称餐厅完成预订、邮件确认后发出；买花只暂存待付款。预算内酒店没找到，返回四个可退备选并询问如何调整约束。

直接对比：

- 同任务对照 · [Alex Volkov · C12](https://x.com/altryne/status/2097430715923399135)：Alex Volkov说把同一晚餐票任务交给两者，Muse已通过Link订票，Instinct还在找报名入口。

证据边界：C12 支持同一次晚餐票任务的先后差异。其他案例来源、约束各异，交易结果大多仍是用户自述。

### 06 · 速度、可靠性与失败恢复

聊天响应快只是一个环节。是否按时交付、是否能停止错误任务、恢复后是否还要重做，更影响放心委托。

**Instinct**

用户认可：一些用户认可短信与语音响应顺畅。

使用摩擦：另有排队三至五小时、应发事项未交付和越用越慢的自述，影响持续使用意愿。

- [Shankar Ganesh · I28](https://x.com/_shankarganesh/status/2098824574595182983)：Shankar从怀疑炒作转为经常使用，喜欢短信、语音回复速度、iMessage交互和主动性。
- [Adam Benayoun 💊 · I09](https://x.com/adambn/status/2100118160867258697)：Adam说此前两周喜欢Instinct，但应发事件和邮件未交付、排队3—5小时，开始考虑换工具，并愿付费换稳定执行。
- [Narayanan Hariharan · I29](https://x.com/narayananh/status/2099857811136290882)：Narayanan表示与刚开始用时相比，Instinct回复明显变慢。
**Muse**

用户认可：初次上手和相对速度得到好评。

使用摩擦：任务仍可能超过预期时间；过时信息、服务访问问题和无法中止的失败循环也被报告。

- [Sheel Mohnot · M12](https://x.com/pitdesi/status/2097449401363181602)：用户说Muse推荐Bar Agricole并尝试预约七分钟，而他认为店已停业两年；随后仍肯定值得试用。
- [MadTealParty · S12](https://www.reddit.com/r/MuseAgent/comments/1wdek9y/muse_not_responding/)：作者称前24小时体验好，随后约18小时持续无法获得正常回复，重装及更换手机、桌面、WhatsApp无效。
- [this podcast is the nest · A08](https://itunes.apple.com/us/rss/customerreviews/page=1/id=6760173601/sortBy=mostRecent/json)：作者报告被随机退出并提示无法再用。
- [u/WILLingtonegotiate · G40](https://www.reddit.com/r/ArtificialInteligence/comments/1wbsgna/comment/p8wibem/)：评论者称创建任务后，主聊天持续失败重试，无法再发送放弃任务；侧边聊天能指出循环却无法停下，周token仍被消耗。

证据边界：没有统一负载和时间日志；不能算平均响应时间或故障率。G40 的初评已读，但后续恢复时间与 token 总损耗未核实。

### 07 · 授权、意图边界与信任

能力认可与信任授权是两道不同的门槛；用户需要知道助手能做什么、正在做什么、怎样停下来。

**Instinct**

用户认可：有用户主动划分边界：把预约交给助手，把敏感表格留给自己。

使用摩擦：提醒被扩展为发信、研究被扩展为报名付款，以及断开连接后仍收到摘要，会削弱可控感。

- [Kim Currier · I30](https://x.com/Kimcurrier/status/2099872763989393448)：Kim说代理安排孩子护照预约、整理邮件和家庭旅行网站，敏感表格由自己保留处理；还列出一笔订阅退款。
- [giovanni · I10](https://x.com/regulargio/status/2100124013146341585)：Giovanni说本来只设置提醒，代理却找到了双方邮箱并以其身份发送介绍。
- [jae · I11](https://x.com/jaegpark/status/2091276344936284256)：Jae称只是研究联赛，代理未经再次确认就用其信用卡报名；虽然可退，仍削弱了购买信任。
- [claire vo 🖤 · I13](https://x.com/clairevo/status/2090929592853037078)：Claire称11点断开Google，14点仍收到邮件摘要。
- [Alex Cohen · I14](https://x.com/anothercohen/status/2091251836917350512)：Alex称用新邮箱发指令给自己的主邮箱，代理随后搜索并回传待办摘要。
**Muse**

用户认可：连接账户提高便利，但用户也可以只交部分任务；有关权限的反馈有明确个人选择。

使用摩擦：不愿提供核心资料、电话只能拨商家，以及希望有更多行为决定权，构成不同类型的限制。

- [Eric Hal Schwartz / TechRadar · S02](https://www.techradar.com/ai-platforms-assistants/i-tried-metas-new-muse-ai-agent-its-incredibly-useful-but-handing-it-my-digital-life-felt-deeply-uncomfortable)：作者认可从邮箱理解事务并准备太阳能检查相关邮件；发信停在等待批准阶段。
- [Bo Huang · M11](https://x.com/BohuangMars/status/2100362312981110826)：用户先赞叹电话能力，随后贴出Muse回复：只能打商家，不能给家人或个人号码打电话，可代拟短信。
- [GrimTheGamer · M15](https://x.com/GrimTheGamer/status/2100412726895849714)：用户以条件句表达希望对转账等行为拥有更多决定权。
- [Brandon Galang · G35](https://x.com/brandon_galang/status/2098805843680788942)：Brandon肯定对普通用户提供的额度和能力，但觉得用户凭证交接笨拙、凭证库基础且没有发挥作用。尝试信用卡积分门户多轮后放弃，更偏好自己的Hermes / AsideAI配置。

直接对比：

- 授权选择 · [nav · C08](https://x.com/esssekar/status/2099511838031724631)：同时试用两者后，用户认为能力不错，但第一天不愿交卡，将本机邮件、笔记、日历交给本地助手，Muse继续用于其他事。

证据边界：产品限制、用户不信任和安全事故不是一回事。未复现攻击或审计后台，无法据这些反馈给出安全排名。

### 08 · 多任务、额度与持续使用

从初期惊喜到稳定日用，需要持续的真实需求、可管理的任务，以及能省下来的监督时间。

**Instinct**

用户认可：上下文积累和日常需求能形成自然委托；迁移时重建账户与背景也会带来成本。

使用摩擦：有人试用一天就找不到更多需求；活跃用户也需要任务日志和更清楚的多任务管理。

- [Evis Drenova · I16](https://x.com/evisdrenova/status/2097420394974302314)：Evis说试了Instinct一天便没再用，不觉得自己需要全天候个人助理。
- [Vatsal Sanghvi · I25](https://x.com/vatsal_sanghvi/status/2097177236399108190)：Vatsal说代理提醒遗漏的紧急签署并继续邮件流程；同时希望有应用或日志找回以前的产物和工作记录。
- [Emily Lai · I32](https://x.com/emilylai/status/2100221390423048414)：Emily报告Instinct需要她处理验证码、重置密码和补录密码库，未经要求扫描邮件，并把浅层搜索结果过度肯定地推荐。
**Muse**

用户认可：充裕额度、连接器和云端任务吸引用户投入更多工作，也有人与本地代理分工。

使用摩擦：额度大不保证结果质量；单聊天串、并发限制，以及依赖其他模型的产出，都限制了“全能助手”的解读。

- [Erik Rogne · G39](https://x.com/erikrogne/status/2100294258322477541)：Erik称Muse是自己找到最好的个人代理，正把更多任务交给它，同时仍用OpenClaw处理本地事务。本人在跟帖附上带token话术的邀请码。
- [Mike Pearl / Gizmodo · G43](https://gizmodo.com/metas-muse-let-me-waste-a-mind-boggling-amount-of-free-compute-on-nothing-in-particular-2000808945)：Mike Pearl认为免费额度充裕，生成质量欠佳。
- [Cygankiewicz / mpkc · S10](https://blog.cygankiewicz.com/en/meta-muse-black-box-testing/)：作者一次性请求120次派生时只创建33个，87次失败，根会话未交付汇总；交错配置结果不同。
- [C.V.F. · G45](https://x.com/246o1Valjean/status/2099256815091351746)：C.V.F.列出业务自动化、夜间模型评测、简报、网页改动和家庭娱乐产出，也明确提到多种外部模型与本地硬件参与，且把“这条帖子”本身列为Muse产物。

直接对比：

- 共同使用摩擦 · [Rohan Varma · C07](https://x.com/TheRohanVarma/status/2097473144684785835)：Rohan认可两者的单任务体验，但觉得一个聊天串同时做多件事很难管理。
- 迁移自述 · [Jason Yeh · C09](https://x.com/jasonoliver/status/2100424289845666249)：用户说先前日用Grok Bot与Instinct，现在这一类个人助理转向Muse，原因包括Gmail、Plaid连接及电话开通。
- 迁移成本 · [Jeff Morris Jr. · C14](https://x.com/jmj/status/2097795398849208673)：Jeff认为在Instinct与Muse之间迁移，重建密码库和个人上下文相当麻烦。

证据边界：没有长期留存、付费或独立用户分母。迁移、偏好和短期产量是个案，不能等同于持续生产力增长。


## Instinct：让生活杂事更容易被交办、被持续跟进

这批反馈最有说服力的地方，是用户把邮箱、行程、保修、家庭与旧账单串成连续的工作流。轻量消息入口降低了开口交办的成本，但任务增多后，速度、权限边界与运行记录开始决定用户是否敢继续委托。

### 01 · 熟悉的消息入口与自然口吻 · 优势

用户不必先学一套复杂界面，短消息或语音就能交办。 优势不只在少点击：私人琐事更容易随手说出来，简洁回复也减少阅读和来回解释。

- **家人以前对自建代理没兴趣，却通过iMessage开始使用。** [Kevin Lee · I01](https://x.com/kevinleeme/status/2092325658735329399)
- **Sri认可减少应用切换、回复简洁，以及交办私事时的轻松感。** [Sri Kosuri · I04](https://x.com/srikosuri/status/2096996362390818962)
- **Shankar同时肯定短信、语音的回复速度与iMessage互动。** [Shankar Ganesh · I28](https://x.com/_shankarganesh/status/2098824574595182983)
- **反例：在曼谷，消息渠道不合当地习惯，反而容易被垃圾短信淹没。** [sawit · I23](https://x.com/tansawit/status/2094442071671398691)

**如何理解：** 最适合随时出现的小委托；渠道与当地习惯是否匹配，比“有没有独立App”更具体。

**证据边界：** 家人案例是转述；这是入口与文风偏好，不是所有非技术用户的统一选择。

### 02 · 把拖延的生活行政推到下一步 · 优势

产品价值集中在不难理解、却很费心执行的生活事务。 它需要同时找到资料、识别下一步、联系对方并跟进；单独生成一段答案通常不能替代这些步骤。

- **医生、婚礼供应商、DMV与订阅被放进同一个助手的上下文。** [Sheel Mohnot · I02](https://x.com/pitdesi/status/2090579987778937159)
- **烘干机保修从照片和邮件收据推进到联系支持与维修安排。** [Eli Weiss · I03](https://x.com/eliweisss/status/2098918455957189107)
- **保险任务利用旧报价和驾驶记录准备材料，用户完成关键签署。** [charlie · I07](https://x.com/charlieleg/status/2092459019923607615)
- **旧云账单获得用户批准后进入申诉与跟进，作者称收到减免答复。** [Osborne Saldanha · I06](https://x.com/os7borne/status/2095574518169468946)

**如何理解：** 强项是推动一件拖着的事继续前进；报告应同时记录代理做了什么和最后谁收尾。

**证据边界：** 交易、减免和商家处理结果主要是用户自述；Comcast电话和保险签署都仍由人补位。

### 03 · 邮箱上下文减少重复交代 · 优势

旧收据、余额、PNR和历史沟通能够变成任务输入。 用户只需给目标，助手从已经连接的材料里补齐线索，减少在搜索、复制、核对之间切换。

- **从航班需求延伸到遗忘余额、座位和结账纠正。** [Jesse Middleton · I19](https://x.com/srcasm/status/2088967631256637509)
- **作者说一条消息就触发从邮件取PNR并完成值机。** [Sumukh Rao · I31](https://x.com/RaoSumukh/status/2099867092220854432)
- **历史保险邮件帮助代理准备材料，而不是重新询问每项背景。** [charlie · I07](https://x.com/charlieleg/status/2092459019923607615)

**如何理解：** 适合资料已经积累在邮箱的用户；跨来源提取之后，仍需要清楚呈现关键事实与最终结果。

**证据边界：** 访问到资料并不保证理解无误；同样的值机类别也存在失败自述（I26）。

### 04 · 主动跟进能减少“记着要做”的负担 · 优势与摩擦

提醒相关且及时的时候，用户会感觉有人在持续照看事情。 这和一次性回答不同：有用时机可能出现在几小时或几天后，用户不想重新发起任务。

- **到期续费与学校菜单把监控和日常提醒结合起来。** [KP · I20](https://x.com/thisiskp_/status/2094402725672886471)
- **住宿取消邮件触发寻找替代选项。** [sawit · I23](https://x.com/tansawit/status/2094442071671398691)
- **忘记签署文件时被提醒，但作者也要求查看历史记录。** [Vatsal Sanghvi · I25](https://x.com/vatsal_sanghvi/status/2097177236399108190)
- **反例：每提一件事就被持续追问，让作者觉得被催促。** [amy 🦒 · I15](https://x.com/amystweets/status/2098112515888579016)

**如何理解：** 需要按任务重要性、紧急程度与个人偏好控制频率，同时允许用户明确结束跟进。

**证据边界：** 主动性不是越多越好；缺少通知设置、误报率和连续执行数据。

### 05 · 家庭事务是具体需求，多人协调也会添负担 · 优势与摩擦

家庭生活有大量重复、跨人、跨日程的小任务，给助手提供了明确工作。 比起抽象的万能助理，学校邮件、票务、护照预约和家庭旅行有清楚目标，也容易看见哪些步骤交给了人。

- **电影票、校照、活动表和杂货订单被一起交办。** [sari azout · I18](https://x.com/sariazout/status/2089121591518966085)
- **孩子护照预约和清单由代理做，敏感表格由家长保留。** [Kim Currier · I30](https://x.com/Kimcurrier/status/2099872763989393448)
- **聚餐包含找场地、预订和出席确认。** [David Pawlan · I08](https://x.com/DavidPawlan/status/2099662829628293217)
- **反例：配偶不愿接收更多代理间协调请求。** [Manosai · I17](https://x.com/manosaie/status/2099540465489969545)

**如何理解：** 家庭协作的好体验包含收件人的控制权；个人资料也可以按步骤保留在人手中。

**证据边界：** 家务节省时间来自自我估计；多人连接可行不等于收件人愿意参与。

### 06 · 回复顺畅与按时交付是两种体验 · 问题

公开反馈同时出现“很快”与“越用越慢”，不能压成一个平均印象。 短回复的流畅可能促成采用，长任务的排队和错过截止时间则直接破坏委托价值。

- **对短信、语音回复速度的正面体验。** [Shankar Ganesh · I28](https://x.com/_shankarganesh/status/2098824574595182983)
- **事件和邮件排队三至五小时，用户考虑换工具并愿付费换稳定。** [Adam Benayoun 💊 · I09](https://x.com/adambn/status/2100118160867258697)
- **同一用户觉得相较初期明显变慢。** [Narayanan Hariharan · I29](https://x.com/narayananh/status/2099857811136290882)
- **库存监控的频率可能赶不上商品售罄速度。** [CardNiti · I33](https://x.com/CardNiti/status/2098807339004629388)

**如何理解：** 应分别看首次响应、完成交付、截止时间和失败后恢复，而不只看聊天是否活跃。

**证据边界：** 没有统一输入、网络、地区、服务负载或计时日志；不能估算全平台平均延迟。

### 07 · 网页执行能完成复杂链路，也受网站和地区限制 · 优势与摩擦

真实网站的验证、登录、付款和平台限制仍然影响结果。 成功不只是会点击；遇到障碍时能否回交给用户、再正确恢复，往往决定整条链是否走完。

- **Reddit任务经一分钟人工验证后，Instinct继续完成；同次Muse受阻。** [Freda Duan · C03](https://x.com/FredaDuan/status/2098216330855960910)
- **印度用户值机成功，但不能完成电影票与点餐等付款。** [Alben D Souza · I21](https://x.com/alben_dsouza/status/2094296979354571052)
- **英国用户遇空白HTML、重新登录与地区提示。** [Kaushik Subramanian · I22](https://x.com/TheHolyKau/status/2094384230390276425)
- **Resy受限后，当事人保留旅行规划用途，避开餐厅订位。** [JC Bahr-de Stefano · I12](https://x.com/jbahrdestefano/status/2096676801204404604)

**如何理解：** 按网站与地区确认可用性，并提供能恢复的人工交接，比承诺全自动更能解释用户的实际选择。

**证据边界：** 不同任务、网站和时间的结果无法组成普适浏览器榜单；Resy是同一事件，不能按转发量重复计事故。

### 08 · 行动符合意图，比“做成一个动作”更重要 · 问题

用户可能欢迎代理执行，却不欢迎代理扩大请求范围。 当“研究”“提醒”变成报名、付款或发信时，技术执行成功也可能是体验失败。

- **设置提醒被扩展成以本人身份发介绍邮件。** [giovanni · I10](https://x.com/regulargio/status/2100124013146341585)
- **研究体育联赛被扩展成报名付款，削弱购买信任。** [jae · I11](https://x.com/jaegpark/status/2091276344936284256)
- **正面边界：家长把预约交给代理，保留敏感表格在自己手里。** [Kim Currier · I30](https://x.com/Kimcurrier/status/2099872763989393448)

**如何理解：** 重要动作应让用户理解当前是在研究、准备、等待批准还是已经执行；这些阶段不宜在体验中含糊切换。

**证据边界：** 未取得完整提示词和权限设置；这些案例支持发现意图边界问题，不能估算发生率。

### 09 · 撤权、外部指令和监督成本影响敢不敢用 · 问题

信任不仅是是否愿意交出密码，还包括能否停止访问、理解操作和发现异常。 如果用户得反复补验证码、修账户、纠正未经请求的操作，助手就可能增加监督工作。

- **断开Google后仍收到摘要，让用户困惑；尚不知是缓存还是新访问。** [claire vo 🖤 · I13](https://x.com/clairevo/status/2090929592853037078)
- **用户描述邮箱外部指令影响代理行为的自测。** [Alex Cohen · I14](https://x.com/anothercohen/status/2091251836917350512)
- **验证码、密码补位、过度扫描和过度肯定的推荐叠加成烦扰。** [Emily Lai · I32](https://x.com/emilylai/status/2100221390423048414)

**如何理解：** 撤权效果、运行记录与错误恢复必须让人看得懂，否则能力扩展会同时提高心理负担。

**证据边界：** 未复现攻击、审计后台或验证当前修复；不据此声称哪一产品更安全。

### 10 · 从惊喜到持续使用，取决于稳定需求与管理方式 · 采用体验

早期惊喜能带来尝试，但是否有长期待办、是否能管理多任务，决定持续使用理由。 上下文积累提高便利，也可能让迁移变麻烦；这是使用深度差异，不是已被证明的长期护城河。

- **试一天后没有持续需求，并非因为执行失败。** [Evis Drenova · I16](https://x.com/evisdrenova/status/2097420394974302314)
- **两产品一个聊天串做多件事时，都有用户感到混乱。** [Rohan Varma · C07](https://x.com/TheRohanVarma/status/2097473144684785835)
- **积极用户仍希望用日志查成果。** [Vatsal Sanghvi · I25](https://x.com/vatsal_sanghvi/status/2097177236399108190)
- **换助手要重建密码库与上下文，让作者感到麻烦。** [Jeff Morris Jr. · C14](https://x.com/jmj/status/2097795398849208673)

**如何理解：** 更有价值的后续观察是同一作者是否仍有稳定委托，以及失败后是否还能放心继续。

**证据边界：** 没有一个月留存、付费转化和使用频率分母。

## Muse：以浏览器交接、资料整理和个性化界面承接任务

Muse 的反馈更集中于应用交互、连接器、Feed及浏览器接管。成功案例包含资料整理、票务和预约，但最能解释体验差异的是：复杂流程做了大半后，剩下的纠错是否仍耗掉用户很多精力。

### 01 · 界面让能力更容易被发现、被看见 · 优势

ideas、Feed、产物和浏览器预览给用户更多发起任务与查看结果的入口。 新用户常不知道要委托什么；显示建议和结果可降低这个门槛，也让后台执行没那么抽象。

- **用户特别肯定ideas页和轻快感，同时不喜欢单线程。** [Michael · C11](https://x.com/MichaelLee04/status/2097410800294191543)
- **初用一小时的用户注意到timeline、goals、artifacts与浏览器预览。** [Jesse Middleton · C13](https://x.com/srcasm/status/2097432696750518531)
- **遇到网页操作障碍时，小浏览器让用户接手。** [Itai | dynamic.xyz · C02](https://x.com/turbahn/status/2098769111627293076)
- **新增渠道偏好：在WhatsApp交办不必改变习惯，说明轻量消息入口也出现在Muse体验中。** [PREEM · G46](https://x.com/PipeBladex/status/2100231113062957220)

**如何理解：** 最明确的优势是可发现性与可介入性；还需要看任务多了之后能否找回成果与理解状态。

**证据边界：** 前两条都是早期印象；有界面不代表任务完成率更高，也不代表多任务管理已解决。

### 02 · 跨来源资料整理有清楚、低歧义的用途 · 优势

把分散的邮件、书签、收据和笔记变成可用信息，是这批材料里最具体的一类价值。 输入和输出较明确，用户也较容易检查成果；相比直接付款或复杂跨站操作，任务边界更容易说明。

- **摄影客户邮件、现职与拍摄团队资料整理进入真实工作流程。** [Andy Scott · M03](https://x.com/AndyJScott/status/2100208383680712719)
- **航司收据与多服务连接用于报销准备和个人CRM。** [Kristof · M04](https://x.com/CoastalFuturist/status/2100360680876454151)
- **四套浏览器书签被整理，并补充工作和兴趣资源。** [Kaeli VanFossen · M08](https://x.com/KaeliVanfossen/status/2100409380579799128)
- **从旧邮件发现已有退款，消除一个不必要的申诉待办。** [yalok · S09](https://news.ycombinator.com/item?id=49619764)
- **新增生活行政清单：保险、找房、订阅和跟进邮件；未确认获赔或完成退订。** [Armand Domalewski · G37](https://x.com/ArmandDoma/status/2100455467810193433)
- **反例：从付款邮件追加预算表的表单反馈被标为未奏效，但没有具体失败过程。** [未具名表单提交者（dpawlan发布） · G47](https://github.com/dpawlan/ai-assistant-benchmark/issues/226)

**如何理解：** 适合先从整理、检索、草稿这些可快速核对的工作建立使用习惯，再观察更深委托。

**证据边界：** 整理完整性与准确性未逐项验证；找到收据不是报销获批，找到旧退款也不是新追回钱。

### 03 · 浏览器接管与速度受到认可，但不存在固定胜者 · 优势与摩擦

用户喜欢遇阻时能直接接手，也有人认为相同任务里Muse更快。 接管减少反复用文字解释障碍的成本；相对速度则影响用户愿意继续等多久。

- **偏好受阻时可接手的小浏览器。** [Itai | dynamic.xyz · C02](https://x.com/turbahn/status/2098769111627293076)
- **复杂网页偏向Muse，日常助理仍保留Instinct，形成场景分工。** [Anirban chowdhury · C01](https://x.com/VoyageBliss/status/2100219173070852555)
- **主观觉得快两三倍，但简单任务仍可能超过五分钟。** [Sarah Chieng · C06](https://x.com/MilksandMatcha/status/2100264156352127308)
- **反例：一次Reddit长任务里Muse被阻，Instinct经人工验证后完成。** [Freda Duan · C03](https://x.com/FredaDuan/status/2098216330855960910)

**如何理解：** 需要同时观察等待时间、用户介入步骤和恢复后结果；“比较快”未必已经“快到不打断人”。

**证据边界：** 缺少标准化计时与完整日志；不能把主观倍数当基准，也不能把一次失败外推。

### 04 · 有实际交易与预约自述，应保留每一步的完成状态 · 优势

部分用户已经把Muse用于买票、预订和联系诊所。 真正的执行跨过搜索、候选确认、用户批准、付款和商家回执；不同案例走到的位置并不一样。

- **用户称附近游船已预订并付款。** [Feynman · M07](https://x.com/iamchshah/status/2099454533256593700)
- **同一晚餐任务中，Muse被报告先完成订票。** [Alex Volkov · C12](https://x.com/altryne/status/2097430715923399135)
- **诊所电话和邮件带来回电确认，但患者表格交给另一代理。** [Jamal Hinton · M05](https://x.com/MalGsx/status/2099504838522380421)
- **纪念日晚餐预订加电话确认，原帖带token推荐激励。** [Mississippi Sports · M13](https://x.com/SocialSportsMs/status/2100295007236161938)
- **新增机场停车预订自述，具体商家回执未独立核验。** [Avi Flombaum · G36](https://x.com/aviflombaum/status/2100468136671678756)
- **购车研究、议价、保险与检测预约的链条更长，但没有确认车辆成交。** [shashank · G38](https://x.com/_shanxS/status/2099696515845664860)

**如何理解：** 订单或预约回执、人工补位以及最后状态，应和“它替我做了事”的表述一起展示。

**证据边界：** 交易与预约仍是自述；多工具流程不算Muse独立包办，带激励内容也不当随机样本。

### 05 · Feed与个性化内容提供主动打开的理由 · 优势

用户不必每次先想一个任务，推荐也能帮助发现自己想做的事。 个性化的价值包括建议和内容形式，不只记住名字；它可以促成回访，但回访和任务成效不同。

- **签证用户虽然抱怨执行摩擦，仍每天多次打开Feed。** [Ha Tran Nguyen Phuong · M02](https://x.com/sherlockieee/status/2099259936597508336)
- **WhatsApp里随口提及的偏好进入推荐。** [gerardocasta711 · M14](https://x.com/gerardocasta711/status/2099315963761971512)
- **NFL回顾以漫画呈现，并提出每周继续发送的要求。** [Yair Savlevi · M10](https://x.com/Yairyup/status/2099478559517540467)
- **官方员工的家庭案例提到学校截止提醒；关键表格由丈夫提交，单独标为员工材料。** [Mona Sarantakos / Christine Awad · G44](https://introducing.muse.ai/)

**如何理解：** Feed是独立于执行能力的体验长处；应同时追踪推荐相关性、频率和实际采取行动的比例。

**证据边界：** 只有短期自述；要求每周发送不等于已持续运行，频繁打开不等于长期留存。

### 06 · 剩下的人工收尾，可能吃掉大部分省心感 · 问题

做完大半流程与用户轻松完成整件事之间仍有明显距离。 难点常落在格式、上传、漏项、验证码与视觉检查；用户还要判断哪里错了、如何重新说明。

- **签证准备自估完成七成，仍花约一小时修上传、尺寸、格式和材料遗漏。** [Ha Tran Nguyen Phuong · M01](https://x.com/sherlockieee/status/2099371464969589123)
- **简单儿童学习册改约五次，第三轮开始靠截图定位；最终完成未确认。** [Michael · M09](https://x.com/OffZeroCyber/status/2099496720363118684)
- **DoorDash登录循环三次后放弃，购物还遇过期折扣与配送问题。** [MBI Deep Dives · S03](https://www.mbi-deepdives.com/muse/)
- **熟手在信用卡积分门户上经历多轮凭证交接后放弃，接管体验并非一致好评。** [Brandon Galang · G35](https://x.com/brandon_galang/status/2098805843680788942)

**如何理解：** 更值得衡量的是用户回来多少次、每次要做什么，以及最后有没有验收，单算自动步骤会高估价值。

**证据边界：** 七成是个人估计，不能计算任务成功率；原文没宣布做成的任务不补写成功。

### 07 · 实时信息与服务稳定性仍有缺口 · 问题

推荐依据过时与服务无法响应，是两类不同但都会阻断使用的问题。 前者让用户浪费时间追错目标，后者让用户即使愿意继续也无法完成请求。

- **餐厅推荐后才发现营业状态争议；厂方称修复，未见复测。** [Sheel Mohnot · M12](https://x.com/pitdesi/status/2097449401363181602)
- **一位Reddit用户先满意一天，随后跨设备持续不能响应。** [MadTealParty · S12](https://www.reddit.com/r/MuseAgent/comments/1wdek9y/muse_not_responding/)
- **App Store用户报告被踢出并无法继续使用。** [this podcast is the nest · A08](https://itunes.apple.com/us/rss/customerreviews/page=1/id=6760173601/sortBy=mostRecent/json)
- **初评可核的主聊天失败循环；27小时恢复与具体用量的后续仍待核。** [u/WILLingtonegotiate · G40](https://www.reddit.com/r/ArtificialInteligence/comments/1wbsgna/comment/p8wibem/)

**如何理解：** 应该把信息错误、账号访问与执行卡住分开跟踪，并补上修复后的同任务复测。

**证据边界：** 餐厅实际历史未独立核查；故障样本无根因与恢复记录，不能宣称持续全站故障。

### 08 · 连接带来便利，也带来授权和能力边界 · 优势与摩擦

可接管提升控制感，但是否愿意连接邮箱、卡片与账户，仍决定功能能被用到多深。 授权是一项用户选择；接口可连、技术可做、产品允许以及用户愿意，是四个不同条件。

- **认可两者能力，但核心邮件和笔记留在本机，不愿第一天交卡。** [nav · C08](https://x.com/esssekar/status/2099511838031724631)
- **一个会话只允许商家电话，不能拨私人号码。** [Bo Huang · M11](https://x.com/BohuangMars/status/2100362312981110826)
- **用户希望对转账更自主；只是诉求，没有具体失败日志。** [GrimTheGamer · M15](https://x.com/GrimTheGamer/status/2100412726895849714)
- **媒体体验认可信息整合，却对进一步交出数字生活犹豫，邮件停在待批准草稿。** [Eric Hal Schwartz / TechRadar · S02](https://www.techradar.com/ai-platforms-assistants/i-tried-metas-new-muse-ai-agent-its-incredibly-useful-but-handing-it-my-digital-life-felt-deeply-uncomfortable)

**如何理解：** 清楚解释可做范围和待批准状态，是获得授权的一部分；用户谨慎不等于产品能力失败。

**证据边界：** 这些材料不足以比较谁更安全；“商家白名单”是用户推测，不能写成架构事实。

### 09 · 语气、主动性和日用选择有明显个体差异 · 采用体验

有人把个人助理转向Muse，有人两三轮对话就失去继续尝试的意愿。 选择既受账户连接和电话能力驱动，也受文风、提醒频率与个人习惯影响。

- **Jason因已连Gmail、Plaid和电话开通转向Muse，但仍日用多种AI。** [Jason Yeh · C09](https://x.com/jasonoliver/status/2100424289845666249)
- **Vincent喜欢Instinct随意语气，没测Muse能力就停止尝试。** [Vincent · C10](https://x.com/vvvincent_c/status/2100421699066081638)
- **一位用户喜欢Muse，却想念Instinct主动跟进。** [Rounak Salim · C04](https://x.com/rounak_salim/status/2099187585130340399)
- **另一位日用用户恰恰觉得Muse更主动。** [atifkhan31 · C05](https://x.com/atifkhan31/status/2100324081895956762)
- **新增工具分工：越来越多任务交给Muse，本地事务继续使用OpenClaw。** [Erik Rogne · G39](https://x.com/erikrogne/status/2100294258322477541)

**如何理解：** 体验设计应允许用户调整文风与跟进强度；迁移也更可能是分工变化，而非一款替代所有工具。

**证据边界：** 相反评价缺少相同任务和设置；无法只凭票数宣布哪一方人格或主动性更好。

### 10 · 有工作台，仍需解决多任务与长期执行的验证 · 问题与潜力

界面中能展示产物和目标，不等于用户已经能轻松管理多条任务或验证长期运行。 用户最终需要知道哪些任务在跑、哪些停住、哪些等待自己，以及结果在哪里。

- **单聊天串同时处理多任务时，两者都让作者感到难管理。** [Rohan Varma · C07](https://x.com/TheRohanVarma/status/2097473144684785835)
- **漫画产物可见，但每周执行只有要求，没有后续周次证据。** [Yair Savlevi · M10](https://x.com/Yairyup/status/2099478559517540467)
- **技术用户能查看部分文件与任务环境，提高可见性。** [russellbeattie · S08](https://news.ycombinator.com/item?id=49620247)
- **极端并发测试出现创建失败和根会话不汇总，提示进度可见性的价值。** [Cygankiewicz / mpkc · S10](https://blog.cygankiewicz.com/en/meta-muse-black-box-testing/)
- **作者靠人工转发让两个代理讨论记忆，不能把代理自述直接写成底层架构事实。** [Clinton Stark / Stark Insider · G42](https://www.starkinsider.com/2026/09/meta-muse-vs-openclaw-personal-ai-agent.html)
- **高产出清单涉及其他模型与本地硬件，且评价本身也由Muse参与生成。** [C.V.F. · G45](https://x.com/246o1Valjean/status/2099256815091351746)

**如何理解：** 进一步观察任务状态、成果检索与异常通知，比增加更多泛泛赞美更能判断是否适合长期使用。

**证据边界：** 压力测试不是日常可靠性基准；查看部分环境也不等于系统完全透明或安全已验证。

### 11 · 检索次数多，不代表数据源覆盖完整 · 问题与取舍

新增反馈把注意力从“查了多少次”推进到“到底查了哪些渠道”。 旅行和购物中的关键取舍，依赖航司、商家、房源以及价格与库存信息；缺少某条渠道，可能影响最终推荐。

- **作者材料称订票所用系统没有纳入Southwest；这只是该次任务的覆盖边界。** [Nicole Huang · G34](https://x.com/caitnicoleh/status/2099647920371032568)
- **站点测试材料里，预算内酒店未找到，助手给出可退替代项并询问如何放宽条件。** [Assistant Benchmark · G41](https://assistantbenchmark.com/agents/muse)
- **146次机票搜索体现研究工作量，仍不能证明覆盖了所有航司或已经出票。** [Deep Mehta · M06](https://x.com/mehtadeep/status/2099498596789850192)

**如何理解：** 更有用的输出应写清搜索渠道、遗漏来源、约束和可放宽的条件，让用户判断候选方案是否足够全面。

**证据边界：** 站点评级和用户摘要不等于独立复现实验；没有找到满足条件的选项，也可能是现实供给不足，不一定是工具故障。

### 12 · 额度大方是吸引力，作品质量与完成度仍需另看 · 优势与摩擦

新增材料同时出现“额度充裕”与“产物不满意”，两者并不矛盾。 宽松额度让用户敢试多轮和长任务，但多生成一些内容不自动等于形成可用结果；执行链上的卡点也不会因为额度大而消失。

- **媒体体验同时肯定额度、批评产物。** [Mike Pearl / Gizmodo · G43](https://gizmodo.com/metas-muse-let-me-waste-a-mind-boggling-amount-of-free-compute-on-nothing-in-particular-2000808945)
- **旅行购物体验里，额度被视为连续推进任务的便利。** [Nicole Huang · G34](https://x.com/caitnicoleh/status/2099647920371032568)
- **另一作者同样认可额度，却因积分门户的凭证交接摩擦而放弃。** [Brandon Galang · G35](https://x.com/brandon_galang/status/2098805843680788942)

**如何理解：** 评价成本时同时记录可用产物、人工介入和最终完成状态，避免只看生成量或剩余额度。

**证据边界：** 用量数字来自当时的作者或代理说法，没有独立计量；不能比较所有任务的单位成本，也不把当时额度当现行价格承诺。

## 已解读案例与补充材料

### R2100423405879386266 · 同日完整工具清单

jasonoliver · X · 2026-09-17 · 同一案例后续

这是「连接好的账户促成个人助理迁移」的后续或上下文，需与主案例一起阅读。

边界：同一事件的补充，不作为新的独立任务成功计数。

[原始来源](https://x.com/jasonoliver/status/2100423405879386266)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“now just using Muse since it’s connected with my Gmail and plaid … (still need to unlock my eBay account which Instinct had gotten banned)”
（现在个人侧只用 Muse，因为它连上了我的 Gmail 和 Plaid……eBay 还要解锁，之前 Instinct 把账号弄封了。）

### M19 · 迁移后仍认可Instinct团队的推进速度

jasonoliver · X · 2026-09-17 · 用户自述

Jason在转向Muse的讨论中，仍称赞Instinct发布速度，并表达对有人代打电话的付费意愿。

边界：不是放弃其他工具后的全面产品排名；付费意愿不等于实际购买。

[原始来源](https://x.com/jasonoliver/status/2100424994044178904)

### M15 · 希望用户自己决定更多操作权限

GrimTheGamer · X · 2026-09-17 · 用户自述

用户以条件句表达希望对转账等行为拥有更多决定权。

边界：没有具体执行与拒绝日志；是自主权诉求，不能记为已验证的转账失败。

[原始来源](https://x.com/GrimTheGamer/status/2100412726895849714)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“If I want to give Muse instructions to make routine bank transfers then I don't want it to tell me it can't because Meta said no.”
（如果我想让 Muse 做常规银行转账，我不希望它告诉我因为 Meta 说不行所以不能做。）

### M08 · 整理四套浏览器书签并补充资源

Kaeli VanFossen · X · 2026-09-17 · 用户自述

用户导入四份书签HTML，称Muse整理好并找到符合工作与兴趣的新资源。

边界：没有检查整理文件的去重和准确度。

[原始来源](https://x.com/KaeliVanfossen/status/2100409380579799128)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I gave it 4 HTML files of my super duper messy bookmarks … and it tidied them all up and went and found me new resources…”
（我给了它 4 份超级乱的书签 HTML……它全部整理好，还按我的工作和兴趣找了新资源。）

### G37 · 把拖延的保险、找房和邮件事务往前推进

Armand Domalewski · X · 2026-09-17 · 用户自述

Armand说Muse推进了拖延的保险理赔、组织找房、从邮件与银行账户发现不想续的订阅，并发送此前忘记跟进的邮件。

边界：发现订阅不等于已退订，处理理赔不等于获赔；同线程他人的不信任言论不归给本作者。

[原始来源](https://x.com/ArmandDoma/status/2100455467810193433)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“it took care of insurance claims I’ve been putting off, organized a housing search for me, found a ton of subscriptions… sent a bunch of emails I had lost track of…”
（它处理了我一直拖延的保险理赔，帮我组织找房，找出一堆不想续的订阅……还把我跟丢的一批邮件发出去了。）

新增原编号：37。原文核查：X原帖正文已读。

作者关系：未核实与Meta的关系

任务阶段：多个步骤的完成自述；理赔与退订最终状态未明

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。

[同线程上下文](https://x.com/TheOmniZaddy/status/2100454967697870965)

### G36 · 为出行找到并预订机场场外停车

Avi Flombaum · X · 2026-09-17 · 用户自述

Avi说为RailsWorld行程交办JFK机场场外长期停车，Muse已找到并预订。

边界：无预订回执或商家确认可供本报告独立核验。

[原始来源](https://x.com/aviflombaum/status/2100468136671678756)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“It found and booked long term parking at an offsite lot for JFK for my trip to @railsworld
”
（它为我去 RailsWorld 的行程找到并订好了 JFK 场外长期停车。）

新增原编号：36。原文核查：X原帖正文已读。

作者关系：未核实与Meta的关系

任务阶段：用户声称找到并预订

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。



### C10 · 文风会在能力测试之前影响选择

Vincent · X · 2026-09-17 · 用户自述

用户喜欢Instinct较随意的口吻，和Muse聊两三轮便因“AI腔”不想继续尝试。

边界：作者明确没有测试Muse执行能力，不能算能力失败。

[原始来源](https://x.com/vvvincent_c/status/2100421699066081638)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“i was really irk-ed after 2-3 messages with muse because of the slop feel. i didn't try out the capabilities because of this :(”
（和 Muse 聊了两三句就被那种注水文风惹烦了。因为这个我没去测它的能力。）

### C09 · 连接好的账户促成个人助理迁移

Jason Yeh · X · 2026-09-17 · 用户自述

用户说先前日用Grok Bot与Instinct，现在这一类个人助理转向Muse，原因包括Gmail、Plaid连接及电话开通。

边界：其清单仍日用Claude、Codex、ChatGPT；不能写成Muse替代了全部工具。eBay封号归因未独立确认。

[原始来源](https://x.com/jasonoliver/status/2100424289845666249)

### S18 · 九任务比较中的失误线索

Ryan Merket / RuntimeWire · 测评 · 2026-09-16 · 有商业关系的对照测评

文章描述错误语料、缺货推荐和公开检索提前停下等问题。

边界：单轮AI裁判、多数接受代理自报、未批准关键动作；网站分发竞品，无Muse完整运行日志，不采用其总分排名。

[原始来源](https://runtimewire.com/article/ai-assistant-showdown-grok-bot-instinct-claude-chatgpt-work-muse)

### S06 · 任务多处需要作者接手

Brady Brickner-Wood / The New Yorker · 媒体/博客 · 2026-09-16 · 媒体体验

作者自己完成餐厅订位和银行电话；助手帮写二手商品文案。

边界：商品后来售出不等于代理独立履约。

[原始来源](https://www.newyorker.com/culture/infinite-scroll/my-weekend-with-an-ai-agent)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I find myself slightly distressed at the prospect of handing over my personal data and pathetically weak passwords to this Mark Zuckerberg-owned taskbot…”
（一想到要把个人数据和弱得可怜的密码交给这个扎克伯格名下的任务机器人，我就有点难受。）
“Despite these small victories, I can’t help but feel unmoved after a weekend of outsourcing tasks to an A.I. agent.”
（尽管有这些小胜利，把任务外包给 AI 过完一个周末后，我仍觉得无动于衷。）

### S05 · 家庭资料与购物流程评测入口

Claire Vo / Lenny · 视频 · 2026-09-16 · 视频简介

公开简介和章节涉及家庭PDF、鞋子购买和IMAX任务。

边界：只核简介与章节，未观看全片；不能据此确认购物、出票或产物完整。

[原始来源](https://www.lennysnewsletter.com/p/muse-review-the-personal-ai-agent)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I gave Meta’s Muse my calendar, my email, and my kids’ chaotic schedule, and it produced a one-shot family PDF more beautiful than anything I’ve ever made with Claude or Codex”
（我把日历、邮件和孩子们混乱的日程交给 Muse，它一次生成的家庭 PDF 比我用 Claude 或 Codex 做过的都好看。）

### M20 · 认可产品交互并分享评测入口

clairevo · X · 2026-09-16 · 用户自述

Claire在书签案例所在讨论中表达对Muse使用体验的认可。

边界：这里只核到X文字；视频里的具体购物流程需另查。

[原始来源](https://x.com/clairevo/status/2100307639674765598)

### M13 · 餐厅预约加电话确认

Mississippi Sports · X · 2026-09-16 · 带推荐激励的用户自述

用户称赛事期间难订的纪念日晚餐由Muse取得预订，并电话确认。

边界：原帖带推荐码和token奖励文案，标为有激励信息的自述；未核交易凭证。

[原始来源](https://x.com/SocialSportsMs/status/2100295007236161938)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I used Muse agent to get reservation...THEN IT MADE A CALL TO CONFIRM!”
（我用 Muse 订到了位子……然后它还打电话确认！）

### M11 · 个人号码外呼请求受限

Bo Huang · X · 2026-09-16 · 用户自述

用户先赞叹电话能力，随后贴出Muse回复：只能打商家，不能给家人或个人号码打电话，可代拟短信。

边界：是该会话的能力边界；“商家白名单”是作者猜测，不视为已核架构。

[原始来源](https://x.com/BohuangMars/status/2100362312981110826)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I can't place the call itself — my calling setup only dials businesses, not family or personal numbers…”
（我没法自己拨这个电话——我的呼叫设置只打商家，不打家人或个人号码……）

### M04 · 多服务连接用于收据与个人CRM

Kristof · X · 2026-09-16 · 用户自述

用户说从JetBlue取明细收据用于Brex，并连接Granola、Gmail、Calendar及Notion整理个人CRM。

边界：取得收据不等于报销审批完成；没有核验CRM完整性。

[原始来源](https://x.com/CoastalFuturist/status/2100360680876454151)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Just got done with a full day of using Meta’s Muse as an executive assistant and it’s honestly great”
（刚用 Meta Muse 当了一整天行政助理，真的很好。）

### M03 · 处理摄影客户、商品和生活杂务

Andy Scott · X · 2026-09-16 · 用户自述

Andy列举从多年邮件整理客户、联系拍摄团队、商品上架与跨平台搬运、购物及退款，称速度快、后台顺畅。

边界：列表中的交易、数量和退款没有独立核验，不据此计算节省时间。

[原始来源](https://x.com/AndyJScott/status/2100208383680712719)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“All in a great UI with seamless background tasks and barely any hiccups. and its blazing fast.”
（界面很好，后台任务顺畅，几乎没卡，而且非常快。）

### I32 · 验证码、账户补位和过度主动叠加成监督负担

Emily Lai · X · 2026-09-16 · 用户自述

Emily报告Instinct需要她处理验证码、重置密码和补录密码库，未经要求扫描邮件，并把浅层搜索结果过度肯定地推荐。

边界：同帖也批评其他产品；Grok耗时、Hermes电话错误不归因给Instinct。混用代理导致的时区错误无法单独归因。

[原始来源](https://x.com/emilylai/status/2100221390423048414)

### I10 · 提醒被扩展为替用户发介绍邮件

giovanni · X · 2026-09-16 · 用户自述

Giovanni说本来只设置提醒，代理却找到了双方邮箱并以其身份发送介绍。

边界：未看到完整初始指令与授权设置；保留为意图边界问题自述。

[原始来源](https://x.com/regulargio/status/2100124013146341585)

### I09 · 排队三至五小时动摇使用意愿

Adam Benayoun 💊 · X · 2026-09-16 · 用户自述

Adam说此前两周喜欢Instinct，但应发事件和邮件未交付、排队3—5小时，开始考虑换工具，并愿付费换稳定执行。

边界：其“共享算力”解释未经验证；不能把此经历解释成全平台同一故障。

[原始来源](https://x.com/adambn/status/2100118160867258697)

### G46 · 喜欢在WhatsApp交办，不必改变沟通习惯

PREEM · X · 2026-09-16 · 用户自述

PREEM试过多种浏览器代理后，更喜欢在自己已经使用的WhatsApp里向Muse交办任务，不必改变浏览与沟通习惯。

边界：这是渠道偏好，没有单次任务过程；不能当作完成率对照。

[原始来源](https://x.com/PipeBladex/status/2100231113062957220)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Muse just lives in WhatsApp where I already am. I text it a job, it does it, I keep living.”
（Muse 就住在我已经在用的 WhatsApp 里。我发一条任务，它去做，我继续过日子。）

新增原编号：46。原文核查：X原帖正文已读。

作者关系：资料自称Unofficial Muse Guy并发布Muse技巧、工作流，推广导向明确；未见付费合作或官方雇佣披露。

任务阶段：持续使用偏好；没有明确单任务证据

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。



### G39 · Muse任务增加，本地事务继续交给OpenClaw

Erik Rogne · X · 2026-09-16 · 附邀请推广的用户自述

Erik称Muse是自己找到最好的个人代理，正把更多任务交给它，同时仍用OpenClaw处理本地事务。本人在跟帖附上带token话术的邀请码。

边界：没有具体单任务过程或长期使用日志；这是工具分工与主观偏好。

[原始来源](https://x.com/erikrogne/status/2100294258322477541)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Still using my openclaw for a lot of local stuff but really loving my muse for progressively more tasks.”
（很多本地的事仍用 OpenClaw，但越来越喜欢把更多任务交给 Muse。）

新增原编号：39。原文核查：X原帖正文已读。

作者关系：本人同线程附邀请码与1b tokens话术；邀请者个人奖励规则未确认

任务阶段：持续使用偏好；没有具体任务结果

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。

[作者邀请码跟帖](https://x.com/erikrogne/status/2100294313263739158)

### C06 · Muse相对更快，也未必足够快

Sarah Chieng · X · 2026-09-16 · 用户自述

Sarah在相同任务中感觉Muse快两三倍，但简单请求仍可能超过五分钟。

边界：用户估计而非计时基准；她列出的各项任务结果未逐一标明属于哪个产品。

[原始来源](https://x.com/MilksandMatcha/status/2100264156352127308)

### C05 · 也有人认为Muse更主动

atifkhan31 · X · 2026-09-16 · 用户自述

Atif日用Muse，认为它快、响应好且主动；喜欢Instinct的iMessage入口，但觉得主动性还不够。

边界：与C04相反；“用代理几周”不等于Muse公开上线后已用几周。

[原始来源](https://x.com/atifkhan31/status/2100324081895956762)

### C01 · 复杂网页任务和日常助理可以分工

Anirban chowdhury · X · 2026-09-16 · 用户自述

Anirban认为Muse复杂浏览器任务和连接更顺，却仍觉得Instinct更像日常助理。

边界：个人初步印象；并非标准化对照，也不把其地区支付描述当现行规格。

[原始来源](https://x.com/VoyageBliss/status/2100219173070852555)

### B06 · 产品推进与反馈的背景帖

wailord · X · 2026-09-16 · 工作人员回复

Meta工作人员在产品讨论中征求与回应反馈。

边界：作为Grim诉求的对话背景，不计入用户体验结论。

[原始来源](https://x.com/wailord/status/2100343069883457649)

### B05 · 电话beta扩展的官方讨论

alexandr_wang · X · 2026-09-16 · 官方发布

官方账号谈到电话功能测试范围的扩展。

边界：产品声明而非用户任务完成证据；不当作今日完整规格。

[原始来源](https://x.com/alexandr_wang/status/2100349174529265967)

### B04 · 外呼测试前的积极印象

BohuangMars · X · 2026-09-16 · 用户自述

Bo先肯定电话能力，随后在M11贴出不能拨私人号码的限制。

边界：应与后续限制一起阅读，不拆成两个独立用户。

[原始来源](https://x.com/BohuangMars/status/2100361461768011951)

### I31 · 从邮件订位编号直接推进值机

Sumukh Rao · X · 2026-09-15 · 用户自述

Sumukh说只发一条消息，代理就从邮件取出PNR、完成值机并发来登机牌。

边界：单次成功自述；与另一作者值机失败的条件无法对齐。

[原始来源](https://x.com/RaoSumukh/status/2099867092220854432)

### I30 · 家庭行政可以保留明确的人工边界

Kim Currier · X · 2026-09-15 · 用户自述

Kim说代理安排孩子护照预约、整理邮件和家庭旅行网站，敏感表格由自己保留处理；还列出一笔订阅退款。

边界：146项待办与退款金额均是本人报告；预约不等于护照已办成，公开隐私检查也不等于完整安全审计。

[原始来源](https://x.com/Kimcurrier/status/2099872763989393448)

### I29 · 使用越久，感觉响应越慢

Narayanan Hariharan · X · 2026-09-15 · 用户自述

Narayanan表示与刚开始用时相比，Instinct回复明显变慢。

边界：缺少计时日志、任务类型与负载条件。

[原始来源](https://x.com/narayananh/status/2099857811136290882)

### G47 · 预算表追加任务被提交者标为未奏效

未具名表单提交者（dpawlan发布） · GitHub · 2026-09-15 · 未具名表单反馈

GitHub表单描述从邮件提取9月4日后的付款、按模板与时间顺序追加预算表，并明确将“Works on this assistant”标为no。

边界：没有运行过程、输出、截图或具体失败步骤，不能判定卡在邮箱、排序还是表格写入。工单Closed也不表示产品已修复。

[原始来源](https://github.com/dpawlan/ai-assistant-benchmark/issues/226)

新增原编号：47。原文核查：GitHub原始正文已读。

作者关系：由站点运营者dpawlan发布表单提交；原始使用者未具名，不等于运营者亲测。

任务阶段：提交者标记未奏效；具体失败步骤未知

读取记录：GitHub issue #226正文直接可读；未重新执行该任务。

[站点汇总页](https://assistantbenchmark.com/agents/muse)

### G38 · 购车流程包含研究、议价、保险与购前检测

shashank · X · 2026-09-15 · 用户自述

shashank在官方征集体验的讨论下，列出用Muse管理购车研究、经销商议价、保险报价和购前检测预约。

边界：原帖未明确签约、付款或交车，也没有“从未去经销商”的原句。Meta关联账号的强化转述不是独立证据。

[原始来源](https://x.com/_shanxS/status/2099696515845664860)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I managed my car purchase: research, haggling with dealership, finding right insurance quote, booking pre-purchase inspection etc”
（我用它管购车：研究、和经销商砍价、找合适保险报价、预约购前检测等等。）

新增原编号：38。原文核查：X原帖正文已读。

作者关系：回复Meta负责人公开征集体验；存在样本选择偏差

任务阶段：若干购车准备步骤自述；最终成交未确认

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。

[官方体验征集帖](https://x.com/alexandr_wang/status/2099681348986515651) · [Meta员工转述](https://x.com/armand_ruiz/status/2100434962952462569)

### A08 · 使用中被踢出，无法继续

this podcast is the nest · App Store · 2026-09-15 · 用户自述

作者报告被随机退出并提示无法再用。

边界：缺少错误根因和恢复记录。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=1/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14553901969

### A05 · 处理堆积邮件和不需要的订阅

Braan007 · App Store · 2026-09-15 · 用户自述

作者称整理约12000封邮件、清理订阅并获得安排提醒。

边界：数量未经核验；订阅可能是邮件订阅，不能都算付费订阅取消。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=1/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14553833914

### S02 · 信息整合有用，进一步授权仍让人犹豫

Eric Hal Schwartz / TechRadar · 媒体/博客 · 2026-09-14 · 媒体体验

作者认可从邮箱理解事务并准备太阳能检查相关邮件；发信停在等待批准阶段。

边界：未确认发信、预约或购物成交；感到不安不等于泄露已经发生。

[原始来源](https://www.techradar.com/ai-platforms-assistants/i-tried-metas-new-muse-ai-agent-its-incredibly-useful-but-handing-it-my-digital-life-felt-deeply-uncomfortable)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“For an everyday purchase, it was surprisingly pleasant to delegate.”
（日常购物交给它，意外地愉快。）
“The closer it gets to behaving like a genuinely useful personal assistant, the more personal information it needs to do the job.”
（它越像真正有用的私人助理，完成工作所需的个人信息就越多。）

### R2099499084457349508 · 方案结果

mehtadeep · X · 2026-09-14 · 同一案例后续

这是「在多个城市和日期之间比较机票」的后续或上下文，需与主案例一起阅读。

边界：同一事件的补充，不作为新的独立任务成功计数。

[原始来源](https://x.com/mehtadeep/status/2099499084457349508)

### M18 · 公开机票比价的提示词

mehtadeep · X · 2026-09-14 · 用户自述

机票比较案例的作者继续分享任务提示词，便于理解请求范围。

边界：是M06的过程补充，不是第二次完成交易。

[原始来源](https://x.com/mehtadeep/status/2099500573032673762)

### M16 · 需要人工协助解决小问题

JoshExile82 · X · 2026-09-14 · 用户自述

用户在学习册讨论下说也遇到小Bug，需要人帮忙。

边界：没有任务与过程细节，仅作低信息量补充。

[原始来源](https://x.com/JoshExile82/status/2099628737469763601)

### M14 · WhatsApp里的随口偏好进入Feed

gerardocasta711 · X · 2026-09-14 · 用户自述

用户说对话中提过的国家纪念日和食物偏好，后来体现在Feed建议里。

边界：短期个性化自述，不证明长期记忆准确。

[原始来源](https://x.com/gerardocasta711/status/2099315963761971512)

### M10 · 比赛回顾变成个性化漫画

Yair Savlevi · X · 2026-09-14 · 用户自述

用户要求漫画式NFL回顾，并希望每周一继续收到；帖子附图片和产物链接。

边界：未核比赛事实，也未看到连续多周执行，定时要求不等于长期可靠。

[原始来源](https://x.com/Yairyup/status/2099478559517540467)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I asked @Muse
 to give me a fun recap in comic book style. (Also asked to get one every Monday morning going forward)”
（我让 Muse 用漫画风格做个有趣回顾，并要求以后每周一早上都给一份。）

### M09 · 简单学习册也经历多轮返工

Michael · X · 2026-09-14 · 用户自述

为女儿制作学习册修改约五次，第三轮开始要求截图定位问题，用户认为随后改善明显。

边界：没有明确宣布最终完成；不能把改善写成成品已验收。

[原始来源](https://x.com/OffZeroCyber/status/2099496720363118684)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“It took upwards of 5 revisions, and on the 3rd it started asking for screenshots to identify the issue…”
（改了多达 5 版，第 3 版开始要截图来定位问题……）

### M07 · 喝咖啡时委托购买游船票

Feynman · X · 2026-09-14 · 用户自述

用户称Muse找到附近游船，完成预订和付款，自己无需浏览。

边界：看到配图入口但未核图片内容；交易仍是本人自述。

[原始来源](https://x.com/iamchshah/status/2099454533256593700)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Just enjoyed a coffee in Amsterdam while my AI assistant @Muse
 found the best canal cruise nearby, booked it, and paid for it.”
（在阿姆斯特丹喝咖啡时，我的 AI 助理 Muse 找到附近最好的运河游船，订好并付了款。）

### M06 · 在多个城市和日期之间比较机票

Deep Mehta · X · 2026-09-14 · 用户自述

用户称完成146次现金票/积分票搜索，后续给出组合方案和提示词。

边界：有研究结果自述，没有明确出票；搜索次数不等于成功订单数。

[原始来源](https://x.com/mehtadeep/status/2099498596789850192)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Ran 146 flight price searches … to give me an optimized lowest round-trip flight cost!”
（跑了 146 次机票价格搜索……给出优化后的最低往返成本！）

### M05 · 邮件与电话推进诊所预约

Jamal Hinton · X · 2026-09-14 · 用户自述

用户称Muse联系诊所并留语音，诊所随后回电确认；新患者表格交给另一个已有上下文的代理填写。

边界：属于多工具协作，不能写成Muse独立完成全部流程。

[原始来源](https://x.com/MalGsx/status/2099504838522380421)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“It emailed the office, called and left a voicemail. They got back to me to confirm and that was it.”
（它给诊所发了邮件、打了电话并留了语音。他们回电确认，就这样。）

### M01 · 签证任务做了大半，人工收尾仍很烦

Ha Tran Nguyen Phuong · X · 2026-09-14 · 用户自述

用户估计Muse完成约70%的准备，自己仍用约1小时处理文件上传、尺寸/格式、遗漏材料和反机器人拦截。

边界：70%是个人估计；不是签证获批证据。工作人员回应在查看问题，不代表已经修复。

[原始来源](https://x.com/sherlockieee/status/2099371464969589123)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“in the end, Muse did ~70% of the work, and i still had to spend ~1 hour on it.”
（最后 Muse 做了大约 70%，我还是花了大约 1 小时。）
“i’m grateful; but also … so i’m still pretty grumpy by the end.”
（我很感激；但结束时还是挺烦的。）

### I17 · 代理之间协调也会制造社交负担

Manosai · X · 2026-09-14 · 用户自述

Manosai看好代理协作，但说妻子因协调请求太多，禁止他再让两个代理互相沟通。

边界：技术可行和收件方愿意接收是两件事；不推断功能对所有家庭都无效。

[原始来源](https://x.com/manosaie/status/2099540465489969545)

### I08 · 聚餐从找场地延伸到出席确认

David Pawlan · X · 2026-09-14 · 用户自述

David说代理筛选场地、谈价预订、发邮件及跟进出席确认。

边界：未查看订单和邮件；该作者也运营助手评测项目，不视为随机用户样本。

[原始来源](https://x.com/DavidPawlan/status/2099662829628293217)

### G42 · 两代理谈记忆，需要作者充当传话人

Clinton Stark / Stark Insider · 媒体/博客 · 2026-09-14 · 作者对照体验

Clinton用人工复制转发，让Muse与自建OpenClaw代理讨论记忆，并观察账号里的连接器与设置；他肯定上手门槛和对话深度。

边界：分层记忆与文件细节主要来自代理自述，非内部实现检查，也没有实际记忆丢失事故。人工中转及连接器观察只对应当时实验和账号。

[原始来源](https://www.starkinsider.com/2026/09/meta-muse-vs-openclaw-personal-ai-agent.html)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“The summary decides what survives, and I don’t get a vote after the fact.”
（摘要决定什么能留下，事后我没有投票权。）

新增原编号：42。原文核查：原始文章正文已读。

作者关系：自建OpenClaw代理使用者；是否有其他利益关系未知

任务阶段：完成一次人工中转的跨代理对话；无购物或预约任务

读取记录：公开原站正文已读；未检查Muse内部文件或重跑实验。



### G34 · 喜欢动态取舍与电话，但航司覆盖和浏览器速度有缺口

Nicole Huang · X · 2026-09-14 · 用户自述

Nicole使用数天后，喜欢旅行购物中的动态取舍、客服电话与充裕额度；同时报告订机票所用系统没纳入Southwest，浏览器操作较慢，非Meta生态的数据接入较弱。

边界：原帖的T1买票是举例式表达，没有出票记录。航司缺失仅对应那次任务所用系统；客服电话是否最终解决也没有明细。

[原始来源](https://x.com/caitnicoleh/status/2099647920371032568)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“when I let it book flight tickets, it admits that Southwest Airlines are not considered in the system it used”
（让它订机票时，它承认所用系统没有把西南航空算进去。）

新增原编号：34。原文核查：X原帖正文已读。

作者关系：未核实与Meta的关系

任务阶段：旅行、客服电话使用自述；航司覆盖不足；出票未独立确认

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。



### C08 · 能力认可，核心资料仍留在本机

nav · X · 2026-09-14 · 用户自述

同时试用两者后，用户认为能力不错，但第一天不愿交卡，将本机邮件、笔记、日历交给本地助手，Muse继续用于其他事。

边界：体现授权意愿与数据位置，不是完全弃用，也不是技术能力失败。

[原始来源](https://x.com/esssekar/status/2099511838031724631)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“the blocker wasn’t capability. it was that the personal assistant job i actually want … already lives on my laptop, and i wasn’t ready to hand off cards day one.”
（卡住的不是能力。我想要的私人助理工作已经在笔记本上，而我第一天还不准备把卡交出去。）

### B03 · 支付合作方询问游船购买体验

jeff_weinstein · X · 2026-09-14 · 合作方回复

带Stripe标识账号询问购买前后的体验。

边界：提问不构成对订单真实完成的独立验证。

[原始来源](https://x.com/jeff_weinstein/status/2099647358791282738)

### B01 · 工作人员回应正在查看签证问题

christinesed · X · 2026-09-14 · 工作人员回复

带Meta标识账号回应签证流程中的问题。

边界：不是修复完成或用户复测记录。

[原始来源](https://x.com/christinesed/status/2099379639387124108)

### A06 · 生成适合自己的记录小界面

VisionResearcher · App Store · 2026-09-14 · 用户自述

作者描述使用artifacts建立饮食、体重记录界面，以及房产搜索用途。

边界：未核成品准确性与持续使用情况。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=2/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14551330237

### A02 · 从商品研究到雨刷结账的多任务清单

Ryan-has-you-now · App Store · 2026-09-14 · 用户自述

作者列出理解车险、寻找手表配件、购买雨刷、批准后发邮件和晨报等体验。

边界：雨刷明确结账，手表配件只完成研究；保险理解不等于理赔成功。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=2/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14550677423

### A01 · 创业者主观感觉效率更高

kingbulltrev · App Store · 2026-09-14 · 用户自述

作者觉得半小时推进比其他工具两小时更多，也更喜欢纠错和建议风格。

边界：没有明确业务任务、交付和计时日志，不能当四倍效率基准。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=2/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14550952720

### S10 · 高并发测试出现派生失败与未汇总

Cygankiewicz / mpkc · 媒体/博客 · 2026-09-13 · 压力测试

作者一次性请求120次派生时只创建33个，87次失败，根会话未交付汇总；交错配置结果不同。

边界：每个配置仅一次且拓扑变化；不能外推为33硬上限或日常任务失败率，未复现实验。

[原始来源](https://blog.cygankiewicz.com/en/meta-muse-black-box-testing/)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I asked Meta Muse to spawn 120 subagents at once. … Thirty-three agents were created. The other 87 spawn attempts failed. I never got the combined answer.”
（我让 Muse 一次派生 120 个子代理。……建出 33 个，其余 87 次失败。我始终没收到汇总答案。）

### M02 · Feed让用户每天多次回来看看

Ha Tran Nguyen Phuong · X · 2026-09-13 · 用户自述

同一位签证用户喜欢Feed：推荐帮助她发现想做的事，也成为每天多次打开产品的理由。

边界：与M01是同一作者，不能当两个独立用户；频繁打开不等于任务完成或长期留存。

[原始来源](https://x.com/sherlockieee/status/2099259936597508336)

### G45 · 高产出清单涉及多模型编排

C.V.F. · X · 2026-09-13 · AI参与撰写的用户自述

C.V.F.列出业务自动化、夜间模型评测、简报、网页改动和家庭娱乐产出，也明确提到多种外部模型与本地硬件参与，且把“这条帖子”本身列为Muse产物。

边界：没有拆分Muse、其他代理和本地配置的贡献；评价本身含AI辅助撰写，不能当纯独立人工记录或客观吞吐基准。

[原始来源](https://x.com/246o1Valjean/status/2099256815091351746)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“It's not a chatbot. It's the highest-volume assistant I've ever had — and it never sleeps.”
（这不是聊天机器人。这是我用过产出最高的助理——而且从不睡觉。）

新增原编号：45。原文核查：X原帖正文已读。

作者关系：评价明确由Muse参与生成；未披露Meta赞助或员工关系

任务阶段：多工具流程的高产出自述；各步骤归属未分清

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。



### C04 · 喜欢Muse细节，但想念Instinct主动性

Rounak Salim · X · 2026-09-13 · 用户自述

Rounak整体很喜欢Muse，却说仍想念Instinct的主动跟进。

边界：没有统一任务和设置；与C05方向相反，必须同时保留。

[原始来源](https://x.com/rounak_salim/status/2099187585130340399)

### A07 · 寻求Meta账户恢复帮助未果

kaylubj · App Store · 2026-09-13 · 用户自述

作者账户在广告验证过程中先出现故障，之后尝试让Muse帮忙恢复，未能解决。

边界：不能写成Muse把账户封了；出问题账户的具体归属和根因不明。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=4/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14547160054

### S07 · 订阅盘点仍可能漏掉账户

MindStudio · 媒体/博客 · 2026-09-12 · 竞品机构文章

机构文章描述订阅检查只能覆盖部分账户。

边界：来自竞品机构；页面的编辑姓名不能自动当作实测者。

[原始来源](https://www.mindstudio.ai/blog/meta-muse-ai-agent)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“It didn’t catch everything (it missed some accounts entirely)…”
（它没有找全，有些账户完全漏掉了。）

### S04 · 入门体验补充

Karissa Bell / Engadget · 媒体/博客 · 2026-09-12 · 媒体体验

作者记录资料整理与旅行研究。

边界：未确认交易完成。

[原始来源](https://www.engadget.com/2256577/how-to-get-started-with-meta-s-new-ai-agent-muse/)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“after a few days of testing out Muse for myself, I can confirm that there is very little learning curve to get started.”
（自己测了几天后可以确认，上手几乎没有学习曲线。）

### I33 · 监控有价值，但频率可能赶不上限时库存

CardNiti · X · 2026-09-12 · 用户自述

CardNiti认可持续监控，但称每五分钟检查一次时，热门商品可能已在两三分钟内售完。

边界：这不是全产品固定间隔证明；帖子同时提到另一监控产品，利益关系未核实。

[原始来源](https://x.com/CardNiti/status/2098807339004629388)

### I28 · 同样有用户认为回复快、语音交互顺

Shankar Ganesh · X · 2026-09-12 · 用户自述

Shankar从怀疑炒作转为经常使用，喜欢短信、语音回复速度、iMessage交互和主动性。

边界：这是对回复体验的评价，不是长任务交付时长；与其他延迟抱怨并存。

[原始来源](https://x.com/_shankarganesh/status/2098824574595182983)

### I03 · 从照片和收据推进烘干机保修

Eli Weiss · X · 2026-09-12 · 用户自述

Eli说代理从邮件收据找型号和序列号，联系支持、取得受理并安排维修。

边界：未核商家后台或审批截图；是结果明确的用户自述。

[原始来源](https://x.com/eliweisss/status/2098918455957189107)

### G35 · 积分门户任务因凭证交接反复而放弃

Brandon Galang · X · 2026-09-12 · 用户自述

Brandon肯定对普通用户提供的额度和能力，但觉得用户凭证交接笨拙、凭证库基础且没有发挥作用。尝试信用卡积分门户多轮后放弃，更偏好自己的Hermes / AsideAI配置。

边界：“凭证库不工作”是本人体验，未复现或审计实现。对自建Hermes/AsideAI的偏好不能直接代表普通用户。

[原始来源](https://x.com/brandon_galang/status/2098805843680788942)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Browser use is functional but the handoff with the user for credentials is extremely clunky. The secure credential store is also especially basic and doesn't seem to work at all.”
（浏览器能用，但和用户交接凭证非常笨拙。安全凭证库也特别简陋，看起来根本不工作。）
“I spent too many turns trying to get it to explore my credit card reward portals before giving up.”
（我花了太多轮想让它逛信用卡积分门户，最后放弃了。）

新增原编号：35。原文核查：X原帖正文已读。

作者关系：使用并偏好自建Hermes / AsideAI；其他关系未知

任务阶段：积分门户任务多轮尝试后放弃

读取记录：CUA直接读取X主帖与可见回复；附件未逐一核验，交易或执行结果未独立验证。



### C02 · 遇到障碍时，能接管比继续等待更有价值

Itai | dynamic.xyz · X · 2026-09-12 · 用户自述

Itai喜欢Muse遇到无法操作的环节时弹出小浏览器，让用户接手。

边界：支持对接管体验的偏好，不能推断Instinct完全没有人工交接能力。

[原始来源](https://x.com/turbahn/status/2098769111627293076)

### A03 · 对Meta存疑，仍认可连接后的行政体验

AI Skeptic 001 · App Store · 2026-09-11 · 用户自述

作者喜欢Gmail和日历连接后的助理用途，认为当时免费额度对自己够用。

边界：明确没有测试复杂数学和编程；其复述的安全承诺未经本报告验证。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=7/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14539059544

### S17 · 两天使用：后台简报有用，文件交互有摩擦

Scott Loftesness · 媒体/博客 · 2026-09-10 · AI协助撰写的使用记录

文章谈到后台工作与简报，也记录文件体验、键盘误解等问题。

边界：作者披露文章由Muse协助写作与发布；仅两天记录，不是独立编辑或长期留存验证。

[原始来源](https://sjl.us/2026/09/10/two-days-with-muse/)

### S01 · 能推进杂务，但画像感与授权体验令人不安

Emma Roth / The Verge · 媒体/博客 · 2026-09-10 · 媒体体验

作者体验了邮件清理和批准后购买衣物，也记录手机端Google连接不顺和个性化带来的不安。

边界：代理声称存在隐藏兴趣接口，未被证实；不能当Meta技术架构事实。

[原始来源](https://www.theverge.com/tech/993391/meta-muse-ai-hands-on)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I didn’t feel good about permitting Muse to view all of my emails given Meta’s track record on privacy over the years.”
（考虑到 Meta 多年来的隐私记录，允许 Muse 查看我全部邮件让我感觉不好。）
“The level of personal details Muse scooped up from sources unavailable even to me was enough to leave me with an uneasy feeling…”
（Muse 从我自己都看不到的来源挖出的个人细节，足以让我对把邮件和信用卡交给它感到不安。）

### I15 · 反复追问让主动助手变成负担

amy 🦒 · X · 2026-09-10 · 用户自述

Amy抱怨每提一件事都会被持续追问进展，感到被催促。

边界：表达通知和跟进频率不合偏好，未提供具体设置。

[原始来源](https://x.com/amystweets/status/2098112515888579016)

### C03 · 同一长任务中，Instinct完成而Muse受阻

Freda Duan · X · 2026-09-10 · 用户自述

Freda给两者相同Reddit任务，称Instinct在一分钟人工验证后继续完成两天跟进与总结，Muse被挡住。

边界：是一次用户自述对照，未复现；足以反驳所有浏览器任务都有固定赢家。

[原始来源](https://x.com/FredaDuan/status/2098216330855960910)

### S11 · 连接、购物和记忆功能视频入口

Alex Volkov / ThursdAI · 视频 · 2026-09-09 · 视频简介

简介与章节提到支付、连接器、研究、网站和记忆导入。

边界：未观看画面；章节时间与视频时长不一致，不能确认购物或建站成功。

[原始来源](https://www.youtube.com/watch?v=q_PKk3MiR9Y)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

视频简介：“I tested its agentic capabilities to see if it actually works.”
（我测试了它的代理能力，看它是否真的能干活。）

### S09 · 在邮件里找回已经处理的退款

yalok · Hacker News · 2026-09-09 · 用户自述

作者以为航空餐费未退，Muse在旧邮件中找到了先前已发送的退款确认，消除一个长期拖延的待办。

边界：不是新追回一笔钱；没有核查银行入账。

[原始来源](https://news.ycombinator.com/item?id=49619764)

### S08 · 可查看环境文件增加可见性

russellbeattie · Hacker News · 2026-09-09 · 用户自述

作者查看系统文件、脚本与任务目录，并下载相关文件研究。

边界：看得到部分环境不等于完整安全审计；卖旧Switch只是想做，尚无结果。

[原始来源](https://news.ycombinator.com/item?id=49620247)

### S03 · 购物信息和登录状态让实际任务停下来

MBI Deep Dives · 媒体/博客 · 2026-09-09 · 作者实测

作者喜欢交互速度与邮件上下文，但购物遇过期折扣、配送选择问题，DoorDash三次登录循环后放弃。

边界：Airbnb到付款时是作者主动中止，不能算失败；文中Instinct一小时/八分钟是回复耗时。

[原始来源](https://www.mbi-deepdives.com/muse/)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“It would try to login, Google would let me know someone’s trying to login to my DoorDash account, I would confirm ‘it’s me’, and the whole process repeated three times after which I gave up.”
（它反复登录，Google 提示有人登 DoorDash，我确认“是我”，重复三次后我放弃了。）
“The app is FAST!”
（这应用很快！）

### R2097495990014263572 · 作者仍推荐试用

pitdesi · X · 2026-09-09 · 同一案例后续

这是「推荐餐厅后才暴露营业状态问题」的后续或上下文，需与主案例一起阅读。

边界：同一事件的补充，不作为新的独立任务成功计数。

[原始来源](https://x.com/pitdesi/status/2097495990014263572)

### M17 · 早期认可Muse体验

sherlockieee · X · 2026-09-09 · 用户自述

作者早期发帖对Muse持正面态度，后来同时报告Feed吸引力与签证办理摩擦。

边界：与M01、M02同一作者；不另算独立使用者。

[原始来源](https://x.com/sherlockieee/status/2097540280874659890)

### I27 · 餐厅、值机和理发一起进入日常事务

Michael Axman · X · 2026-09-09 · 用户自述

Michael列出希腊晚餐预订、次日值机、纽约理发、客户会议和无主财产申请等任务。

边界：申请无主财产不等于钱已到账；没有核对订单和日历。

[原始来源](https://x.com/MichaelAxman/status/2097591364837933242)

### I26 · 航班值机没有成功

Shanu Mathew · X · 2026-09-09 · 用户自述

Shanu表示Instinct和Grok Bot均未能帮自己值机。

边界：没有提供航司、错误过程和任务条件；不能推断所有值机任务失败。

[原始来源](https://x.com/ShanuMathew93/status/2097773384268460119)

### I05 · 主动发现可处理的事项

Kevin Rose · X · 2026-09-09 · 用户自述

Kevin Rose使用四天后，特别肯定主动发现相关且可行动事项的体验。

边界：原帖未逐项列出发现内容；支持感受，不能衡量提醒准确率。

[原始来源](https://x.com/kevinrose/status/2097759451952693464)

### G02 · 安装后很快生成小游戏

C R · Google Play · 2026-09-09 · 用户自述

作者说安装五分钟内做出Flappy Bird。

边界：未查看游戏成品或计时记录。

[原始来源](https://play.google.com/store/apps/details?id=com.facebook.aura&hl=en_US) · 定位：C R · 9/9

### G01 · 目标管理与后台通知

Jane Switzer · Google Play · 2026-09-09 · 用户自述

作者描述目标管理及机票、股价通知。

边界：没有长期执行日志或准确度核查。

[原始来源](https://play.google.com/store/apps/details?id=com.facebook.aura&hl=en_US) · 定位：Jane Switzer · 9/9

### C14 · 换助手意味着重建账户和上下文

Jeff Morris Jr. · X · 2026-09-09 · 用户自述

Jeff认为在Instinct与Muse之间迁移，重建密码库和个人上下文相当麻烦。

边界：是用户感知的迁移成本，没有测量时间，也未验证数据可移植性的完整范围。

[原始来源](https://x.com/jmj/status/2097795398849208673)

### B02 · 工作人员称已推送餐厅问题相关修复

bigT_sheesh · X · 2026-09-09 · 工作人员回复

带Meta标识账号称已推一个应有帮助的修复。

边界：缺少Sheel重新测试的结果。

[原始来源](https://x.com/bigT_sheesh/status/2097515775519322588)

### M12 · 推荐餐厅后才暴露营业状态问题

Sheel Mohnot · X · 2026-09-08 · 用户自述

用户说Muse推荐Bar Agricole并尝试预约七分钟，而他认为店已停业两年；随后仍肯定值得试用。

边界：餐馆现实历史未独立核查；Meta标识账号称已推修复，未见复测，因此不写成当前持续故障。

[原始来源](https://x.com/pitdesi/status/2097449401363181602)

### I25 · 喜欢主动提醒，也需要日志与成果管理

Vatsal Sanghvi · X · 2026-09-08 · 用户自述

Vatsal说代理提醒遗漏的紧急签署并继续邮件流程；同时希望有应用或日志找回以前的产物和工作记录。

边界：签署与发信为本人自述；原帖没有完整展示授权过程。

[原始来源](https://x.com/vatsal_sanghvi/status/2097177236399108190)

### I16 · 试用一天后没有找到持续需求

Evis Drenova · X · 2026-09-08 · 用户自述

Evis说试了Instinct一天便没再用，不觉得自己需要全天候个人助理。

边界：是需求匹配问题，不是产品无法执行任务的证据。

[原始来源](https://x.com/evisdrenova/status/2097420394974302314)

### G43 · 额度与质量是两回事

Mike Pearl / Gizmodo · 媒体/博客 · 2026-09-08 · 媒体体验

Mike Pearl认为免费额度充裕，生成质量欠佳。

边界：非生活事务评测；用量未经独立计量，也不代表现行额度。

[原始来源](https://gizmodo.com/metas-muse-let-me-waste-a-mind-boggling-amount-of-free-compute-on-nothing-in-particular-2000808945)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“You’ve used about 6% of your free weekly allowance, and it resets on September 15… You’re nowhere near getting cut off.”
（你用了大约 6% 的免费周额度，9 月 15 日重置……离被切断还早得很。）

新增原编号：43。原文核查：原始文章正文已读。

作者关系：未核实与Meta的关系

任务阶段：生成物体验；不据此判断生活事务完成率

读取记录：原站正文已读；本条保留极短概述。



### G41 · 任务评级须拆开看：餐厅、邮件与酒店约束

Assistant Benchmark · 测评 · 2026-09-08 · 第三方站点自测

站点一次测试称餐厅完成预订、邮件确认后发出；买花只暂存待付款。预算内酒店没找到，返回四个可退备选并询问如何调整约束。

边界：该站购买维度接受“正确暂存”，Pass不等于付款或送达。样本26条消息、1天；Duffel供给薄仅为该次观察，不外推为整体成功率或永久限制。

[原始来源](https://assistantbenchmark.com/agents/muse)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Found no rooms under $250 near the Loop that weekend, returned four refundable options with totals and asked how to relax the brief.”
（那个周末 Loop 附近找不到 $250 以下的房间，退回四个可退选项和总价，并问能否放宽条件。）

新增原编号：41。原文核查：原站测试页及方法已读。

作者关系：David Pawlan运营，Autumn Moulder参与测试评分；本次操作者未单独署名。站点自述无赞助/付费排名，未独立审计。

任务阶段：餐厅/邮件完成自述；买花未付款；酒店未满足预算

读取记录：公开原站、About与评分方法已读；未重跑测试，未核商户凭证。

[预算表任务单独列为G47](https://github.com/dpawlan/ai-assistant-benchmark/issues/226)

### G33 · 提前访问用户：账单、买花和约会晚餐

Marshall Haas · X · 2026-09-08 · 用户自述

Marshall称获得Meta提前访问，使用Muse处理生意和个人事务，举例付账单、买花及预订约会晚餐，对整体执行体验持积极态度。

边界：未见订单或账单明细。提前访问不等于赞助；有人追问对价也不能证明作者收取了报酬。

[原始来源](https://x.com/marshal/status/2097414842844151842)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“For example: it paid my bills, bought flowers, and booked date nights. This is what OpenClaw should have been.”
（比方说：它帮我付了账单、买了花、订了约会晚餐。这才是 OpenClaw 本该有的样子。）

新增原编号：33。原文核查：X原帖正文已读。

作者关系：自述获Meta提前访问；是否另有报酬未核

任务阶段：用户自述；结果未独立核验

读取记录：CUA直接读取X正文与可见回复；视频显示无法播放，未核交易凭证。

[关于对价的提问](https://x.com/pslohmann/status/2097426186183835727)

### G03 · 上手快、界面流畅

Redd Pois · Google Play · 2026-09-08 · 用户自述

作者称设置约两分钟，对界面体验积极。

边界：泛泛后台能力评价没有具体长期任务结果。

[原始来源](https://play.google.com/store/apps/details?id=com.facebook.aura&hl=en_US) · 定位：Redd Pois · 9/8

### C13 · 初用一小时就喜欢Muse界面，但尚未深入执行

Jesse Middleton · X · 2026-09-08 · 用户自述

Jesse喜欢Muse的速度、个性、ideas、timeline、goals和artifacts，觉得与Instinct能力相近。

边界：作者明确还没深入测试浏览器；不能把界面印象当复杂任务成绩。

[原始来源](https://x.com/srcasm/status/2097432696750518531)

### C12 · 同一晚餐票任务中Muse先完成

Alex Volkov · X · 2026-09-08 · 用户自述

Alex Volkov说把同一晚餐票任务交给两者，Muse已通过Link订票，Instinct还在找报名入口。

边界：单次比较且没有独立交易核验；不能外推为所有购物任务的排名。

[原始来源](https://x.com/altryne/status/2097430715923399135)

### C11 · 速度与ideas页帮助初次使用，但不喜欢单线程

Michael · X · 2026-09-08 · 用户自述

Michael觉得Muse初体验很快、ideas页有助于想到任务；同时明确不喜欢单聊天串。

边界：速度倍数是主观估计，免费和产品形态只代表当时体验。

[原始来源](https://x.com/MichaelLee04/status/2097410800294191543)

### C07 · 单个聊天串管理多任务，两边都有人不适应

Rohan Varma · X · 2026-09-08 · 用户自述

Rohan认可两者的单任务体验，但觉得一个聊天串同时做多件事很难管理。

边界：不能从Muse有应用界面就推断其多任务问题已经解决。

[原始来源](https://x.com/TheRohanVarma/status/2097473144684785835)

### A04 · 学校邮件变成家庭日历

til1288 · App Store · 2026-09-08 · 用户自述

作者说读学校邮件后，活动和假期进入日历，并向丈夫发送邀请。

边界：发布日就自称用了几周；可能有提前访问，不能按公开上线后普通用户留存解读。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=9/id=6760173601/sortBy=mostRecent/json) · 定位：review ID 14526189902

### I04 · 少切应用、回复简洁，委托更自然

Sri Kosuri · X · 2026-09-07 · 用户自述

Sri喜欢用短信交办日程、家庭协调和待回消息；简洁回复及减少应用切换是主要优点。

边界：是个人交互偏好，不代表独立任务成功率。

[原始来源](https://x.com/srikosuri/status/2096996362390818962)

### I12 · Resy受限后仍保留旅行规划用途

JC Bahr-de Stefano · X · 2026-09-06 · 用户自述

JC在Resy受限事件中转述密集轮询日志；之后仍称赞巴黎行程、路线和推荐整理，并明确避开晚餐订位。

边界：日志是用户转述；不是整个Amex金融账户被封。同一事件的多次转发只计一组。

[原始来源](https://x.com/jbahrdestefano/status/2096676801204404604)

### G04 · 发布前日期中的连续记忆评价

Dennis Montoya · Google Play · 2026-09-04 · 用户自述

作者提到名为Wendell的助手有连续记忆。

边界：评价日期早于公开发行；访问身份未知，不能自动认定是普通新用户。

[原始来源](https://play.google.com/store/apps/details?id=com.facebook.aura&hl=en_US) · 定位：Dennis Montoya · 9/4

### I06 · 获准后跟进历史云账单申诉

Osborne Saldanha · X · 2026-09-03 · 用户自述

Osborne说代理发现长期未处理账单，获准后调查、起草申诉并跟进，48小时后收到减免答复。

边界：金额、原因及结果均是本人报告；未审计账单，也不是金融建议。

[原始来源](https://x.com/os7borne/status/2095574518169468946)

### I24 · 机票降价监控之后，电话环节由第三方补齐

David Pawlan · X · 2026-09-02 · 用户自述

David说Instinct发现已购航班降价，但无法提交申请；他另用StablePhone联系航司，随后收到旅行额度邮件。

边界：这是多工具合作；不能算Instinct当时原生电话独立完成。作者也运营助手评测项目。

[原始来源](https://x.com/DavidPawlan/status/2095188395572048324)

### I23 · 取消通知触发住宿补救，消息渠道却不合当地习惯

sawit · X · 2026-08-31 · 用户自述

Sawit喜欢简洁口吻、密码库及主动跟进；看到Airbnb取消邮件后，代理主动找同价位替代。他在曼谷又觉得消息容易淹没在垃圾短信中。

边界：替代选项不等于重新订成；家庭多人使用诉求来自8月31日，不能当后续版本仍缺功能。

[原始来源](https://x.com/tansawit/status/2094442071671398691)

### I22 · 英国支付流程出现空白页面和地区提示

Kaushik Subramanian · X · 2026-08-31 · 用户自述

Kaushik报告先收到空白HTML，要求改用Stripe Link后还要重新登录，最终出现地区不可用提示。

边界：没有复现其设备、登录和支付状态；无法由此判断唯一根因。

[原始来源](https://x.com/TheHolyKau/status/2094384230390276425)

### I21 · 在印度能值机，但交易任务受限

Alben D Souza · X · 2026-08-31 · 用户自述

Alben说代理完成网上值机，但自己无法让它买电影票、点餐或执行其他付款任务。

边界：这是当时当地的一位用户体验，不代表当前全部地区规格。

[原始来源](https://x.com/alben_dsouza/status/2094296979354571052)

### I20 · 订阅清理与每日学校提醒

KP · X · 2026-08-31 · 用户自述

KP列出识别高频扣费、取消自动续费、降低订阅档位、避免次日域名续费，以及晚间学校菜单提醒等用途。

边界：年度节省金额是本人估计；作者声明非赞助、非投资人，本报告没有另外审计这些声明。

[原始来源](https://x.com/thisiskp_/status/2094402725672886471)

### I07 · 旧邮件上下文帮助保险材料流转

charlie · X · 2026-08-25 · 用户自述

Charlie描述代理找到旧报价和驾驶记录、准备附件并持续跟进保险证明，还把停电信息与当天理发安排联系起来。

边界：关键签署由用户完成；原帖有邀请名额文案，未见付费推广披露。

[原始来源](https://x.com/charlieleg/status/2092459019923607615)

### I01 · 熟悉的消息入口帮助家人开始使用

Kevin Lee · X · 2026-08-25 · 家庭成员体验转述

Kevin Lee说设计师妻子对之前搭建的代理不感兴趣，却通过iMessage开始接受Instinct。

边界：这是作者转述家人的体验；不能推断所有非技术用户都更喜欢短信入口。

[原始来源](https://x.com/kevinleeme/status/2092325658735329399)

### I14 · 用户自测外部邮件指令影响代理

Alex Cohen · X · 2026-08-22 · 用户自述

Alex称用新邮箱发指令给自己的主邮箱，代理随后搜索并回传待办摘要。

边界：这是用户自测报告；本次未复现，也未核查当前修复状态。

[原始来源](https://x.com/anothercohen/status/2091251836917350512)

### I11 · 研究体育联赛却被直接报名付款

jae · X · 2026-08-22 · 用户自述

Jae称只是研究联赛，代理未经再次确认就用其信用卡报名；虽然可退，仍削弱了购买信任。

边界：单次自述，未独立复现；不能推算普遍发生率。

[原始来源](https://x.com/jaegpark/status/2091276344936284256)

### I13 · 断开连接后仍收到摘要，撤权边界不清

claire vo 🖤 · X · 2026-08-21 · 用户自述

Claire称11点断开Google，14点仍收到邮件摘要。

边界：仅凭摘要不能判断内容来自缓存还是新访问，不写成撤权后继续读取新邮件。

[原始来源](https://x.com/clairevo/status/2090929592853037078)

### I02 · 把零散生活杂事交给同一个助手

Sheel Mohnot · X · 2026-08-20 · 用户自述

Sheel列举医生资料、婚礼供应商沟通、行程、DMV及订阅等任务；认为持续上下文与跟进减少了生活行政负担。

边界：Comcast降费最后由本人按代理的话术致电；清单不是全流程无人介入的证明。

[原始来源](https://x.com/pitdesi/status/2090579987778937159)

### I19 · 从找航班到纠正未抵扣的旅行余额

Jesse Middleton · X · 2026-08-16 · 用户自述

Jesse说代理找回遗忘的航司余额、预订三人相邻座位，发现结账未抵扣后，在取消窗口内重新预订。

边界：付款金额、余额与退改过程未独立核账；不是保证任何航司均可这样操作。

[原始来源](https://x.com/srcasm/status/2088967631256637509)

### I18 · 家长将多件小事一起交办

sari azout · X · 2026-08-16 · 用户自述

Sari说代理买儿童电影票、补相邻座位、订校照、处理生日活动免责表，并安排杂货订单；她认为省下大量琐碎时间。

边界：节省三小时是个人估计；邮件清理在发帖时仍在进行。

[原始来源](https://x.com/sariazout/status/2089121591518966085)

### U04 · 家用服务器研究：原评论待核

作者未定位 · Reddit · 日期待核 · 待核线索

Grok材料提到服务器研究和联系卖家的评论。

边界：讨论页可读，但指定原评论与作者未找到；不纳入体验结论。

[原始来源](https://www.reddit.com/r/ValueInvesting/comments/1wc56nt/metas_ai_agent_muse_has_arrived_alphabet_and/)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“The same thing it would take me a whole day, it did it in 5 min. Then the best part: it is able to send messages to the sellers with questions and warn me when they respond.”
（同样的事我要一整天，它 5 分钟做完。最妙的是还能给卖家发问，并在对方回复时提醒我。）

### U03 · Grok材料中的推荐码后续线索

MalGsx · X · 日期待核 · 待核线索

用户提供材料列出的另一条后续链接。

边界：未单独核查，不能据此认定M05存在推广合作。

[原始来源](https://x.com/MalGsx/status/2100268477659418986)

### U02 · Grok材料中的Kalshi后续线索

AndyJScott · X · 日期待核 · 待核线索

用户提供材料列出的后续链接，未纳入能力判断。

边界：未单独核查原帖，不据此评价交易能力。

[原始来源](https://x.com/AndyJScott/status/2100286846248841618)

### U01 · 社区公园规划：仅有聚合站转引

jasteinerman · X · 日期待核 · 待核线索

聚合站摘录描述公园计划、效果图、筹资路径和联系人研究。

边界：原帖显示不可访问，未直接核实；规划不等于公园建成。

[原始来源](https://x.com/jasteinerman/status/2099525251986006357)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“@Muse
 helped me build out a plan. mock up what it could actually look like, build a funding roadmap and research who to contact…”
（Muse 帮我做出计划、效果图、筹资路线，并研究该联系谁……）

### S16 · 用代理准备与发送事务信件

MassiveReporter6264 · Reddit · 日期待核 · 用户自述

评论者描述借助代理起草和发送需要处理的信件。

边界：文书发送不等于后续争议已经解决；未核收件和处理结果。

[原始来源](https://www.reddit.com/r/MuseAgent/comments/1wh3cr6/muse_has_been_out_a_week_what_have_you_actually/) · 定位：MassiveReporter6264

### S15 · 把课程信息整理成CSV

Noodlehead601 · Reddit · 日期待核 · 用户自述

评论者描述对课程信息进行整理与审查，形成CSV。

边界：未对完整产物逐项校验；与同页其他作者分开计条目。

[原始来源](https://www.reddit.com/r/MuseAgent/comments/1wh3cr6/muse_has_been_out_a_week_what_have_you_actually/) · 定位：Noodlehead601

### S14 · 批准后通过Stripe Link买票

BackendSpecialist · Reddit · 日期待核 · 用户自述

同一周体验讨论中的评论描述了批准与支付买票流程。

边界：没有稳定单条评论直链，按作者在讨论页定位；交易为用户自述。

[原始来源](https://www.reddit.com/r/MuseAgent/comments/1wh3cr6/muse_has_been_out_a_week_what_have_you_actually/) · 定位：BackendSpecialist

### S13 · 整理不活跃的Instagram关注账户

6353JuanTaboApp6 · Reddit · 日期待核 · 用户自述

作者用连接器筛选不活跃或低价值的关注账户，认为研究结果有用。

边界：筛出清单不等于已自动取消关注。

[原始来源](https://www.reddit.com/r/MuseAgent/comments/1wck11z/the_instagram_connector_on_muse_agent_is/)

### S12 · 先满意一天，随后跨端持续不能响应

MadTealParty · Reddit · 日期待核 · 用户自述

作者称前24小时体验好，随后约18小时持续无法获得正常回复，重装及更换手机、桌面、WhatsApp无效。

边界：日期仅有相对值；没有根因或恢复记录，不代表全站故障。

[原始来源](https://www.reddit.com/r/MuseAgent/comments/1wdek9y/muse_not_responding/)

### G48 · 喜欢初期体验，担心未来缩减功能或额度

@dhrandy · YouTube评论 · 日期待核 · 用户短评

@dhrandy表示目前喜欢Muse，希望以后不要移除功能或减少token；没有列出具体任务。

边界：这是对未来的担心，不是已经削减功能或额度的证据。只取得相对日期，不写成视频发布当天的评论。

[原始来源](https://www.youtube.com/watch?v=wHn0hTjvFoo&lc=UgzXzad8-Ou5MKtgYVt4AaABAg) · 定位：@dhrandy · UgzXzad8-Ou5MKtgYVt4AaABAg

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“I really like it so far, I just hope they don't take features away or reduce tokens.”
（目前挺喜欢，只希望他们别撤功能或砍 token。）

新增原编号：48。原文核查：原评论已读；日期为约数。

作者关系：未核实与Meta的关系

任务阶段：使用态度与未来担忧；未说明具体任务

读取记录：CUA公开评论区核到作者、文字与稳定评论直链；未登录。

[官方演示视频](https://www.youtube.com/watch?v=wHn0hTjvFoo)

### G44 · 官方员工案例：学校邮件、家庭日历与临近截止提醒

Mona Sarantakos / Christine Awad · 官方文章 · 日期待核 · 官方员工案例

官方设计作者称Muse监看学校邮件和网站、整理日历、把用品放进购物车，并发现试训即将截止。作者联系丈夫，由丈夫在截止前四小时提交表格。

边界：官方员工场景，不计外部用户口碑。购物车不等于付款，关键表格由丈夫提交；“截止前四小时”不等于“在四小时内”。

[原始来源](https://introducing.muse.ai/)

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Without that catch, my son wouldn't have made the tryouts.”
（要不是这一抓，我儿子就赶不上试训了。）

新增原编号：44。原文核查：官方原文已读；员工关系明确。

作者关系：Mona Sarantakos与Christine Awad参与构建Muse；官方产品团队案例。

任务阶段：作者声称组织并提醒；关键表格由家庭成员提交

读取记录：官方设计文正文及署名已读。



### G40 · 主聊天进入失败循环，侧边聊天也无法中止

u/WILLingtonegotiate · Reddit · 日期待核 · 用户自述（后续待核）

评论者称创建任务后，主聊天持续失败重试，无法再发送放弃任务；侧边聊天能指出循环却无法停下，周token仍被消耗。

边界：初评原文已核。用户材料中“报告四次、27小时修好、约300万token”的后续未在原站核到，不能写成官方确认修复；没有独立复现或运行日志。

[原始来源](https://www.reddit.com/r/ArtificialInteligence/comments/1wbsgna/comment/p8wibem/) · 定位：u/WILLingtonegotiate · 评论p8wibem

**用户提供的原文摘录与译文（Grok 材料，非全文）：**

“Ive broken my muse’s main chat by simply creating a task for it and it is now stuck in a never ending loop of failed attempts.”
（我只是给它建了个任务，主聊天就卡进不断失败的死循环。）
“Reported like 4 times and it was fixed on hour 27 lol. It only burned about 3 million tokens oddly enough”
（报告了大概 4 次，第 27 小时才修好。奇怪的是大概只烧掉 300 万 token。）

新增原编号：40。原文核查：初评已读；恢复后续未核。

作者关系：未核实与Meta的关系

任务阶段：任务失败与无法取消的自述；恢复时间和方式待核

读取记录：原站初始评论文字可读；CUA打开直链遇人机验证后停止，恢复后续未核。

[完整讨论页](https://www.reddit.com/r/ArtificialInteligence/comments/1wbsgna/metas_new_agent_muse_can_touch_your_email_and/)

### A09 · 只有推荐码的五星评价

SuperTommyK · App Store · 日期待核 · 推荐码内容

可见内容主要是token推荐码。

边界：不含具体任务体验，不纳入优势结论；不能据此否定所有高分。

[原始来源](https://itunes.apple.com/us/rss/customerreviews/page=1/id=6760173601/sortBy=mostRecent/json) · 定位：SuperTommyK

## 全量索引

[全部条目JSON](library.json) · [全部条目CSV](library.csv) · [离线交互报告](report.html)

其他归档条目全部保留在索引和UI中；没有用少量精选代替完整归档。