问题的开始:「那个邮件,我好像看过?」
每周会收到数十个买家询问。我们把邮件、电话号码、公司名称一个一个输入Excel。某天,一位团队成员喃喃自语:「诶?这家公司上周好像联系过?」
那是一种直觉。直觉上感觉漏掉了什么。
Before:手工验证的极限
当时我们是这样做的:
Excel → 用眼睛滚动 → 「诶?这个重复了?」→ 手动删除 → 下一行 → 重复
结果?到下周五左右,又出现重复。因为我们无法眼睛确认所有3,000行。
自动化解决方案:Claude Code验证机器人
在Windows设备上制作了一个简单的Python脚本。
# 买家数据重复验证逻辑
import pandas as pd
from difflib import SequenceMatcher
# 1. 完全重复检测
# 2. 邮件格式验证 (包含@,检查域名)
# 3. 电话号码正则表达式验证
# 4. 相似度70%以上项目标记
机器人做的工作:
• **完全重复**:相同邮件/电话出现在多行时检测
• **格式错误**:邮件无@、电话非数字等检出
• **可疑重复**:「john@company.com」和「j.john@company.com」等相似项目标示
• **自动整理**:优先保留最新输入数据(移除旧的)
After:一次发现的结果
首次执行时,结果令人震惊。
| 验证项目 | 发现数量 |
|---------|----------|
| 完全重复 | 48条 |
| 格式错误(邮件) | 23条 |
| 格式错误(电话) | 15条 |
| 可疑重复(70%+相似度) | 14条 |
| **总清理条数** | **100条** |
我们漏掉的有100条。我们还发现3周来一直在用错误的邮件发送自动回复。
实际改善效果
整理前:3,000行中有100条重复/错误数据混在一起
整理后:2,900行「可信赖的」买家数据
最大的改变是邮件送达率。之前每周平均收到15~20封「undeliverable」退信,自动化后减到3~5封。
机器人揭示的模式
分析验证结果时,发现了几个模式:
1. **时段别错误率**:夜间输入的数据错误率较高(疲劳增加)
2. **公司别格式**:特定国家的买家几乎犯相同的格式错误
3. **重复询问周期**:同一买家每隔2~3周会询问多次
根据这些信息,我们改进了输入表单,还新增了自动重复警告功能。
现在
每周一上午10时,机器人会自动执行验证。万一出现错误,会立即通知团队。手工验证时间几乎变成0。
「那个邮件,我好像看过?」这种事,现在由机器人替我们处理。